如何在PySpark中将字典列表字符串转为Struct类型列?
将字符串格式的字典列表转换为Struct类型列(PySpark实现)
你的views列是类JSON但非标准的字符串格式,核心问题在于它的键没有引号、用=替代了JSON的:,需要先将其转换为合法JSON,再解析为Struct数组类型。以下是具体实现步骤:
1. 预处理字符串为合法JSON
通过正则表达式批量替换格式问题,把原字符串转换成标准JSON结构:
- 给所有键(如
name、id)添加双引号 - 将
=替换为JSON的键值分隔符:
2. 定义Struct Schema
根据你的数据结构,定义包含name和id字段的Struct类型,再包裹成数组类型。
3. 使用from_json解析为Struct数组
利用Spark的from_json函数,将预处理后的JSON字符串解析为指定的Struct数组类型。
完整代码示例
from pyspark.sql import SparkSession from pyspark.sql.types import StructType, StructField, StringType, ArrayType from pyspark.sql.functions import regexp_replace, from_json # 初始化Spark会话 spark = SparkSession.builder.appName("StringToStruct").getOrCreate() # 创建测试数据 data = [ (1, "[{name=view1, id=0123-abc-4567}, {name=view2, id=9876-xyz-5432}]"), (2, "[{name=view3, id=4589-adc-5467}, {name=view4, id=4476-add-5434}]"), (3, "[{name=view5, id=6987-fha-4997}, {name=view6, id=9161-asd-1199}]"), (4, "[{name=view7, id=0653-trt-4117}, {name=view8, id=9754-gfz-1222}]") ] df = spark.createDataFrame(data, ["id", "views"]) # 预处理:转换为合法JSON字符串 df_clean = df.withColumn( "views_json", regexp_replace("views", r"([a-zA-Z0-9_]+)=", r'"\1":') ) # 定义Struct数组Schema view_schema = ArrayType( StructType([ StructField("name", StringType(), nullable=True), StructField("id", StringType(), nullable=True) ]) ) # 解析为Struct数组列 df_result = df_clean.withColumn("views_struct", from_json("views_json", view_schema)) # 查看结果 df_result.select("id", "views_struct").show(truncate=False) df_result.printSchema()
结果说明
最终views_struct列的Schema为:
root |-- id: long (nullable = true) |-- views: string (nullable = true) |-- views_json: string (nullable = true) |-- views_struct: array (nullable = true) | |-- element: struct (containsNull = true) | | |-- name: string (nullable = true) | | |-- id: string (nullable = true)
如果你的views字符串包含其他特殊字符或更多字段,只需调整正则表达式和StructSchema即可适配。
内容的提问来源于stack exchange,提问作者Marcos Dias
相关产品推荐
相关产品推荐

