Spark Scala:调整数组结构体列元素顺序并新增元素
解决方案
错误原因
你代码中的问题有两点:
- 用字符串
'NULL'表示空值,这会生成值为"NULL"的字符串而非SQL标准的NULL空值,同时Spark对struct内的此类表达式有解析限制,触发报错。 - 重复定义了字段名
elem2,违反结构体字段名唯一的要求。
修正后的代码
假设你需要在x.elem2后新增一个名为elem_new的NULL值字段,同时按目标schema2的顺序排列结构体元素,代码如下:
df.withColumn("sample", expr("transform(sample, x -> struct(x.elem1, x.elem2, null as elem_new, x.elem3, x.elem4, x.elem5, x.elem6, x.elem7))"))
关键说明
- 用无引号的
null表示SQL空值,替代带引号的字符串'NULL'。 - 新增字段时指定唯一的字段名(将示例中的
elem_new替换为你需要的字段名)。 - 按schema2的顺序,在
struct()内依次排列原有字段和新增的NULL字段,即可完成元素排序与空值补全。
内容的提问来源于stack exchange,提问作者stdinstoud
相关产品推荐
相关产品推荐

