Pyspark中将DataFrame指定列的null值替换为空数组的问题求助
PySpark 数组类型列null值替换为空数组解决方案
你原有代码的逻辑是正确的,无法生效通常由以下两个原因导致:
- PySpark DataFrame为不可变对象,
withColumn方法会返回转换后的新DataFrame,不会修改原DataFrame,你需要将返回结果赋值给变量才能保存修改 - 未正确导入依赖的Spark SQL函数,或者列引用方式有误
完整实现代码
首先导入需要的工具函数:
from pyspark.sql.functions import coalesce, array, col
执行替换操作:
# 可根据需要赋值给新变量或者覆盖原有df变量 df = df.withColumn("column_1", coalesce(col("column_1"), array().cast("array<string>")))
验证替换效果
执行以下代码统计替换后column_1的null值行数,返回0即表示替换成功:
df.filter(col("column_1").isNull()).count()
内容的提问来源于stack exchange,提问作者Jojo
相关产品推荐
相关产品推荐

