为何Apache Spark map()报‘Column is not iterable’错误?如何修复?
问题原因与修复方案
错误原因
Spark 3.x及后续版本对map函数的参数格式做了严格规范:它要求传入成对的键-值列(即键1、值1、键2、值2……的顺序)。你直接传入两个Column时,Spark会尝试迭代第一个Column,因此抛出TypeError: Column is not iterable错误。旧版本Spark可能允许这种写法,但新版本已不再兼容。
修复后的代码
根据你的需求,分两种场景调整:
场景1:生成固定键为"WHITE METAL LANTERN"的Map列
如果你想创建以固定字符串为键、InvoiceNo为值的Map,需要用lit()把固定键转为列类型:
df.select(map(lit("WHITE METAL LANTERN"), col("InvoiceNo")).alias("complex_map"))\ .selectExpr("complex_map['WHITE METAL LANTERN']").show(2)
场景2:用每行的Description值作为键生成Map
如果要让每行的Map以该行Description的值为键、InvoiceNo为对应值,可保留原map参数,但改用getItem方法获取指定键值(或直接查看整个Map列):
# 方式1:用getItem方法获取指定键 df.select(map(col("Description"), col("InvoiceNo")).alias("complex_map"))\ .select(col("complex_map").getItem("WHITE METAL LANTERN")).show(2) # 方式2:先查看整个Map列确认结构 df.select(map(col("Description"), col("InvoiceNo")).alias("complex_map")).show(2)
额外提示
如果要生成包含多组键值对的Map,需按map(键1, 值1, 键2, 值2, 键3, 值3)的格式传入参数。
内容的提问来源于stack exchange,提问作者Brian Clements
相关产品推荐
相关产品推荐

