如何在PySpark中从Schema动态获取列名列表
PySpark提取DataFrame列名为列表的方法
方法一:直接用columns属性(最简便)
PySpark DataFrame自带columns属性,能直接返回所有列名的字符串列表,一行代码就能搞定:
col_names = parsed_df.columns
执行后col_names就是你需要的列名列表,直接使用即可。
方法二:基于Schema字段生成列表(对应你提供的代码优化)
你给出的遍历schema.fields的思路完全可行,我们可以用列表推导式直接生成列名列表,不用逐个打印:
col_names = [field.name for field in parsed_df.schema.fields]
如果只是需要打印列名,你的代码可以保留,加上中文注释更清晰:
# 获取DataFrame的Schema字段集合 my_list = parsed_df.schema.fields # 遍历每个字段并打印列名 for field in my_list: print(field.name)
两种方法的区别
columns属性:直接返回列名字符串列表,代码简洁、效率高,只需要列名的话优先用这个。schema.fields方式:除了列名,还能获取列的数据类型(field.dataType)、是否可为空(field.nullable)等元数据,适合需要额外Schema信息的场景。
内容的提问来源于stack exchange,提问作者Venkat
相关产品推荐
相关产品推荐

