You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在PySpark中从Schema动态获取列名列表

PySpark提取DataFrame列名为列表的方法

方法一:直接用columns属性(最简便)

PySpark DataFrame自带columns属性,能直接返回所有列名的字符串列表,一行代码就能搞定:

col_names = parsed_df.columns

执行后col_names就是你需要的列名列表,直接使用即可。

方法二:基于Schema字段生成列表(对应你提供的代码优化)

你给出的遍历schema.fields的思路完全可行,我们可以用列表推导式直接生成列名列表,不用逐个打印:

col_names = [field.name for field in parsed_df.schema.fields]

如果只是需要打印列名,你的代码可以保留,加上中文注释更清晰:

# 获取DataFrame的Schema字段集合
my_list = parsed_df.schema.fields
# 遍历每个字段并打印列名
for field in my_list:
    print(field.name)

两种方法的区别

  • columns属性:直接返回列名字符串列表,代码简洁、效率高,只需要列名的话优先用这个。
  • schema.fields方式:除了列名,还能获取列的数据类型(field.dataType)、是否可为空(field.nullable)等元数据,适合需要额外Schema信息的场景。

内容的提问来源于stack exchange,提问作者Venkat

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 07:52:01