在哪里查看pyspark.sql.DataFrameReader.options()方法参数详情?
DataFrameReader.option()支持选项的查找路径 DataFrameReader.option()本身只是通用的键值对透传入口,不会维护固定的参数集合,不存在脱离具体数据源的统一全量选项列表,所有可配置的选项键由你实际读取的数据源类型决定,按以下方式查找即可:
- 读取Spark内置支持的通用数据源(CSV、JSON、Parquet、ORC、JDBC等)时,直接查官方文档Data Sources章节下对应数据源的说明小节,每个小节会完整列清该格式支持的所有读写参数、取值规则和默认值,比如CSV的
header/delimiter、JDBC连接的url/dbtable/fetchsize这类常用参数都能在对应位置找到。 - 读取第三方数据源(比如对接Kafka、Iceberg、Hudi、Delta Lake这类外部组件的连接器)时,直接查对应连接器官方发布的Spark集成说明文档,里面会列全该连接器支持的所有配置项、适用版本和使用注意事项。
- 本地写代码调试的时候,也可以直接在PySpark交互环境里看对应读取方法的内置帮助,比如要查CSV读取支持的参数,执行
help(spark.read.csv)就能看到输出的参数说明;想拿最准确的信息也可以直接翻对应数据源读取实现的源码注释。
提醒:
option()方法本身不会校验你传的参数键合不合法,当前数据源识别不了的参数要么被静默忽略,要么会触发底层数据源抛运行时错误,不用浪费时间找覆盖所有数据源的通用参数清单。
内容的提问来源于stack exchange,提问作者Rinze
相关产品推荐
相关产品推荐

