You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Azure Databricks中打印读取CSV文件的所有配置项

打印Azure Databricks流读取配置项的方法

针对你在流读取(spark.readStream)中设置的配置项,有两种实用方式可以查看最终生效的所有配置:

1. 使用explain()方法查看详细配置

在source_query定义完成后调用explain(True),会输出包含所有配置的执行计划详情,从中可以找到你设置的所有option参数:

source_query = (
    spark.readStream
    .format("cloudFiles")
    .option("cloudFiles.format", "csv")   
    .option("cloudFiles.includeExistingFiles", True) 
    .option("mode","FAILFAST") 
    .option("cloudFiles.allowOverwrites", True) 
    .option("enforceSchema", "false") 
    .option("ignoreMissingFiles", True) 
    .option("cloudFiles.schemaLocation", checkpoint_path)
    .option("rescuedDataColumn","ctl_rescued_data") # Rescued data
    .option("skipRows", 0)
    .option("header", True) 
    .option("recursiveFileLookup", True)
)

# 打印包含配置的详细执行计划
source_query.explain(True)

执行后,在输出的Extended Logical Plan或Physical Plan板块,能看到所有已生效的配置参数,包括被覆盖后的最终值。

2. 提取DataStreamReader的配置属性

spark.readStream返回的是DataStreamReader对象,你可以通过访问其内部关联的Java对象来获取配置。不过这依赖Spark内部API,不同版本可能存在差异:

# 直接获取所有配置键值对
print(source_query._jreader.options())

这个方法会返回一个字典,直观展示每个配置的最终生效值。

注意:第二种方法依赖Spark私有API(_jreader),版本更新可能导致兼容性问题,优先推荐使用explain()方法。

内容的提问来源于stack exchange,提问作者Mohammad

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.02 00:49:57