Spark中如何设置maxFilesPerTrigger?是否支持会话配置?
关于Spark流处理中maxFilesPerTrigger参数的配置方式
不能通过spark.conf.set(...)在创建Spark会话时全局配置maxFilesPerTrigger参数,这个参数仅能在readStream的数据源选项中设置。
Spark的maxFilesPerTrigger属于文件流数据源的特定配置项,而非Spark全局核心配置参数,这类参数需要绑定到具体的流读取操作上,无法通过全局会话配置生效。
正确的设置方式示例:
spark.readStream .format("csv") .option("maxFilesPerTrigger", 5) // 每个触发器最多处理5个文件 .load("/path/to/source")
如果尝试用spark.conf.set("spark.sql.streaming.maxFilesPerTrigger", 5)这类全局设置,是不会生效的,因为Spark并没有提供对应的全局配置键。
内容的提问来源于stack exchange,提问作者Geosphere
相关产品推荐
相关产品推荐

