You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

ADF数据流是否会多次读取源数据?分支场景与中间存储疑问

ADF数据流分支读取与中间结果相关问题解答

关于分支过滤是否重复读取源数据

当你从CosmosDB等数据源读取数据后,通过分支操作生成两个数据集并分别应用过滤条件时,ADF数据流只会读取源数据一次。

ADF基于Spark运行,Spark的惰性执行机制会对整个数据流的执行计划做优化:它会识别出两个分支来自同一个数据源节点,因此会将读取操作合并为一次,把读取到的数据暂存在Spark集群的内存或本地存储中,再分发给两个分支执行过滤逻辑,不需要重复从源数据源拉取数据。你的担心其实多余,Spark的执行计划优化会自动处理这种场景,不需要额外手动将数据存储到集群。

关于中间转换结果的保存

ADF数据流不会自动保存中间转换的结果。所有中间转换步骤都是在Spark作业运行过程中临时处理的,数据仅在作业执行期间存在于集群的内存或临时存储中,作业完成后这些临时数据会被自动清理。

如果需要保留中间转换的结果,你必须手动在数据流中添加一个输出接收器(比如将数据写入Blob Storage、CosmosDB或其他存储服务),主动将中间数据持久化下来。

内容的提问来源于stack exchange,提问作者DxG

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 15:54:50