You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Azure Data Flow如何处理大CSV输出并自定义分块文件名?

实现无列键分区的自定义文件名输出

可以实现,以下是两种可行方案:

方案一:用Surrogate Key生成分区标识

  • 在数据流源节点后添加Surrogate Key转换,生成自增整数列(例如命名为seq_id)。
  • 新增派生列转换,通过floor(seq_id / 分区数量)生成分组列(比如要生成10个文件就除以10,列名设为group_key)。
  • 在Sink的分区设置中选择Column,指定group_key作为分区列。
  • 进入Sink的Settings面板,开启Output to single file per partition,文件名填写part@{_partition}.csv,最终会生成part1.csv、part2.csv这类命名的文件。

方案二:按行数分区直接生成自定义文件名

  • 在Sink的分区设置中选择Number of rows,根据10GB数据的行大小预估合适的单文件行数,以此控制生成的文件数量。
  • 同样在Sink的Settings里开启Output to single file per partition,文件名设置为part@{_partition}.csv,无需额外数据转换即可生成带序号的自定义命名文件。

注意事项

  • 两种方案都不依赖原始数据中的列作为分区键,完全通过数据流内置规则实现需求。
  • 按行数分区时,需根据数据平均行大小合理设置数值,避免生成的文件过大或过小。
  • 确保Blob存储目标容器拥有足够的写入权限,避免因权限问题导致写入失败。

内容的提问来源于stack exchange,提问作者AzSurya Teja

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.16 15:14:53