You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

导入Azure Data Factory时如何筛选CSV文件的指定源列

ADF导入CSV文件时仅导入指定列的实现方法

以下是三种常用的实现方案,你可以根据自己的业务场景选择:

方案1:复制活动列映射配置(最简便,适合纯数据同步场景)

  • 先在ADF中创建CSV源数据集,勾选第一行作为表头选项,确保ADF可以正确识别所有列的列名
  • 打开对应复制活动的源配置页签,找到「列映射/架构映射」板块,点击「重置架构」拉取CSV文件的完整300列列表
  • 直接在列表中删除不需要的270列,仅保留目标30列即可。复制任务运行时只会拉取保留的列,不会加载多余数据,对20GB的大文件也不会产生额外的资源占用

方案2:映射数据流选择转换(适合需要后续数据清洗转换的场景)

  • 在ADF中创建映射数据流,添加CSV源节点并导入完整列架构
  • 新增选择转换节点,在节点配置中手动勾选需要的30个列,也可以配置规则批量匹配目标列
  • 后续所有转换、Sink写入操作都只会处理筛选后的30个列

方案3:源端预查询(适合超大文件,性能最优)

如果你的CSV文件存放在Azure存储账户中,可以搭配Azure Synapse Serverless SQL池使用:

  • 提前为目标CSV文件创建外部表,在ADF源配置中选择查询模式
  • 编写SQL语句仅SELECT需要的30个列,计算压力下沉到Serverless SQL层,ADF侧仅接收筛选后的结果集,同步效率更高

注意:如果你的源CSV文件列顺序可能发生变动,一定要选择按列名匹配的模式,不要按列索引匹配,避免列序调整后导入错列的问题


内容的提问来源于stack exchange,提问作者Pavan Bhagavan

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.10.02 09:12:01