You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Azure Data Factory中配对ADLS Gen2中对应前缀的文件

在Azure Data Factory中实现ADLS Gen2文件配对的方案

核心思路

通过ADF的元数据获取、筛选、遍历组件,先提取所有非hash_前缀的基础文件,再为每个基础文件生成对应的hash文件名,最终完成配对操作。

具体步骤

  1. 获取目标文件夹的所有文件列表

    • 添加Get Metadata活动,配置其数据集指向ADLS Gen2的目标文件夹。
    • 在活动的字段选项中勾选Child Items,获取文件夹内所有文件的名称、大小等元数据信息。
  2. 筛选出非hash前缀的基础文件

    • 添加Filter活动,输入设置为Get Metadata活动的输出(@activity('Get Metadata活动名称').output.childItems)。
    • 设置筛选条件为:@not(contains(item().name, 'hash_')),过滤出所有不带hash_前缀的基础文件(如abc_test_20170505_120101.csv)。
  3. 遍历基础文件并匹配对应hash文件

    • 添加For Each活动,输入设置为Filter活动的输出(@activity('Filter活动名称').output.value),根据需求选择并行或串行执行。
    • 在For Each内部添加以下活动:
      • 生成配对的hash文件名:添加Set Variable活动,创建字符串类型变量(如hashFileName),变量值设置为@concat('hash_', item().name),得到当前基础文件对应的hash文件名(如hash_abc_test_20170505_120101.csv)。
      • (可选)验证hash文件存在性:添加Lookup活动,配置数据集指向ADLS Gen2,文件名设为hashFileName变量,同时在设置中开启“允许空结果”,避免因文件不存在导致流水线失败。
      • 执行配对操作:根据业务需求添加对应活动(如Copy Data实现文件复制、Data Flow实现文件合并等),分别引用基础文件(item().name)和hash文件(@variables('hashFileName'))作为数据源。

注意事项

  • 确保文件名规则严格统一:基础文件和对应的hash文件仅相差前缀hash_,若存在命名不一致的情况,需调整筛选或文件名生成的表达式。
  • 处理异常场景:若部分基础文件无对应hash文件,可在Lookup后添加If Condition活动,根据结果判断是否跳过或触发告警。

内容的提问来源于stack exchange,提问作者Azzu

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.17 10:32:20