Azure Data Factory中合并不同Schema CSV文件实现维度关联全指标输出咨询
Azure Data Factory 同维度跨CSV指标合并方案
你之前得到两行结果的核心原因是误用了行拼接逻辑,你需要的是按共同维度做列拼接,用Join转换即可实现需求,具体操作步骤如下:
步骤1:配置两个数据源
- 在数据流中分别添加CSV1、CSV2两个源组件,提前校验两个源的5个维度字段的名称、数据类型完全一致,避免关联匹配失败。
步骤2:添加Join转换
- 拖入
Join组件,两个输入分别连接CSV1和CSV2的输出 - Join类型按需选择:如果需要保留同时存在于两个CSV的维度选内连接(Inner Join),需要保留仅存在于单个CSV的维度可对应选左连接/右连接/全外连接
- 关联条件设置为两个源的5个维度字段逐一相等,例如
CSV1.维度1 == CSV2.维度1,直到5个维度全部完成匹配配置
步骤3:添加Select转换整理字段
- 拖入
Select组件连接Join的输出 - 按以下规则保留字段即可:
- 保留任意一个源的5个维度字段(两个源的维度值完全一致,选任意一方即可,避免重复输出)
- 保留CSV1的全部10个x指标字段(x1~x10)
- 保留CSV2的全部10个y指标字段(y1~y10)
- 删除重复的另一组维度字段
步骤4:输出结果
- 连接Select输出到Sink组件,配置为CSV格式输出即可得到单条数据包含5个维度+全部20个指标的结果。
注意:如果单个CSV中同一个维度值对应多条数据,Join后会出现数据膨胀,建议Join前先对两个CSV按维度字段做聚合去重,确保每个维度值在两个源中都只有唯一一行数据。
内容的提问来源于stack exchange,提问作者sac
相关产品推荐
相关产品推荐

