Data Factory中生成TSV文件输出至BLOB的所需配置咨询
Azure Data Factory SQL到Blob存储TSV格式传输配置步骤
1. 前置资源准备
- 提前配置SQL数据源的访问权限:将Data Factory的托管身份/出口IP添加到SQL防火墙白名单,授予对应库表的查询权限
- 提前创建目标Blob存储容器,为Data Factory分配该容器的存储Blob数据参与者权限
2. 数据集配置
2.1 SQL源数据集
- 选择和你的SQL数据源对应的数据集类型(Azure SQL Database、本地SQL Server、AWS RDS for SQL等)
- 关联提前创建的SQL链接服务,可直接选择要同步的表/视图,也可填写自定义查询语句过滤数据:
SELECT 字段1,字段2 FROM 目标表 WHERE 过滤条件
2.2 Blob目标数据集
- 数据集类型选择Azure Blob Storage下的
DelimitedText(分隔符文本)格式 - 关联提前创建的Blob存储链接服务,配置输出路径:
目标容器名/自定义输出目录/ - 格式配置必须按以下要求设置:
- 列分隔符选择制表符(\t)
- 行分隔符默认用
\n即可,可按需调整 - 按需开启「首行作为列名」开关
- 编码默认选UTF-8,有特殊业务要求可自行调整
3. 复制活动配置
- 在管道中添加复制数据活动,源端关联上述SQL源数据集
- 大表同步可开启并行查询功能,配置分区字段提升同步效率
- 接收器端关联上述Blob目标数据集
- 可选配置:需要拆分多文件输出时,可设置「每写入N行拆分一个文件」,默认输出单文件
- 再次检查格式配置,确认列分隔符为制表符,避免配置错误
- 若存在字段映射不匹配、类型转换需求,可在活动的「映射」标签页手动调整字段对应关系
注意:如果SQL查询结果中本身包含制表符,建议提前在查询中做转义处理,避免输出TSV出现字段错位问题
4. 验证流程
- 调试运行管道,运行完成后进入目标Blob路径下载输出文件
- 验证字段分隔是否符合TSV要求、数据内容是否完整、编码是否符合预期
- 如存在乱码、分隔错误问题,回头检查目标数据集的格式配置项
内容的提问来源于stack exchange,提问作者SUCHENDRA REDDY
相关产品推荐
相关产品推荐

