在ADF中实现Blob存储二进制文件转CSV/文本可读格式
使用Azure Data Factory (ADF) 将Blob存储中的二进制文件转换为CSV/文本格式
前置准备
- 拥有Azure Blob存储账户,待转换的二进制文件已上传至指定容器
- 已创建Azure Data Factory实例,且该实例具备Blob存储的访问权限(可通过托管标识、SAS密钥或存储账户密钥配置)
步骤1:配置输入二进制数据集
- 在ADF「数据集」界面,新建二进制格式的数据集
- 关联Blob存储连接服务,指定源二进制文件的容器、文件夹路径(支持通配符批量处理)
步骤2:根据二进制文件类型选择转换方案
场景1:Excel二进制文件(.xlsb)转CSV/文本
- 使用复制数据活动:
- 源端选择已创建的二进制数据集,在「源」选项卡中切换格式为Excel,指定目标工作表或数据范围
- 宿端创建CSV/文本格式的数据集,在「宿」选项卡中配置分隔符、编码、行尾符等参数,设置写入行为(覆盖/追加等)
场景2:自定义结构二进制文件转CSV/文本
- 使用数据流活动实现自定义解析:
- 数据流源节点选择二进制数据集,保持格式为「二进制」
- 添加「解析」或「派生列」转换,根据二进制文件的结构规则(如固定长度、特定字节分隔符)编写表达式解析出结构化字段
- 添加「宿」转换节点,关联CSV/文本格式的数据集,完成字段映射
场景3:压缩包内的二进制文件
- 先在复制数据活动的「源」选项卡中启用压缩配置,选择对应压缩格式(Zip/Gzip等)实现自动解压
- 解压后的文件再按照场景1或2的流程完成格式转换
步骤3:配置输出数据集
- 新建CSV或文本格式的数据集,指定Blob存储中用于存放输出文件的容器和路径
- 根据业务需求设置宿端写入模式:批量处理选「覆盖」,增量同步选「追加」
步骤4:构建管道并验证
- 将上述活动组合为ADF管道,设置活动间依赖关系(如需)
- 手动触发管道或配置触发器(定时/事件驱动),通过ADF监控面板查看运行状态
- 登录Blob存储账户,检查输出路径下的CSV/文本文件是否符合解析要求
注意事项
- 复杂结构的二进制文件,建议先在本地完成结构分析,再在ADF中配置对应解析逻辑
- 若Blob存储部署在虚拟网络内,需使用自托管集成运行时(IR)确保ADF能访问存储资源
- 批量转换前,先用小体积测试文件验证解析逻辑,避免大规模运行出错
内容的提问来源于stack exchange,提问作者sunitha v
相关产品推荐
相关产品推荐

