You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

使用Azure Data Factory数据流展平JSON时遇架构推理格式错误

解决Azure Data Factory数据流JSON源预览报错问题

问题重现

从开源API复制数据到Azure Blob存储为JSON文件,数据集可正常预览,但数据流中预览源时提示:

Malformed records are detected in schema inference. Parse Mode: FAILFAST. It could be because of a wrong selection in document form to parse json file(s). Please try a different 'Document form' (Single document/Document per line/Array of documents) on the json source.

切换所有Document form选项后问题依旧。

排查解决步骤

  • 检查Blob中JSON文件的完整性
    数据集的预览逻辑相对宽松,数据流的Schema推断更严格。直接在Blob存储中打开JSON文件,确认:

    • 文件是完整的数组格式(开头[、结尾]齐全)
    • 数组内每个对象间的逗号没有多余(比如最后一个对象后不能加逗号)
    • 没有特殊字符、换行符或截断情况(比如复制活动中途中断导致文件不完整)
      可以用本地的JSON编辑器(如VS Code的JSON校验功能)检查文件格式是否完全合规。
  • 调整数据流源的Schema解析设置

    1. 打开数据流的JSON源设置,将Parse Mode从FAILFAST改为PERMISSIVE,允许跳过错误记录,先加载正常数据排查问题
    2. 关闭Allow schema drift,手动指定匹配JSON结构的Schema(如果已知数据结构),避免自动推断时出错
    3. 如果文件开头有无关内容,设置Skip line count为对应行数,跳过无效行
  • 统一压缩类型设置
    确认数据集和数据流的JSON源中,Compression Type设置一致(比如都设为None,如果文件未压缩),避免数据流因压缩识别错误导致解析失败

  • 重新生成Blob中的JSON文件
    重新运行复制活动,确保数据完整写入Blob。复制完成后,对比API返回的原始数据和Blob中的文件内容,确认没有数据丢失或格式篡改

  • 预处理修复格式问题
    如果文件存在轻微格式错误(如数组结尾多余逗号),可以在数据流中添加Derived Column转换,用字符串替换函数修复:

    replace($$root, ",]", "]")
    

    修复后再进行后续的展平操作

内容的提问来源于stack exchange,提问作者Carolina Karoullas

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.28 14:02:38