You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Informatica Cloud平台:如何从平面文件提取JSON数据并生成JSON文件?

解决方案:提取平面文件中的JSON字段并保存为JSON文件

问题核心

你的TXT文件里Field1字段是带双引号转义的非标准JSON内容(以""替代"),且与Field2通过空白分隔。直接用Hierarchy Parser失效,是因为工具无法识别转义后的非标准JSON格式,得先处理格式问题再提取。

可行工具与操作步骤

1. Python脚本(灵活可控)

无需依赖特定ETL组件,直接编写脚本处理:

  • 读取TXT文件并跳过表头行
  • 按空白分割每行内容,提取第一部分(Field1的内容)
  • 将转义双引号""替换为正常双引号",还原成标准JSON
  • 把处理后的内容写入JSON文件

示例代码:

# 读取输入文件
with open('input.txt', 'r', encoding='utf-8') as f:
    lines = f.readlines()

# 处理数据行(跳过表头)
for line in lines[1:]:
    # 分割字段,取Field1内容
    field1_content = line.split(maxsplit=1)[0]
    # 修复JSON格式
    valid_json = field1_content.replace('""', '"')
    # 写入输出JSON文件
    with open('output.json', 'w', encoding='utf-8') as out_f:
        out_f.write(valid_json)

2. ETL工具(以Pentaho Kettle为例)

如果习惯可视化ETL流程,调整步骤如下:

  • 文本文件输入:读取TXT文件,设置分隔符为「多个空白字符」,将内容拆分为Field1和Field2两个字段
  • 字符串替换组件:对Field1字段执行替换,把""替换为"
  • JSON输出组件:将修复后的Field1字段直接写入JSON文件
  • 注意:不要直接用Hierarchy Parser,必须先修复JSON格式,工具才能识别结构

3. 命令行工具组合(适合批量快速处理)

用awk和sed组合处理:

# 跳过表头,提取Field1,修复格式后写入JSON文件
awk 'NR>1 {print $1}' input.txt | sed 's/""/"/g' > output.json

Hierarchy Parser失效原因

Hierarchy Parser仅能解析标准格式的JSON/XML,而你的Field1是带转义的非标准字符串,必须先替换转义引号、转换成合法JSON后,工具才能识别并解析结构。

内容的提问来源于stack exchange,提问作者Bratty Neal

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.27 09:33:16