You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python3读取GCS存储桶JSON文件遇JSONDecodeError求助

问题分析与解决方案

一、代码层面的直接报错原因

你打印的content是bytes类型(开头的b'就是明显标志),但你用str(content)直接转换时,Python会把整个bytes对象转成类似"b'{\r\n\t\"application\": ...'"的字符串——这个字符串开头是b,完全不是有效的JSON格式,所以json.loads解析时会在第一行第一列找不到预期的JSON起始值,直接抛出JSONDecodeError。

解决方法很简单:把bytes对象解码成UTF-8字符串,替换解析那行代码:

json_application_properties = json.loads(content.decode('utf-8'))

或者更省心的方式,如果你用的是Google Cloud Storage的Python客户端,可以直接调用blob.download_as_text()方法,直接获取字符串,省去手动解码步骤:

# 假设你已经通过GCS客户端获取到了目标blob对象
content = blob.download_as_text()
json_application_properties = json.loads(content)

二、你的JSON文件本身存在无效问题

即使解决了代码的问题,你的JSON仍不符合规范——在ingestion对象里,你重复定义了两次fileingestion_mappings键。JSON对象要求键必须唯一,重复的键会被后面的覆盖(不同解析器处理逻辑可能有差异,但严格来说这属于无效JSON)。

修正后的JSON应该把重复的键改成数组结构,比如:

{
  "application": {
    "project_id": "fiery-bay-224704"
  },
  "ingestion": {
    "fileingestion_mappings": [
      {
        "id":"small-files",
        "input_directory": "gs://small-files/*",
        "staging_directory": "gs://small-files/staging",
        "kafka_topic": "kafkatopic-small-files",
        "big_query_table_name": "bigquery-small-files"
      },
      {
        "id":"big-files",
        "input_directory": "gs://small-files/*",
        "staging_directory": "gs://small-files/staging",
        "kafka_topic": "kafkatopic-small-files",
        "big_query_table_name": "bigquery-small-files"
      }
    ]
  }
}

这样就符合JSON规范了,后续解析时你可以通过json_application_properties['ingestion']['fileingestion_mappings']获取到一个包含两个元素的列表,分别处理每个映射规则。

总结修复步骤

  • 修正bytes转字符串的方式,用decode('utf-8')或者download_as_text()获取正确的JSON字符串;
  • 修改JSON文件结构,把重复的fileingestion_mappings键改成数组形式。

内容的提问来源于stack exchange,提问作者Mahdi

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.11 08:37:42