You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

分词处理推特JSON文件时遭遇KeyError: 'text'问题求助

解决KeyError: "text"的问题

嘿,这问题我之前也碰到过!你代码里的问题出在对JSON结构的理解上——你直接从加载后的整个JSON对象里取text,但看你给出的示例,text其实藏在statuses数组的每一个元素里面,根本不是顶级键,难怪会报错。

为啥会报错?

你的JSON结构简化后是这样的:

{"statuses": [{"text": "你的推文内容...", ...}, ...]}

当你用json.loads(line)加载每一行时,得到的是包含statuses的整个大对象,不是单条推文。你直接访问tweet['text'],自然找不到这个键,就抛出KeyError了。

修复后的代码

你得先拿到statuses数组,再遍历里面的每一条推文,才能提取到text。这里给你调整好的代码:

import json

def preprocess(text):
    # 这里放你的分词预处理逻辑,比如分词、去停用词之类的
    return text.split()

with open('volby2018_1.json', 'r') as f:
    # 注意:如果你的整个文件是一个完整的JSON对象(不是每行一条独立JSON),直接加载整个文件就行
    data = json.load(f)
    # 遍历statuses数组里的每一条推文
    for tweet in data['statuses']:
        # 提取推文的text字段
        tweet_content = tweet['text']
        tokens = preprocess(tweet_content)
        # 这里可以添加你对tokens的后续处理,比如打印、保存到文件等
        print(tokens)

额外小提示

  • 如果你的文件是JSON Lines格式(每行一个独立的JSON对象),那要确认每行的结构:如果每行还是包含statuses的对象,那还是要先取statuses再遍历;如果每行直接是单条推文,那可以直接取tweet['text']。
  • 为了避免某些特殊推文没有text字段导致报错,你可以用字典的get方法:tweet.get('text', ''),这样就算没有text键,也会返回空字符串,程序不会崩溃。

内容的提问来源于stack exchange,提问作者Tereza

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 08:20:18