You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python遍历嵌套字典统计关键词出现次数并更新字典

实现方案

你提供的原始字典数据存在几处Python语法错误(字典键值对间缺逗号、Plain_Text键后缺冒号和值的前引号),下面给出修正后可运行的完整实现,完全匹配你要的输出效果。

核心逻辑

  • 遍历policy层级下的所有子节点,不需要硬编码判断键是"1"还是"2",后续新增节点也能自动处理
  • 自动兼容两种文本字段名:Text和Plain_Text
  • 采用整词匹配统计关键词出现次数,避免把包含关键词子串的其他单词(如this里的is、myself里的my)误算入统计
  • 统计结果以字符串格式写入原节点,和你给出的期望格式一致

完整代码

import re
from collections import Counter

# 修正语法错误后的原始数据
data = {
    "policy": {
        "1": {"ID": "ML_0", "URL": "www.a.com", "Text": "my name is Martin and here is my code"},
        "2": {"ID": "ML_1", "URL": "www.b.com", "Plain_Text": "my name is Mikal and here is my code"}
    }
}
keywords = ['is', 'my']

for node in data["policy"].values():
    # 读取当前节点的文本内容,兼容两种文本字段名
    content = node.get("Text") if "Text" in node else node.get("Plain_Text", "")
    # 分词后统计词频,统一转小写避免大小写漏判
    word_counter = Counter(re.findall(r'\b[a-zA-Z]+\b', content.lower()))
    # 写入统计结果
    for kw in keywords:
        node[kw] = str(word_counter.get(kw, 0))

输出验证

执行上述代码后,data的内容和你期望的格式完全一致:

{
  "policy": {
    "1": {
      "ID": "ML_0",
      "URL": "www.a.com",
      "Text": "my name is Martin and here is my code",
      "is": "2",
      "my": "2"
    },
    "2": {
      "ID": "ML_1",
      "URL": "www.b.com",
      "Plain_Text": "my name is Mikal and here is my code",
      "is": "2",
      "my": "2"
    }
  }
}

可选调整

如果你不需要做整词校验,只是简单统计字符串中子串的出现次数,可以把词频统计的部分替换成直接计数:

for kw in keywords:
    node[kw] = str(content.count(kw))

这种写法更轻量,但会出现子串误判的问题,根据你的实际文本场景选择即可。

内容的提问来源于stack exchange,提问作者ZA09

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.27 11:24:41