Python遍历嵌套字典统计关键词出现次数并更新字典
实现方案
你提供的原始字典数据存在几处Python语法错误(字典键值对间缺逗号、Plain_Text键后缺冒号和值的前引号),下面给出修正后可运行的完整实现,完全匹配你要的输出效果。
核心逻辑
- 遍历
policy层级下的所有子节点,不需要硬编码判断键是"1"还是"2",后续新增节点也能自动处理 - 自动兼容两种文本字段名:
Text和Plain_Text - 采用整词匹配统计关键词出现次数,避免把包含关键词子串的其他单词(如
this里的is、myself里的my)误算入统计 - 统计结果以字符串格式写入原节点,和你给出的期望格式一致
完整代码
import re from collections import Counter # 修正语法错误后的原始数据 data = { "policy": { "1": {"ID": "ML_0", "URL": "www.a.com", "Text": "my name is Martin and here is my code"}, "2": {"ID": "ML_1", "URL": "www.b.com", "Plain_Text": "my name is Mikal and here is my code"} } } keywords = ['is', 'my'] for node in data["policy"].values(): # 读取当前节点的文本内容,兼容两种文本字段名 content = node.get("Text") if "Text" in node else node.get("Plain_Text", "") # 分词后统计词频,统一转小写避免大小写漏判 word_counter = Counter(re.findall(r'\b[a-zA-Z]+\b', content.lower())) # 写入统计结果 for kw in keywords: node[kw] = str(word_counter.get(kw, 0))
输出验证
执行上述代码后,data的内容和你期望的格式完全一致:
{ "policy": { "1": { "ID": "ML_0", "URL": "www.a.com", "Text": "my name is Martin and here is my code", "is": "2", "my": "2" }, "2": { "ID": "ML_1", "URL": "www.b.com", "Plain_Text": "my name is Mikal and here is my code", "is": "2", "my": "2" } } }
可选调整
如果你不需要做整词校验,只是简单统计字符串中子串的出现次数,可以把词频统计的部分替换成直接计数:
for kw in keywords: node[kw] = str(content.count(kw))
这种写法更轻量,但会出现子串误判的问题,根据你的实际文本场景选择即可。
内容的提问来源于stack exchange,提问作者ZA09
相关产品推荐
相关产品推荐

