You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何统计Pandas DataFrame中指定词列表(含同义词)的出现次数?

嘿,这个需求我之前也碰到过,刚好可以给你分享个高效的解法——毕竟150万行的数据,得兼顾速度和准确性对吧?

首先,我们得先把同义词分组整理清楚,比如把word2和wordtwo归为一组,用字典定义这种映射关系会很灵活,后面要加新的词组直接改字典就行。

接下来核心思路是利用Pandas的矢量化字符串操作,避免逐行循环(不然150万行真的会很慢)。具体步骤如下:

步骤1:定义关键词分组

先把要统计的词和对应的同义词组整理成字典,键是你最终想要显示的组名,值是该组包含的所有关键词:

import pandas as pd

# 假设你的DataFrame已经加载完成
# df = pd.read_csv("your_dataset.csv")

# 自定义关键词分组
keyword_groups = {
    "word1": ["word1"],
    "word2/wordtwo": ["word2", "wordtwo"],
    # 你可以继续添加更多分组,比如:
    "python/py": ["python", "py"]
}

步骤2:批量统计每组的出现次数

遍历这个分组字典,用正则表达式把每组的关键词拼接起来,然后用str.contains匹配任意一个关键词,最后统计匹配成功的行数:

result = {}
for group_name, keywords in keyword_groups.items():
    # 把关键词用|拼接成正则模式,实现"任意匹配"
    regex_pattern = "|".join(keywords)
    # 统计匹配次数:case=False忽略大小写,na=False把空值视为不匹配
    match_count = df["Content"].str.contains(regex_pattern, case=False, na=False).sum()
    result[group_name] = match_count

# 转成Series格式,输出更美观
result_series = pd.Series(result)
print(result_series)

可选优化:精确匹配完整单词

如果你需要的是完整单词匹配(比如不想把"word20"误判成"word2"),可以给每个关键词加上正则的单词边界\b,修改拼接正则的代码:

regex_pattern = "|".join([rf"\b{kw}\b" for kw in keywords])

输出示例

运行后你会得到类似这样的结果:

word1             40
word2/wordtwo    120
python/py         67
dtype: int64

这种方法用的是Pandas原生的矢量化操作,处理150万行数据完全没问题,速度比循环快很多,而且代码也容易维护~

内容的提问来源于stack exchange,提问作者dnclem

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.27 03:25:22