You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Python调用wikipedia库清洗文本、统计词频并输出Top10高频词

实现代码及说明

对应需求分三步实现:

  • 文本清洗:统一转小写消除大小写差异,通过正则移除所有非字母的无效符号、特殊标记、数字,拆分得到纯单词列表
  • 词频统计:使用Python标准库collections.Counter完成计数,无需安装第三方包
  • 排序输出:调用Counter内置的most_common()方法直接得到降序排列的词频结果,截取前10项输出

完整可运行代码:

import re
import wikipedia
from collections import Counter

# 拉取英文bitcoin词条内容
wikipedia.set_lang("en")
bitcoin_page = wikipedia.page("bitcoin")
raw_text = bitcoin_page.content

# 1. 清洗无效无用符号
text_lower = raw_text.lower()
# 正则匹配所有非小写字母、非空白字符的内容,全部替换为空格
cleaned_text = re.sub(r'[^a-z\s]', ' ', text_lower)
# 拆分单词,过滤空值
words = [w for w in cleaned_text.split() if w]

# 2. 统计单词出现次数
word_counter = Counter(words)

# 3. 取词频最高的前10个结果
top_10 = word_counter.most_common(10)

# 打印结果
print("bitcoin词条词频Top10:")
for idx, (word, cnt) in enumerate(top_10, 1):
    print(f"{idx}. {word}: {cnt}次")

说明:当前实现未过滤the、of、and这类无实际语义的停用词,如果需要得到更有实际意义的高频关键词,可以在单词列表生成后增加停用词过滤逻辑。

内容的提问来源于stack exchange,提问作者UwU Tails UwU

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.28 18:18:41