Python调用wikipedia库清洗文本、统计词频并输出Top10高频词
实现代码及说明
对应需求分三步实现:
- 文本清洗:统一转小写消除大小写差异,通过正则移除所有非字母的无效符号、特殊标记、数字,拆分得到纯单词列表
- 词频统计:使用Python标准库
collections.Counter完成计数,无需安装第三方包 - 排序输出:调用Counter内置的
most_common()方法直接得到降序排列的词频结果,截取前10项输出
完整可运行代码:
import re import wikipedia from collections import Counter # 拉取英文bitcoin词条内容 wikipedia.set_lang("en") bitcoin_page = wikipedia.page("bitcoin") raw_text = bitcoin_page.content # 1. 清洗无效无用符号 text_lower = raw_text.lower() # 正则匹配所有非小写字母、非空白字符的内容,全部替换为空格 cleaned_text = re.sub(r'[^a-z\s]', ' ', text_lower) # 拆分单词,过滤空值 words = [w for w in cleaned_text.split() if w] # 2. 统计单词出现次数 word_counter = Counter(words) # 3. 取词频最高的前10个结果 top_10 = word_counter.most_common(10) # 打印结果 print("bitcoin词条词频Top10:") for idx, (word, cnt) in enumerate(top_10, 1): print(f"{idx}. {word}: {cnt}次")
说明:当前实现未过滤the、of、and这类无实际语义的停用词,如果需要得到更有实际意义的高频关键词,可以在单词列表生成后增加停用词过滤逻辑。
内容的提问来源于stack exchange,提问作者UwU Tails UwU
相关产品推荐
相关产品推荐

