如何在Python中生成保留标点符号的词云?
解决WordCloud移除标点(冒号等)的问题
问题出在WordCloud的默认分词规则上:它默认使用正则表达式 r"\w[\w']+" 提取词汇,这个规则仅保留字母、数字、下划线和单引号,因此冒号、连字符这类标点会被过滤。要让CSV中的完整条目(比如NumVeh:SV、Driver_age:25-44)原样呈现,可通过以下两种方式解决:
方法1:修改WordCloud的regexp参数
指定匹配所有非空白字符序列的正则表达式,让每一行的完整内容被当作独立词汇。
修改后的完整代码:
import pandas as pd import matplotlib.pyplot as plt from wordcloud import WordCloud, STOPWORDS # 读取CSV文件(替换为你的文件路径) df1 = pd.read_csv("your_file.csv") comment_words = '' stopwords = set(STOPWORDS) # 遍历内容,直接拼接每个条目(无需split,因为单条目无空格) for val in df1.CONTENT3: val = str(val).lower() comment_words += val + " " # 设置regexp参数为r"\S+",匹配所有非空白字符序列 wordcloud = WordCloud(width = 2000, height = 2000, random_state=1, background_color='white', colormap='Set2', collocations=True, stopwords = stopwords, min_font_size = 10, regexp=r"\S+").generate(comment_words) # 绘制词云 plt.figure(figsize = (8, 8), facecolor = None) plt.imshow(wordcloud) plt.axis("off") plt.tight_layout(pad = 0) plt.show()
方法2:手动统计词频,使用generate_from_frequencies
这种方式完全规避WordCloud的自动分词逻辑,直接控制每个词汇的出现次数,灵活性更高:
import pandas as pd import matplotlib.pyplot as plt from wordcloud import WordCloud, STOPWORDS from collections import Counter # 读取CSV文件(替换为你的文件路径) df1 = pd.read_csv("your_file.csv") # 转换为小写并统计每个条目的出现次数 word_counts = Counter(df1.CONTENT3.str.lower()) # 基于词频生成词云 wordcloud = WordCloud(width = 2000, height = 2000, random_state=1, background_color='white', colormap='Set2', stopwords = stopwords, min_font_size = 10).generate_from_frequencies(word_counts) # 绘制词云 plt.figure(figsize = (8, 8), facecolor = None) plt.imshow(wordcloud) plt.axis("off") plt.tight_layout(pad = 0) plt.show()
两种方法均可保留CSV中的所有标点符号,让NumVeh:SV、Driver_age:25-44这类完整条目原样出现在词云中。
内容的提问来源于stack exchange,提问作者drtamakloe
相关产品推荐
相关产品推荐

