You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何基于dataframe的整数频次列处理字符串以生成准确word cloud

词云生成数据转换方案

你不需要对Minor Text列做特殊的文本转换,主流Python词云库(比如wordcloud)原生支持直接传入「文本-频次」字典,比重复构造文本列表的效率更高,具体操作如下:

方案1:直接构造频次字典(推荐)

直接将Minor Text列作为键,2019列的频次值作为值生成字典,调用词云对应的频次生成接口即可:

import pandas as pd
from wordcloud import WordCloud

# 此处替换为你自己的DataFrame读取逻辑
# df = pd.read_csv("你的数据文件路径")

# 构造文本-频次字典
freq_dict = df.set_index("Minor Text")["2019"].to_dict()

# 直接基于频次生成词云
wc = WordCloud(width=800, height=600)
wc.generate_from_frequencies(freq_dict)

# 后续可自行添加词云样式配置、导出或展示逻辑

方案2:转换为重复文本列表(适配不支持频次字典的场景)

如果你用的词云工具只支持传入原始文本内容,可以按频次重复对应文本,再拼接为大文本字符串:

# 按频次重复文本后合并为列表
text_list = df.apply(lambda row: [row["Minor Text"]] * row["2019"], axis=1).sum()
# 转为空格分隔的大字符串
full_text = " ".join(text_list)

# 传入词云生成接口
wc = WordCloud(width=800, height=600)
wc.generate(full_text)

注意:数据量较大时方案2会占用更多内存,优先选择方案1即可。

内容的提问来源于stack exchange,提问作者Jimmy K

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.09.26 01:45:02