Pandas DataFrame词频分布统计触发ValueError报错如何修复
报错原因
- 原有代码仅提取每行文本的首尾两个词,会遗漏行中间的词汇,本身逻辑无法得到正确的词频统计结果
- 两次分组后的结果存在列名重复,concat后重置索引时触发列名插入冲突,导致报错
修复代码
直接使用拆分+行展开+频次统计的逻辑即可,代码如下:
# 拆分word列的字符串为列表,展开为单独行后统计频次 count_result = rawData['word'].str.split().explode().value_counts().reset_index() # 重命名列符合你的输出要求 count_result.columns = ['word', 'count']
运行后输出结果和你预期完全一致:
word count 0 pear 3 1 apple 2 2 best 1
内容的提问来源于stack exchange,提问作者nia4life
相关产品推荐
相关产品推荐

