You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Pandas DataFrame分词后停用词无法移除的问题排查

解决Pandas DataFrame中停用词移除未生效的问题

你的问题核心很明确:最后一行的apply操作只生成了处理后的结果,但没有把结果写回原DataFrame的列中,所以原数据完全没变化。

修正后的代码如下:

from nltk.corpus import stopwords
from nltk.tokenize import word_tokenize
stop = stopwords.words('english')

# 执行分词并覆盖原列
lyrical_data['lyrics'] = lyrical_data.apply(lambda x: word_tokenize(str(x['lyrics'])), axis=1)

# 移除停用词,同时赋值回原列(这步是你漏掉的关键操作)
lyrical_data['lyrics'] = lyrical_data['lyrics'].apply(lambda x: [item for item in x if item.lower() not in stop])

额外补充两个实用优化点:

  • 加入item.lower():因为NLTK的英文停用词全是小写形式,如果你分词结果里有大写的停用词(比如"I"),直接匹配会过滤不掉,转小写后能确保所有停用词都被识别。
  • 如果需要同时过滤标点符号,可以再加个item.isalpha()判断,只保留纯字母的单词:
    lyrical_data['lyrics'] = lyrical_data['lyrics'].apply(lambda x: [item.lower() for item in x if item.lower() not in stop and item.isalpha()])
    

内容的提问来源于stack exchange,提问作者Randolf Gabrielle Uy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.10 18:04:55