You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

R语言NLP文本分析:如何移除数据集内的指定单词‘no’

解决葡萄牙语文本分析中无法移除"no"的问题

你的问题核心是列名不匹配:用unnest_tokens(word, texto.do.kant)生成的单词列名为word,但你后续尝试的代码里错误地用了palavra作为列名,导致过滤/连接操作根本找不到目标列,自然删不掉"no"。

正确的解决方法:

方法1:用filter直接过滤(最简单)

修正列名为word即可:

palavras_a_remover <- c("no")
kant_palavras <- kant_palavras %>% filter(!word %in% palavras_a_remover)

方法2:用anti_join自定义停用词表

确保自定义停用词表的列名也是word,和你的数据列匹配:

palavras_a_remover <- data.frame(word = c("no"))
kant_palavras <- kant_palavras %>% anti_join(palavras_a_remover)

方法3:合并默认停用词和自定义词(推荐,一次性处理)

把"no"加入葡萄牙语默认停用词表,后续直接用这个合并后的表移除停用词:

# 合并默认停用词和自定义词
pt_stopwords <- get_stopwords(language = 'pt') %>%
  bind_rows(data.frame(word = "no", lexicon = "custom"))

# 移除停用词
kant_palavras <- dados_kant2 %>%  
  unnest_tokens(word, texto.do.kant) %>%
  anti_join(pt_stopwords)

为什么你之前的方法无效?

  • 方法1:anti_join("no")完全错误,anti_join要求传入数据框,不是单个字符串。
  • 方法2&3:你创建的自定义词表列名是palavra,但你的数据列是word,两者无法匹配,所以过滤/连接操作没有生效。

内容的提问来源于stack exchange,提问作者philosophy

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.11 17:22:46