在R语言文本挖掘中,如何便捷处理「停用短语」?
移除司法文档中固定短语的简洁方案
直接对原始文本进行固定短语的精准替换是更高效的方案,无需拆分二元语法,能彻底移除目标短语同时保留单个词汇在其他语境下的含义。
实现代码
library(dplyr) library(stringr) # 原始文本数据 text <- data.frame(word = "according to Council directive 453-EL") # 定义需要移除的固定短语列表(可按需添加多个) remove_phrases <- c("Council directive") # 批量替换目标短语并清理多余空格 text_cleaned <- text %>% mutate(word_clean = str_replace_all(word, str_c(remove_phrases, collapse = "|"), "") %>% str_squish()) # 输出清理后的结果 text_cleaned
关键说明
str_replace_all()支持一次性匹配多个目标短语,通过str_c(remove_phrases, collapse = "|")将短语拼接为正则"或"模式,实现批量替换str_squish()用于清理替换后可能出现的连续空格,保证文本格式整洁- 该方案支持任意长度的固定短语,无需调整语法拆分逻辑,完全适配你的需求
内容的提问来源于stack exchange,提问作者banannanas
相关产品推荐
相关产品推荐

