You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在R语言文本挖掘中,如何便捷处理「停用短语」?

移除司法文档中固定短语的简洁方案

直接对原始文本进行固定短语的精准替换是更高效的方案,无需拆分二元语法,能彻底移除目标短语同时保留单个词汇在其他语境下的含义。

实现代码

library(dplyr)
library(stringr)

# 原始文本数据
text <- data.frame(word = "according to Council directive 453-EL")

# 定义需要移除的固定短语列表(可按需添加多个)
remove_phrases <- c("Council directive")

# 批量替换目标短语并清理多余空格
text_cleaned <- text %>%
  mutate(word_clean = str_replace_all(word, str_c(remove_phrases, collapse = "|"), "") %>%
           str_squish())

# 输出清理后的结果
text_cleaned

关键说明

  • str_replace_all() 支持一次性匹配多个目标短语,通过str_c(remove_phrases, collapse = "|")将短语拼接为正则"或"模式,实现批量替换
  • str_squish() 用于清理替换后可能出现的连续空格,保证文本格式整洁
  • 该方案支持任意长度的固定短语,无需调整语法拆分逻辑,完全适配你的需求

内容的提问来源于stack exchange,提问作者banannanas

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.28 03:22:37