You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

在R语言中进行文本挖掘:删除各文档的第一句话

移除文本中的第一句话(R语言实现)

需求说明

处理包含多段文本的数据集,移除每条文本的第一句话,保留剩余内容。

输入示例

案例编号文本
1Today is a good day. It is sunny.
2Today is a bad day. It is rainy.

预期输出

案例编号文本
1It is sunny.
2It is rainy.

示例数据集(R语言)

case_number <- c(1, 2)
text <- c("Today is a good day. It is sunny.",
          "Today is a bad day. It is rainy.")
data <- data.frame(case_number, text)

解决方案

方法1:使用stringr包(语法直观,推荐)

# 首次使用需安装包
# install.packages("stringr")
library(stringr)

# 移除第一句话并生成新列
data$processed_text <- str_remove(data$text, "^.*?\\.\\s")

方法2:使用基础R的sub函数(无需额外安装包)

# 移除第一句话并生成新列
data$processed_text <- sub("^.*?\\.\\s", "", data$text)

正则表达式说明

^.*?\\.\\s 规则解析:

  • ^:匹配文本起始位置
  • .*?:非贪婪模式匹配任意字符,直到遇到第一个句号
  • \\.:匹配句号(正则中句号为特殊字符,需反斜杠转义)
  • \\s:匹配句号后的空格

执行后,processed_text列即为移除第一句话后的目标内容。


内容的提问来源于stack exchange,提问作者USER12345

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.13 21:34:57