You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

基于quanteda清理语料:移除#符号包裹的文本

语料库#包裹文本清理方案

你可以通过正则表达式批量处理readtext返回的数据框,快速移除所有被#符号包裹的内容。以下是两种常用实现方式:

基础R实现

直接使用gsub函数对text字段进行替换,支持跨行匹配#包裹的段落:

# 假设读取后的数据集为corpus_df
corpus_df$clean_text <- gsub("#.*?#", "", corpus_df$text, perl = TRUE, flags = "s")
  • #.*?#:非贪婪匹配所有以#开头、#结尾的内容
  • flags = "s":让.匹配换行符,处理跨行的#包裹段落
  • 若不需要保留原text字段,可直接将结果覆盖到corpus_df$text

dplyr管道实现

如果习惯用tidyverse风格,可结合mutate批量处理:

library(dplyr)

corpus_df <- corpus_df %>%
  mutate(clean_text = gsub("#.*?#", "", text, perl = TRUE, flags = "s"))

验证清理结果

随机抽取几条数据确认效果:

sample(corpus_df$clean_text, 5)

内容的提问来源于stack exchange,提问作者bgreen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.15 12:35:00