基于quanteda清理语料:移除#符号包裹的文本
语料库#包裹文本清理方案
你可以通过正则表达式批量处理readtext返回的数据框,快速移除所有被#符号包裹的内容。以下是两种常用实现方式:
基础R实现
直接使用gsub函数对text字段进行替换,支持跨行匹配#包裹的段落:
# 假设读取后的数据集为corpus_df corpus_df$clean_text <- gsub("#.*?#", "", corpus_df$text, perl = TRUE, flags = "s")
#.*?#:非贪婪匹配所有以#开头、#结尾的内容flags = "s":让.匹配换行符,处理跨行的#包裹段落- 若不需要保留原
text字段,可直接将结果覆盖到corpus_df$text
dplyr管道实现
如果习惯用tidyverse风格,可结合mutate批量处理:
library(dplyr) corpus_df <- corpus_df %>% mutate(clean_text = gsub("#.*?#", "", text, perl = TRUE, flags = "s"))
验证清理结果
随机抽取几条数据确认效果:
sample(corpus_df$clean_text, 5)
内容的提问来源于stack exchange,提问作者bgreen
相关产品推荐
相关产品推荐

