如何将经stringi编辑后的文本导入Quanteda并保留原文本?
解决方法
第一步:完整读取原始文本,保留原始数据
用readtext包读取文件,把原始文本和文档变量都存下来,这样原始内容不会丢失:library(readtext) library(stringi) library(quanteda) # 读取extdata下的所有文本文件,递归读取子目录内容 raw_data <- readtext(system.file("extdata/", package = "readtext"), recursive = TRUE)第二步:生成处理后的文本列
在原始数据框里新增一列,专门存放经过stringi替换后的文本,这样原始文本(raw_data$text)完全不受影响:raw_data$processed_text <- stri_replace_all_regex(raw_data$text, "Whereas.*Whereas\n{2}", "")第三步:将处理后的文本导入quanteda
直接用处理后的文本列创建quanteda的语料库,同时可以把原始的文档变量(比如文件名、路径)一并带入,方便后续分析时溯源:# 创建用于分析的处理后语料库 processed_corpus <- corpus(raw_data$processed_text, docvars = docvars(raw_data))
这样操作后,raw_data里保留了全部原始文本,processed_corpus就是你需要的、经过编辑后的quanteda语料库,两边需求都能满足。
内容的提问来源于stack exchange,提问作者bgreen
相关产品推荐
相关产品推荐

