You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何将经stringi编辑后的文本导入Quanteda并保留原文本?

解决方法
  • 第一步:完整读取原始文本,保留原始数据
    用readtext包读取文件,把原始文本和文档变量都存下来,这样原始内容不会丢失:

    library(readtext)
    library(stringi)
    library(quanteda)
    
    # 读取extdata下的所有文本文件,递归读取子目录内容
    raw_data <- readtext(system.file("extdata/", package = "readtext"), recursive = TRUE)
    
  • 第二步:生成处理后的文本列
    在原始数据框里新增一列,专门存放经过stringi替换后的文本,这样原始文本(raw_data$text)完全不受影响:

    raw_data$processed_text <- stri_replace_all_regex(raw_data$text, "Whereas.*Whereas\n{2}", "")
    
  • 第三步:将处理后的文本导入quanteda
    直接用处理后的文本列创建quanteda的语料库,同时可以把原始的文档变量(比如文件名、路径)一并带入,方便后续分析时溯源:

    # 创建用于分析的处理后语料库
    processed_corpus <- corpus(raw_data$processed_text, docvars = docvars(raw_data))
    

这样操作后,raw_data里保留了全部原始文本,processed_corpus就是你需要的、经过编辑后的quanteda语料库,两边需求都能满足。

内容的提问来源于stack exchange,提问作者bgreen

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.15 03:23:28