如何将quanteda的tokens对象转换为corpus对象
quanteda处理后tokens对象转corpus对象方法
tokens对象本质是存储了每个文档对应分词结果的列表,只需要先把每个文档的分词结果拼接回完整文本,就可以生成符合要求的corpus对象,具体操作如下:
- 第一步:遍历tokens对象,将每个文档的分词列表拼接为单条字符串
可以配合sapply()和paste()实现,示例中processed_tokens为你已处理完成的tokens对象:
如果不需要分词之间的空格分隔,可将processed_texts <- sapply(processed_tokens, paste, collapse = " ")collapse参数修改为"" - 第二步:将拼接好的文本向量转为corpus对象,可选择保留原tokens的文档元数据
# 保留元数据的转换方式 processed_corpus <- corpus(processed_texts, docvars = docvars(processed_tokens)) # 不需要保留元数据可直接简化为 # processed_corpus <- corpus(processed_texts)
内容的提问来源于stack exchange,提问作者ab0rt
相关产品推荐
相关产品推荐

