Quanteda显示限制问题:如何突破仅显示6份文档的上限?
问题描述
我正处于自定义词典的构建与测试初期阶段,使用包含30份TXT文件的美国州政党纲领语料库进行测试。已成功创建词典并通过Quanteda生成汇总统计,但目前仅能一次显示6份文件的结果。我的计划是将该词典用于数十年间的数百份文件,请问是否有方法实现一次显示超过6份文档?
代码示例
corp_platform <- corpus(corp) toks_platform <- tokens(corp_platform) dict_toks <- tokens_lookup(toks_platform, dictionary = dict) print(dict_toks) dfm(dict_toks)
输出/限制提示
Document-feature matrix of: 30 documents, 2 features (1.67% sparse) and 2 docvars. communitarian individualist akdem20.txt 113 20 azdem20.txt 60 13 cadem20.txt 254 98 medem20.txt 27 7 mndfl20.txt 40 18 ncdem20.txt 235 64 [已达max_ndoc上限...还有24份文档]
解决方案
Quanteda默认限制dfm打印时显示的文档数量为6,你可以通过以下几种方式调整:
临时单份dfm调整:使用
print()函数时指定max_ndoc参数,按需设置显示数量:my_dfm <- dfm(dict_toks) # 显示全部30份文档 print(my_dfm, max_ndoc = 30) # 显示所有文档(适用于数百份文件场景) print(my_dfm, max_ndoc = Inf)转换为数据框查看:将dfm转换为普通数据框,直接获取全量内容:
as.data.frame(dfm(dict_toks))全局默认设置修改:调整Quanteda的全局选项,后续所有dfm打印都会应用该设置:
options(quanteda.print_max_ndoc = Inf) # 之后直接调用dfm(dict_toks)即可显示全部文档
内容的提问来源于stack exchange,提问作者dcoffey
相关产品推荐
相关产品推荐

