You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在Quanteda的textplot_xray中用作者名替代文档ID作为标识?

在Quanteda词汇离散图中显示作者名(不合并文档)

刚好碰到过类似的需求,给你两个实用的解决方案,既能保留每个文档的独立线条,又能把x轴的文档ID换成作者名:

方法1:给文档名添加作者标识(保留唯一性)

因为文档ID必须唯一,我们可以把作者名和原文档ID组合成新的唯一名称,这样绘图时直接显示带作者的标识,每个文档的线条依然独立。

# 生成带作者名的唯一文档ID
new_docnames <- paste(myCorpus$documents[,'author'], docnames(myCorpus), sep = "_")
# 更新语料库的文档名
docnames(myCorpus) <- new_docnames
# 绘制词汇离散图(替换成你要分析的目标词汇)
textplot_xray(dfm_select(dfm(myCorpus), pattern = "your_target_word"))

生成的文档名会是类似JaneDoe_doc1、JaneDoe_doc2这样的格式,既满足唯一性要求,又能清晰看到每个文档对应的作者。

方法2:绘图后手动替换x轴标签

如果你不想改动原语料库的文档名,可以直接在绘图完成后,用ggplot2的语法修改x轴标签(毕竟textplot_xray是基于ggplot2构建的)。

# 先绘制基础的词汇离散图
p <- textplot_xray(dfm_select(dfm(myCorpus), pattern = "your_target_word"))
# 获取和文档顺序匹配的作者名向量
author_labels <- myCorpus$documents[,'author']
# 替换x轴标签为作者名
p + ggplot2::scale_x_discrete(labels = author_labels)

这个方法更灵活,完全不影响原语料库的结构。如果作者名重复导致x轴标签拥挤,还可以加个角度调整:

p + ggplot2::scale_x_discrete(labels = author_labels) +
  ggplot2::theme(axis.text.x = ggplot2::element_text(angle = 45, hjust = 1))

倾斜后的标签会更易读,避免重叠。

内容的提问来源于stack exchange,提问作者Colin

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.05.19 08:39:16