You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何可视化经dfm_trim处理后的文档特征矩阵(dfm)单文档词数?

解决DFM单文档词数可视化问题

方法1:生成整洁的词数表格

ntoken()可以直接从DFM提取每个文档的词数,将结果转为数据框就能得到整洁的结构化输出:

# 提取DFM的单文档词数并转为数据框
doc_token_counts <- data.frame(
  文档名称 = docnames(PI3_DFM),
  筛选后词数 = ntoken(PI3_DFM),
  row.names = NULL
)

# 查看整理后的结果
print(doc_token_counts)

方法2:可视化词数分布

如果需要直观展示词数的分布情况,用ggplot2绘制直方图或箱线图:

# 若未安装ggplot2先执行安装:install.packages("ggplot2")
library(ggplot2)

ggplot(doc_token_counts, aes(x = 筛选后词数)) +
  geom_histogram(binwidth = 50, fill = "#2c3e50", color = "white") +
  labs(title = "DFM筛选后各文档词数分布",
       x = "单文档词数",
       y = "文档数量") +
  theme_minimal()

方法3:快速查看排序后的词数

如果只想快速了解文档词数的高低排序,直接用sort()处理结果:

# 按词数降序排列展示
sorted_counts <- sort(ntoken(PI3_DFM), decreasing = TRUE)
print(sorted_counts)

补充说明

  • ntoken(PI3_DFM)会自动计算经过dfm_trim筛选后,每个文档保留的有效词数
  • 若需要统计每个文档中不同词的数量,将ntoken()替换为ntype()即可

内容的提问来源于stack exchange,提问作者Pablo1100

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.03 01:38:26