如何可视化经dfm_trim处理后的文档特征矩阵(dfm)单文档词数?
解决DFM单文档词数可视化问题
方法1:生成整洁的词数表格
ntoken()可以直接从DFM提取每个文档的词数,将结果转为数据框就能得到整洁的结构化输出:
# 提取DFM的单文档词数并转为数据框 doc_token_counts <- data.frame( 文档名称 = docnames(PI3_DFM), 筛选后词数 = ntoken(PI3_DFM), row.names = NULL ) # 查看整理后的结果 print(doc_token_counts)
方法2:可视化词数分布
如果需要直观展示词数的分布情况,用ggplot2绘制直方图或箱线图:
# 若未安装ggplot2先执行安装:install.packages("ggplot2") library(ggplot2) ggplot(doc_token_counts, aes(x = 筛选后词数)) + geom_histogram(binwidth = 50, fill = "#2c3e50", color = "white") + labs(title = "DFM筛选后各文档词数分布", x = "单文档词数", y = "文档数量") + theme_minimal()
方法3:快速查看排序后的词数
如果只想快速了解文档词数的高低排序,直接用sort()处理结果:
# 按词数降序排列展示 sorted_counts <- sort(ntoken(PI3_DFM), decreasing = TRUE) print(sorted_counts)
补充说明
ntoken(PI3_DFM)会自动计算经过dfm_trim筛选后,每个文档保留的有效词数- 若需要统计每个文档中不同词的数量,将
ntoken()替换为ntype()即可
内容的提问来源于stack exchange,提问作者Pablo1100
相关产品推荐
相关产品推荐

