R语言Gibbs-LDA主题建模:一致性得分计算及phi参数疑问
LDA主题模型一致性得分计算及phi参数解析
一、计算一致性得分的方法(含textmineR的CalcProbCoherence使用)
你用topicmodels包的LDA()函数(Gibbs抽样方法)训练的模型,完全可以用textmineR包的CalcProbCoherence()函数计算主题一致性,步骤如下:
- 从你的
topicModel中提取主题-词概率矩阵(即phi参数):# 提取主题-词概率分布,对应textmineR需要的phi phi <- posterior(topicModel)$terms - 直接调用
CalcProbCoherence()计算:
其中library(textmineR) coherence_scores <- CalcProbCoherence(phi = phi, DTM = DTM, M = 5)M=5表示取每个主题下概率最高的5个词来计算一致性(可根据需求调整)。
二、phi参数的具体含义
phi是LDA模型的核心参数之一,全称主题-词概率分布矩阵:
- 矩阵的每一行对应一个主题,每一列对应一个词汇;
- 矩阵中的元素
phi[k, w]表示第k个主题生成第w个词的概率; - 每一行的元素和为1(每个主题下所有词的概率总和为1),代表该主题的词汇概率分布。
内容的提问来源于stack exchange,提问作者Emily
相关产品推荐
相关产品推荐

