tidy文本挖掘中widyr与ggraph的相关性阈值及图布局问题
文本挖掘关联网络常见问题解答
1. 相关性阈值0.15是否属于行业最佳实践
不存在统一的行业通用最佳阈值,教程中的0.15是针对NASA特定数据集的个性化取值,选取逻辑可参考以下规则:
- 阈值的核心作用是过滤弱关联的噪声边,取值完全依赖数据集规模、词汇稀疏度、分析目标:数据集越大、共现组合越多,阈值可以适当调高避免图过于拥挤;数据集越小、想要保留更多弱关联做探索,阈值可以适当压低
- 通用的选取方法是做阈值敏感性测试:你可以分别选取0.1、0.15、0.2三个梯度的阈值生成网络图,选择聚类语义最清晰、既没有过多孤立节点也不会所有节点糊成一团的阈值即可
- 没有相关文献给出统一标准是正常情况,该参数属于探索性文本分析的可调超参,所有公开教程中的阈值都只能作为同类型数据集的参考值,不能直接套用到所有场景。
2. 网络图聚类中心度的确定规则与节点布局逻辑
你提到的“聚类中心度”在关键词关联网络场景下,通常采用以下两种常用指标计算:
- 度中心性:统计和当前节点相连的边的总数量,连接的节点越多,中心性越高,代表该词和更多其他关键词存在强关联
- 特征向量中心性:不仅统计连接节点的数量,还会纳入连接节点本身的中心性权重,连接的节点越重要,当前节点的中心性越高,更适合用来定位语义聚类的核心代表词
教程中的网络图采用的是力导向布局算法,布局逻辑如下:
- 两个节点的相关性越高,相互之间的引力越大,布局位置就越近;无关联的节点之间存在斥力,会互相远离
- 词汇的重要度和是否靠近全图的全局中心没有必然联系,你看到的靠近某一类聚类中心的节点,本质是它和当前聚类内的其他节点关联最多,所以被拉到该聚类的中心位置。如果存在多个独立语义聚类,每个聚类都会有自己的中心节点,不会全部向全图的全局中心靠拢。
内容的提问来源于stack exchange,提问作者Gabriella
相关产品推荐
相关产品推荐

