You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Scikit Learn高斯混合模型(GMM)聚类结果不一致问题咨询

原因分析
  1. 随机初始化引发局部最优差异
    Scikit-learn的GaussianMixture默认会对高斯成分的均值、协方差等参数做随机初始化,EM算法在优化过程中可能收敛到不同的局部最优解,这是每次聚类结果不一致的核心原因。

  2. 样本量与簇数不匹配
    你的数据集仅12个样本,却指定了4个聚类簇,平均每个簇仅3个样本。这种情况下数据无法呈现出4个清晰的高斯分布结构,EM算法更容易在不同局部最优间波动,导致结果不稳定。

解决建议
  • 固定随机种子
    初始化GaussianMixture时设置random_state参数,固定初始化的随机过程,确保每次运行结果一致:
model = GaussianMixture(n_components=4, random_state=42)
  • 多轮初始化选最优结果
    设置n_init参数让模型多次运行不同初始化,最终选择似然值最高的结果,搭配random_state保证可复现:
model = GaussianMixture(n_components=4, n_init=10, random_state=42)
  • 用准则选择合理簇数
    强行指定4个簇不符合样本量现状,建议通过BIC/AIC准则选择最优簇数:
n_components_range = range(1, 5)
bic_scores = []
for n in n_components_range:
    model = GaussianMixture(n_components=n, random_state=42)
    model.fit(X)
    bic_scores.append(model.bic(X))

# 绘制BIC曲线,选择最小BIC对应的簇数
pyplot.plot(n_components_range, bic_scores)
pyplot.xlabel('Number of Components')
pyplot.ylabel('BIC Score')
pyplot.show()

通常BIC值最小的点对应的簇数是最合理的选择。

  • 标准化特征尺度
    你的特征x和y数值范围差异较大(x:030,y:068),标准化后让特征尺度一致,可提升模型拟合稳定性:
from sklearn.preprocessing import StandardScaler

scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)

# 使用标准化后的数据训练模型
model = GaussianMixture(n_components=4, random_state=42)
model.fit(X_scaled)

内容的提问来源于stack exchange,提问作者user3673063

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.08.18 22:05:26