You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

如何在已知噪声/异常点占比时拟合高斯混合模型?

扩展高斯混合模型EM算法以忽略已知占比的未知数据

背景

高斯混合模型(Gaussian Mixture Model)通过期望最大化(Expectation-Maximization,EM)算法进行拟合。该算法包含初始化和两个核心步骤:

  • 初始化(针对k=2个高斯分布):为两个高斯分布寻找(或猜测)初始的mu和sigma参数值。
  • E步:利用当前的高斯分布参数,估计每个数据点来自高斯分布A(或B)的似然性。将这些似然性除以两者之和,可得到数据点更可能来自A而非B的概率(即后验概率)。若已知潜在类别的占比,可在此引入先验信息。
  • M步:更新所有mus和sigmas参数。例如,高斯分布A的新mu值可通过所有数据点的加权和计算得出,权重为上一步得到的后验概率。sigmas参数也可通过类似方式推导。

问题需求

我想扩展该算法以忽略已知占比的数据点。例如,已知数据集包含p(A)=70%的栗属数据、p(B)=15%的向日葵数据,以及15%的未知物种数据。希望拟合两个高斯分布来描述栗属和向日葵的分布,并让算法忽略15%的数据,这样剩余两个高斯分布无需为覆盖未知分布的数据而扩大sigma,从而得到更小的sigma值。

注:由于未知物种可能包含多个类别,无法引入第三个高斯分布来“吸收”它们;且未知物种的分布可能与A相似,因此直接移除异常点并非最优方案。

目前已在E步中使用了A和B的已知占比作为先验信息,但尚未找到优雅的方法来忽略未知数据。请问有什么思路?

示例图

包含70%物种A、15%物种B和15%未知物种的示例
包含70%物种A、15%物种B和15%未知物种的示例


内容的提问来源于stack exchange,提问作者Klops

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.17 11:57:24