You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

Hessian矩阵与方差的关联原理探究

Hessian矩阵与方差的关联原理探究

我最近一直在琢磨为啥Hessian矩阵会和方差扯上这么有名的关系,自己试着推导了一遍,过程绕得不行,索性把思路拆成几个部分整理出来,先从基础概念开始捋:

  • 似然函数:$ L(\theta|x) = p(x|\theta) $
  • 对数似然函数:$ l(\theta|x) = \log L(\theta|x) $
  • 得分函数(对数似然的一阶导数):$ s(\theta) = \frac{\partial l(\theta|x)}{\partial \theta} $
  • Hessian矩阵(由二阶偏导数构成的矩阵):$ H(\theta) = \frac{\partial^2 l(\theta|x)}{\partial \theta \partial \theta^T} $
  • 基本假设:得分函数的期望为0,即 $ E[s(\theta)] = 0 $
  • Fisher信息矩阵:$ I(\theta) = E\left[s(\theta)s(\theta)^T\right] $

推导的核心其实是从得分函数的性质切入:因为得分函数的期望为0,它的方差就等于自身的二阶矩,也就是上面的Fisher信息矩阵。接下来关键的一步是交换求导和求期望的顺序(这里需要满足正则条件,比如概率密度函数可微、积分与导数运算可交换),咱们可以得到:

$ E\left[\frac{\partial s(\theta)}{\partial \theta^T}\right] = E\left[H(\theta)\right] = -I(\theta) $

这就直接把Hessian矩阵的期望和Fisher信息矩阵联系起来了!而Fisher信息矩阵又和参数估计的方差下界(Cramer-Rao下界)直接相关:任何无偏估计量$\hat{\theta}$的协方差都满足:

$ \text{Cov}(\hat{\theta}) \geq I(\theta)^{-1} $

结合前面的式子,$ I(\theta) = -E[H(\theta)] $,所以可以进一步得到:

$ \text{Cov}(\hat{\theta}) \geq -\left(E[H(\theta)]\right)^{-1} $

当样本量足够大的时候,极大似然估计(MLE)的渐近分布是正态分布,它的协方差矩阵可以近似用Fisher信息矩阵的逆来表示,也就是$ -\left(H(\hat{\theta})\right)^{-1} $——这里用MLE估计出的Hessian矩阵代替期望Hessian,因为大样本下它会依概率收敛到期望Hessian。这就是为啥咱们常说Hessian和方差有关联:它的逆矩阵取负之后,就能用来近似极大似然估计的方差!

备注:内容来源于stack exchange,提问作者heartofdarkness

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.04.15 16:09:49