狄利克雷分布线性变换后的概率分布求解问询
一、可逆方阵情形(n=m且A可逆)
你关于可逆方阵的推导完全正确:因为这个线性变换是双射(既单射又满射),我们可以通过变量替换直接得到Y的概率密度。具体来说,X = A⁻¹Y,变量替换的雅可比行列式绝对值是$1/|\det(A)|$,所以Y的密度函数为:
$$
f_Y(Y) = f_X(A^{-1}Y) \cdot \frac{1}{|\det(A)|}
$$
这里$f_X$是狄利克雷分布$D_{\alpha_n}$的密度:
$$
f_X(X) = \frac{1}{B(\alpha)} \prod_{i=1}^n x_i^{\alpha_i - 1}, \quad B(\alpha) = \frac{\prod_{i=1}^n \Gamma(\alpha_i)}{\Gamma(\sum_{i=1}^n \alpha_i)}
$$
代入后得到的$f_Y(Y)$本质上是广义狄利克雷分布的特例,只是变量是原变量的线性逆变换,保持了乘积项的幂次结构。
二、非可逆方阵情形(n≠m或A不可逆)
这部分更复杂,结合你提到的论文《狄利克雷分布及其在贝叶斯统计中的应用》(原英文标题:Dirichlet Distributions and Their Applications to Bayesian Statistics)的核心结论,我们分情况讨论:
1. 先明确变换的约束
题目要求对任意满足$\sum x_i=1$的X,Y=AX都满足$\sum y_i=1$,这意味着矩阵A的每一行元素之和必须为1——因为$\sum_{j=1}^m y_j = \sum_{j=1}^m \sum_{i=1}^n A_{ji}x_i = \sum_{i=1}^n x_i \sum_{j=1}^m A_{ji}$,要让这个结果等于1,必须每一行的和都是1。
2. 不同结构下的Y分布
- 降维合并(n>m,贝叶斯网络常见场景):如果A的行是“合并X的若干分量”的形式(比如某一行是[0,1,1,0],表示y_j = x₂+x₃),那么Y的分布很直观:如果把每个y_j对应的X分量的α参数加起来,得到β_j = $\sum_{i \in S_j} \alpha_i$(S_j是第j行中1对应的X分量索引),此时Y服从普通狄利克雷分布$D_{\beta_m}$。这也是贝叶斯网络中父节点概率由子节点聚合的常见情况。
如果A不是简单的分量合并,而是更一般的降维线性变换,那么Y的分布是广义狄利克雷分布,需要通过积分所有满足AX=Y的X的密度来得到:
$$
f_Y(Y) = \int_{{X | AX=Y, \sum x_i=1, x_i>0}} f_X(X) dX
$$ - 升维变换(n<m):这种情况比较少见,因为X是n维单纯形,要让AX落在m维单纯形中,A的列必须满足严格的线性约束。此时Y的分布是狄利克雷分布的投影分布,密度函数需要通过矩生成函数或指数族分布的性质推导,形式相对复杂。
3. 论文关键结论翻译
这篇论文的核心观点是:当线性变换矩阵的行和全为1时,变换后的分布仍属于指数族,其充分统计量是原狄利克雷分布充分统计量的线性组合。对于分量合并类的降维变换,只有当合并的分量参数可加时,Y才服从普通狄利克雷分布,否则是广义狄利克雷分布。
三、总结
- 可逆方阵:Y的密度是原狄利克雷分布经逆变换后乘以雅可比行列式倒数,属于广义狄利克雷分布。
- 降维分量合并:Y服从普通狄利克雷分布,参数为对应X分量的α和;非合并类降维变换则为广义狄利克雷分布。
- 其他非可逆情况:需通过积分原分布密度或利用指数族性质推导,具体形式依赖A的结构。
内容的提问来源于stack exchange,提问作者Snowy Baboon

