联合熵与联合分布中结合性(Associativity)和交换性(commutativity)相关技术问题咨询
联合熵与联合分布中结合性(Associativity)和交换性(commutativity)相关技术问题咨询
嗨!很高兴看到你在信息论学习中注意到了这个细节——这其实是联合熵的两个核心性质在帮论文作者简化表达式,完全不是“随意乱写”哦,我来给你拆解一下:
首先,你提到的教材里的链式法则 $H(Y|X)=H(X,Y) - H(X)$,本质是针对两个随机变量的情况;而论文里的 $H(X|Y,Z)=H(X,Y,Z)−H(Y,Z)$,其实是把这个法则推广到了以联合随机变量为条件的场景,只是借助联合熵的性质做了写法上的简化。
背后支撑这种简化的两个关键性质是:
- 交换性(Commutativity):联合熵的结果和随机变量的顺序无关。比如 $H(X,Y) = H(Y,X)$,扩展到三个变量就是 $H(X,Y,Z) = H(Y,X,Z) = H(Y,Z,X)$,以此类推。原因很简单:联合分布 $P(X,Y,Z)$ 和 $P(Y,Z,X)$ 描述的是同一个概率场景,只是变量的排列顺序不同,而熵是对概率分布的量化度量,自然不会因为顺序改变而变化。
- 结合性(Associativity):多个随机变量的联合熵可以任意分组,不需要保留括号。比如 $H(X,(Y,Z)) = H((X,Y),Z) = H(X,Y,Z)$。这是因为不管怎么分组,我们描述的都是这三个变量的联合概率分布,分组方式不会改变分布本身,所以熵值也完全一致。
正是因为这两个性质,论文里才可以放心地去掉括号、调换变量顺序——既让表达式更简洁易读,又完全不损失数学严谨性。比如你觉得“应该写成 $H(X|(Y,Z))=H((Y,Z), X)−H(Y,Z)$”,其实和论文里的写法是完全等价的,只是论文用了更紧凑的表达方式而已。
备注:内容来源于stack exchange,提问作者Mio
相关产品推荐
相关产品推荐

