已知随机变量X、Y取值范围,求互信息I(X;Y)的最大值
互信息I(X;Y)的最大可能值分析
嘿,你的思路方向是对的,但咱们得补上一个关键细节:互信息I(X;Y)的上限其实是min(H(X), H(Y)),而不是单纯的H(X)。这是因为互信息代表的是两个变量共享的信息量,它不可能超过其中任何一个变量自身的熵。
接下来咱们一步步拆解:
1. 明确变量的熵上限
- 对于Y(取值范围{0,1}),它的最大熵出现在均匀分布时,也就是
P(Y=0)=P(Y=1)=1/2,此时H(Y)=log₂(2)=1比特。这是Y能达到的最大熵,不可能更高了。 - 对于X(取值范围{0,1,2}),它的最大熵出现在均匀分布时,
H(X)=log₂(3)≈1.58比特,但这个值比Y的最大熵要大。
2. 构造能达到上限的联合分布
既然min(H(X), H(Y))的最大值是1(因为Y的熵最多到1),那我们可以构造一个联合分布让I(X;Y)刚好等于1:
- 定义一个映射:让X的两个取值对应Y=0,一个取值对应Y=1,同时调整X的分布使得Y是均匀的。比如:
P(X=0)=1/4,P(X=1)=1/4,P(X=2)=1/2- 对应的联合分布:
P(X=0,Y=0)=1/4,P(X=1,Y=0)=1/4,P(X=2,Y=1)=1/2
- 此时:
- Y是均匀分布,
H(Y)=1 - 给定X时Y是确定的(
H(Y|X)=0,因为每个X对应唯一的Y) - 所以
I(X;Y)=H(Y)-H(Y|X)=1-0=1
- Y是均匀分布,
3. 为什么不能超过1?
假设尝试让I(X;Y)大于1,那意味着Y需要提供超过1比特的信息,但Y本身最多只有1比特的熵(因为它只有两个可能取值),这是不可能的。所以1就是互信息能达到的最大值。
另外你提到的“是否假设X均匀分布”:在这个问题里,X均匀分布时H(X)最大,但因为Y的熵上限更低,所以此时互信息的上限还是由Y决定,没法达到H(X)的数值。只有当Y的熵上限大于等于X的熵时,互信息的最大值才等于X的最大熵。
内容的提问来源于stack exchange,提问作者user3727648
相关产品推荐
相关产品推荐

