统计学习中经验分布在全变差距离下对连续分布的可学习性求证及文献咨询
我最近在统计学习的场景下,尝试证明或者证伪一个命题:经验分布能否在全变差距离的意义下,学习任意连续分布。我个人倾向于这个命题不成立,但也不敢确定自己的判断是对的。我查了不少网上资料和专业书籍,都没找到和这个问题表述类似的内容,所以如果有相关的文献推荐,我会非常感激。
补充说明:正如评论里指出的,我这里定义的距离在当前场景下和全变差距离是一致的。
问题的数学表述
我考虑的是实数域$\mathbb{R}$上的概率分布,首先定义如下函数集合:
$$ \mathcal F = { g \in \mathcal C^b(\mathbb R) \ \mid \ \lVert {g}\rVert_\infty \leq 1 } $$
其中$\mathcal C^b(\mathbb R)$表示$\mathbb{R}$上的有界连续函数空间,$\lVert g \rVert_\infty$是函数的无穷范数。
基于这个集合,我定义对应的$\mathcal F$-散度:
$$ d_\mathcal F (\mu \mid \nu ) = \sup_{g \in \mathcal F} \Big | \int_\mathbb R g \ d\mu - \int_\mathbb R g\ d\nu \ \Big | .$$
我需要证明(或者否定)的结论是:
对于任意连续概率分布$\mu$,给定从$\mu$中抽取的独立同分布样本$X_1, \dots , X_n$,经验分布$\tilde \mu n = \frac{1}{n} \sum{i=1}^n \delta_{X_i}$(其中$\delta_x$是狄拉克δ函数)在$d_\mathcal F$意义下依概率收敛到$\mu$,即:
$$ P( d_\mathcal F (\mu \mid \tilde \mu_n ) > \epsilon) \xrightarrow[ n \to \infty ]{} 0, \quad \forall \epsilon>0 $$
我的思考与进展
- 已经证明了$d_\mathcal F$下的收敛等价于在以下散度下的收敛:
$$ \tilde d (\mu \mid \nu ) = \sup_{g \in \mathcal C^c(\mathbb R) \ \lVert {g}\rVert_\infty \leq 1 } \Big | \int_\mathbb R g \ d\mu - \int_\mathbb R g\ d\nu \ \Big | .$$
这里$\mathcal C^c(\mathbb R)$是$\mathbb{R}$上具有紧支撑的连续函数空间,它是可分的——存在可数的稠密子集。我感觉或许可以利用这个性质来处理上确界的问题,但目前还没想清楚具体的操作路径。另外,我也不知道该怎么利用$\mu$是连续分布这个条件。 - 对于单个$g \in \mathcal F$,我可以用切比雪夫不等式或者弱大数定律证明收敛性,而且收敛速率和$g$无关:
$$ P\Big (\Big | \int_\mathbb R g \ d\mu - \int_\mathbb R g\ d\tilde \mu_n \ \Big | > \epsilon \Big ) \leq \frac{Var(g(X_1))}{\epsilon^2 n} \stackrel{g(X) \in [-1,1] \ P \ a.s. }{\leq} \frac{1}{\epsilon^2 n} $$
但要把这个单点收敛推广到所有$g \in \mathcal F$上的一致收敛,我感觉难度非常大。 - 我曾想过把问题限制在$\mathcal F$中满足$\mathbb E [g(X_1)] = 0$的函数子集上,尝试把期望放到随机变量内部处理,但这似乎没什么实质性帮助,甚至不确定这是不是一个合理的思路。
- 我也考虑过用一些简单的连续分布(比如高斯分布或者均匀分布)作为反例,来证伪原命题,但要证明这些情况下收敛不成立依旧很困难——我面临的核心障碍就是不知道怎么处理概率表达式里的那个上确界。
- 我也在想是不是有一些我没联想到的已知定理可以用:比如Glivenko-Cantelli定理,它保证了经验分布在对应半直线指示函数的散度下可以学习任意概率分布,但我觉得这个定理对当前问题并没有直接帮助。
备注:内容来源于stack exchange,提问作者pppp0l

