关于《深度学习》(Goodfellow等,2016)中随机变量定义与标准定义差异的疑问
关于《深度学习》(Goodfellow等,2016)中随机变量定义与标准定义差异的疑问
你观察得非常仔细——这个差异确实存在,不少刚接触深度学习的同学都会有类似的困惑,我来帮你梳理清楚:
首先先明确书中的定义(引用自第3.2节):
随机变量是可以随机取不同值的变量。我们通常用普通字体的小写字母表示随机变量本身,用小写手写体字母表示它可能取到的值。例如,$x_1$ 和 $x_2$ 都是随机变量 $x$ 可能取到的值。对于向量值变量,我们会将随机变量写为 $\boldsymbol{x}$,它的一个值写为 $\boldsymbol{x}$。随机变量本身只是对可能状态的描述;它必须与一个概率分布结合,才能指定每个状态的可能性。
随机变量可以是离散的或连续的。离散随机变量具有有限或可数无限个状态。请注意,这些状态不一定是整数;它们也可以是不被视为具有任何数值的命名状态。连续随机变量与实数值相关联。
你提到的标准定义(从样本空间到可测空间的映射,要求取值为数值)是测度论视角下的严谨表述,也是传统概率论教材里的常规定义。而《深度学习》里的定义确实更偏向实验结果的代名词——它把随机变量直接等同于「可能的结果集合」,而非那个从样本空间到数值空间的映射函数。
这个差异在期望的定义上体现得格外明显:
- 标准离散期望的定义是:
$$\mathbb{E}[X] = \sum_x xP(x)$$
这里的$X$就是那个映射函数,$x$是它输出的数值,直接参与求和运算。 - 而《深度学习》第3.8节的期望定义是:
$$\mathbb{E}_{x \sim P}[f(x)] = \sum_x P(x)f(x)$$
这里的$x$更像是实验的原始结果(可能是非数值的,比如「正面/反面」分类标签、图像样本),必须通过函数$f$转换成数值后才能计算期望——这个$f$其实就承担了标准定义里随机变量的「映射」职责。
你的理解完全正确!至于为什么要偏离标准定义,主要有两个核心原因:
- 实用性优先:深度学习领域处理的对象经常是非数值的(文本、图像、分类标签等),如果严格遵循测度论定义,每次都要先把这些对象映射到数值空间,会增加不必要的繁琐表述。直接把「实验结果」称为随机变量,更符合从业者的日常语境,沟通效率更高。
- 降低入门门槛:《深度学习》的目标读者是计算机科学、工程领域的从业者,他们可能没有系统学习过测度论。用更直观、贴近实际应用的定义,可以避免一开始就陷入复杂的数学形式主义,让读者更快聚焦到核心概念上。
当然,这种简化确实会带来混淆——尤其是当读者同时学习严谨的概率论教材时。但换个角度看,这其实是领域特定的「术语简化」,就像程序员会把「对象实例」简称为「对象」一样,本质上是为了适配领域的使用场景。
备注:内容来源于stack exchange,提问作者Jay Mody
相关产品推荐
相关产品推荐

