You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

为何n元语言模型的加一(Laplace)平滑中分母需加入词汇量V?

Laplace(加一)平滑分母加V的深层解释

核心原因:我们给所有可能的二元组都加了计数

加一平滑不是只给当前出现过的后续词加1,而是给词汇表里所有V个可能的后续词都加了1次虚拟计数。当计算条件概率P(w_i | w_{i-1})时,分母是前一个词w_{i-1}的实际出现次数,加上V的本质是:对应我们给每个可能的后续词都额外加了1次,总共额外增加了V次计数。

直观例子辅助理解

假设词汇表大小V=3(包含A、B、C三个词),前一个词X实际出现了5次,且所有后续词都是A。加一平滑后:

  • X-A的计数变为5+1=6
  • X-B、X-C的计数都从0变为0+1=1
    此时分母需要是5+3=8,这样三个条件概率分别是6/8、1/8、1/8,加起来刚好等于1,符合概率的基本规则。

如果只给分母加1,分母变成5+1=6,那三个概率会是6/6、1/6、1/6,总和是8/6>1,完全不合法。

从先验概率角度的补充解释

加一平滑相当于给每个二元组赋予了一个均匀的先验假设:我们默认每个可能的后续词都有至少一次出现的可能性。分母加V,就是把这个均匀先验的权重和实际观测到的计数做了加权融合,既保留了观测数据的信息,又保证了整个概率分布的合法性。

内容的提问来源于stack exchange,提问作者hxdshell

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.07.13 23:53:29