You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

相同n-gram权重下BLEU评分差异悬殊的原因及权重确定方法咨询

问题

我用Python计算BLEU评分时,设置unigram、bigram、trigram、4-gram的权重为(0.25, 0.25, 0, 0)。同一套代码和权重下,针对第一组参考文本得到BLEU评分0.51,针对第二组参考文本得到6.91的高分。想请教:

  1. 评分差异悬殊的原因是什么?
  2. 该如何确定n-gram的权重?
  3. 有没有确定权重的特定标准?

第一组参考文本对应脚本

# 定义自定义权重(示例:给bigram更高权重)
weights = (0.25, 0.25, 0, 0)  # 分别对应unigram、bigram、trigram、4-gram的权重

# 参考文本与预测文本
reference = [["the", "alleyway", "barely", "lives", "in", "semi", "isolation"]]
predictions = ["midaq", "alley", "lives", "in", "almost", "complete", "isolation"]

# 带权重计算BLEU分数
score = sentence_bleu(reference, predictions, weights=weights)
print(score)

第二组参考文本对应脚本

# 定义自定义权重(示例:给bigram更高权重)
weights = (0.25, 0.25, 0, 0)  # 分别对应unigram、bigram、trigram、4-gram的权重

# 参考文本与预测文本
reference = [["the", "alley", "is", "almost", "living", "in", "a", "state", "of", "isolation"]]
predictions = ["midaq", "alley", "lives", "in", "almost", "complete", "isolation"]

# 带权重计算BLEU分数
score = sentence_bleu(reference, predictions, weights=weights)
print(score)

解答

1. 评分差异悬殊的原因

BLEU分数核心由n-gram匹配度和长度惩罚项决定,你的权重仅关注unigram和bigram,差异根源在这两部分:

  • Unigram匹配差距:第二组参考文本与预测文本的匹配单词数量远多于第一组:第二组能匹配alley、in、almost、isolation,而第一组仅能匹配lives、in、isolation,alleyway与alley不匹配,其余单词也无对应项,直接拉低了第一组的基础匹配率。
  • Bigram匹配贡献:第一组仅(lives, in)这1个bigram匹配,第二组虽bigram匹配数不多,但unigram的高匹配度已经拉开了分数差距。
  • 长度惩罚的影响:第一组参考与预测长度均为7,无惩罚;第二组参考长度10、预测长度7,存在一定惩罚,但unigram的高匹配度足以抵消惩罚扣分,最终分数仍远高于第一组。

2. 如何确定n-gram的权重

权重设置完全围绕任务需求调整:

  • 若关注词汇准确性(如机器翻译的基础词汇正确性),可提高unigram权重。
  • 若关注语句流畅度、语法合理性(如文本生成、机器翻译通顺度),可提高bigram、trigram权重,它们能反映词与词的搭配是否符合语言习惯。
  • 若处理长文本任务(如文档摘要),可适当提高trigram、4-gram权重,用来衡量语句的连贯性与逻辑一致性。
  • 实际调试时,可通过验证集测试不同权重组合,选择在验证集上表现最优的配置;也可参考同领域论文的成熟权重设置。

3. 有没有特定标准

  • 通用基准标准:最经典的BLEU设置是unigram到4-gram权重均为0.25(即(0.25, 0.25, 0.25, 0.25)),这是机器翻译领域的通用基准,适用于大多数通用文本生成任务。
  • 领域特化标准:不同任务会针对性调整:
    • 短文本生成(如对话回复)中,通常降低高阶n-gram权重——短文本中高阶n-gram匹配概率低,权重过高会导致分数失真。
    • 代码生成任务中,会提高trigram、4-gram权重——代码语法高度依赖连续token的搭配逻辑。
  • 注意:单句BLEU分数波动极大,通常更适合计算语料级BLEU(对整个数据集的所有句子计算平均分数),此时权重设置会更稳定。

内容的提问来源于stack exchange,提问作者user20003920

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.22 05:33:15