You need to enable JavaScript to run this app.
优惠活动
大模型
产品
解决方案
定价
更多

能否用Sentence BERT评估机器翻译?文档级计算与适用性探讨

Sentence-BERT 在机器翻译评估中的适用性探讨

我们讨论的不是BERTScore(它采用token级词嵌入,通过词嵌入成对余弦相似度与贪心匹配计算得分),而是Sentence-BERT——它通过纯余弦相似度直接比较句子语义相似度,不涉及精确率、召回率或F1值。

核心问题

在文档级(多句子场景)下,是否仅需计算平均余弦相似度即可完成评估?或是Sentence-BERT本身并不适合作为BLEU的替代方案用于机器翻译评估?

单句层面表现

单句场景下,Sentence-BERT能有效捕捉语义相似度:对于语义相同但表述不同的句子,BLEU会因词汇匹配度不足扣分,而Sentence-BERT会给出符合语义预期的高分,这完全契合机器翻译评估的核心需求。

待解疑问

但在近期WMT共享度量任务的相关论文中,几乎看不到Sentence-BERT的应用案例。推测它存在一些尚未被明确察觉的缺陷,才导致该方案未被广泛采用。

内容的提问来源于stack exchange,提问作者Yuirike

相关产品推荐
方舟 Agent Plan

超全模态模型 × Harness 升级,最新支持 Deepseek-V4.1-Flash、GLM-5.3 系列、Doubao-Seedream-5.0-pro、Kimi-K3 (部分), 限时 9.9 元起

最近更新时间:2026.06.14 20:45:54