能否用Sentence BERT评估机器翻译?文档级计算与适用性探讨
Sentence-BERT 在机器翻译评估中的适用性探讨
我们讨论的不是BERTScore(它采用token级词嵌入,通过词嵌入成对余弦相似度与贪心匹配计算得分),而是Sentence-BERT——它通过纯余弦相似度直接比较句子语义相似度,不涉及精确率、召回率或F1值。
核心问题
在文档级(多句子场景)下,是否仅需计算平均余弦相似度即可完成评估?或是Sentence-BERT本身并不适合作为BLEU的替代方案用于机器翻译评估?
单句层面表现
单句场景下,Sentence-BERT能有效捕捉语义相似度:对于语义相同但表述不同的句子,BLEU会因词汇匹配度不足扣分,而Sentence-BERT会给出符合语义预期的高分,这完全契合机器翻译评估的核心需求。
待解疑问
但在近期WMT共享度量任务的相关论文中,几乎看不到Sentence-BERT的应用案例。推测它存在一些尚未被明确察觉的缺陷,才导致该方案未被广泛采用。
内容的提问来源于stack exchange,提问作者Yuirike
相关产品推荐
相关产品推荐

