加载中...

BLEU(Bilingual Evaluation Understudy)是 IBM 研究者 Papineni 等人于 2002 年提出的机器翻译自动评测指标,通过比较机器译文与人工参考译文的 n-gram 重合程度给出 0 到 1(常以百分制呈现)的分数。
BLEU 计算 1 元至 4 元 n-gram 的修正精确率(每个 n-gram 的计数不超过参考译文中的出现次数),取几何平均,再乘以简短惩罚因子(Brevity Penalty)以惩罚过短译文。通常在整个测试集上汇总计算,句子级分数波动较大。
BLEU 使翻译系统的快速迭代评测成为可能,极大推动了统计机器翻译的发展,至今仍是论文报告的默认指标,常用 SacreBLEU 工具保证计算口径一致。
BLEU 只看表面字串匹配,不理解同义表达和语法正确性,与人工评价的相关性有限,因此 METEOR、chrF、COMET 等语义化指标相继被提出作为补充。

登录 后参与讨论
暂无讨论,来发表第一条评论吧