加载中...

ROUGE(Recall-Oriented Understudy for Gisting Evaluation)是 Chin-Yew Lin 于 2004 年提出的一族自动评测指标,主要用于评价自动文本摘要质量,通过统计系统摘要与人工参考摘要之间的重叠单元来打分。
ROUGE-N 计算 n-gram 的召回率(如 ROUGE-1、ROUGE-2 分别基于一元与二元词串);ROUGE-L 基于最长公共子序列,能捕捉句子级词序信息;ROUGE-S 使用跳跃二元组。实践中常同时报告 ROUGE-1、ROUGE-2 与 ROUGE-L 的 F1 值。
ROUGE 是摘要研究领域论文的标准指标,也被用于评测标题生成、问答和对话回复等文本生成任务,常与 DUC、CNN/DailyMail 等基准数据集配套出现。
与 BLEU 类似,ROUGE 依赖表面匹配,无法评估事实一致性与流畅度,对抽象式摘要偏严;近年常辅以基于语义或大模型的评测方法。

登录 后参与讨论
暂无讨论,来发表第一条评论吧