加载中...
大模型评审指用强大的语言模型代替人工来给其他模型的输出打分或成对比较,以低成本大规模评估生成质量。该方法随MT-Bench论文流行,但存在位置偏好、长度偏好等已知偏差,需要谨慎设计。

| 英文名 | LLM-as-a-Judge |
| 流行起点 | MT-Bench 论文(2023) |
| 常见形式 | 打分、成对比较 |
| 主要偏差 | 位置、长度、自我偏好 |
| 典型应用 | 基准评测、数据筛选、RLAIF |
大模型评审(LLM-as-a-Judge)是指使用能力较强的大语言模型作为评委,对其他模型的输出进行打分、成对比较或点评,从而替代或辅助人工评估的方法。随着2023年MT-Bench与Chatbot Arena论文对该方法的系统研究,它已成为大模型评测与数据筛选的主流手段。
开放式生成任务(如对话、写作、总结)没有唯一标准答案,BLEU、ROUGE等传统指标与人类判断相关性差,而人工评估昂贵缓慢。研究发现,GPT-4级别的模型作为评委,与人类偏好的一致率可超过80%,接近人类标注者之间的一致率,这使得用模型评模型成为可行的低成本方案。
除了跑基准(如MT-Bench、AlpacaEval、Arena-Hard),大模型评审还被广泛用于:筛选与清洗训练数据,为RLAIF生成偏好标签,线上服务的质量监控与回归测试,以及智能体系统中对中间步骤的自我检查。专门训练的开源评审模型也在发展,以降低对商业模型的依赖。
问:大模型评审能完全取代人工评估吗?答:不能。在高风险领域、需要专业知识或评委模型自身能力不足的任务上,模型评审可能系统性出错,关键结论仍需人工抽检校准。
问:用被评测的同一个模型当评委可以吗?答:应尽量避免。自我偏好偏差会使评分虚高,通常选用更强或至少无同源关系的模型作评委,并汇报评委版本。

| 英文名 | LLM-as-a-Judge |
| 流行起点 | MT-Bench 论文(2023) |
| 常见形式 | 打分、成对比较 |
| 主要偏差 | 位置、长度、自我偏好 |
| 典型应用 | 基准评测、数据筛选、RLAIF |
登录 后参与讨论
暂无讨论,来发表第一条评论吧