加载中...
RewardBench 是首个系统评测奖励模型能力的公开基准,通过覆盖对话、安全、推理、代码等场景的成对偏好样本,检验奖励模型能否正确区分优质与劣质回答,是对齐研究的重要评估工具。

| 中文名 | RewardBench |
| 发布方 | Allen AI |
| 发布时间 | 2024 年 |
| 类别 | 评测基准 |
| 评测对象 | 奖励模型 |
RewardBench 是一个专门用于评测奖励模型的公开基准数据集与排行榜,通过大量精心构造的成对回答,衡量奖励模型判断答案优劣的准确率。
在基于人类反馈的强化学习流程中,奖励模型负责给回答打分,其质量直接决定对齐效果。然而长期以来缺乏统一的奖励模型评测标准。RewardBench 由 Allen AI 研究团队于二零二四年发布,首次为奖励模型提供了跨领域、可复现的评测框架,填补了这一空白。
RewardBench 主要用于对齐研究团队在训练奖励模型后进行横向比较,快速评估不同数据配方与模型结构的效果。它也帮助研究者诊断奖励模型的弱项,例如是否容易被冗长但空洞的回答误导。
问:奖励模型分数高就代表最终模型一定好吗?答:不完全是。RewardBench 分数反映的是判别偏好的能力,但最终对齐效果还受强化学习流程、采样策略与奖励作弊等因素影响,需综合评估。
问:RewardBench 能评测生成式奖励模型吗?答:可以。除传统打分式奖励模型外,基于大模型充当评审的生成式奖励方案也能在同一批成对样本上给出偏好判断并接受评测。

| 中文名 | RewardBench |
| 发布方 | Allen AI |
| 发布时间 | 2024 年 |
| 类别 | 评测基准 |
| 评测对象 | 奖励模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧