加载中...
MMLU 是一个评测大语言模型多任务语言理解能力的知名基准,全称为大规模多任务语言理解。它涵盖数学、历史、法律、医学等 57 个学科的选择题,以准确率衡量模型的广博知识与推理水平,是模型能力对比的常用指标。

| 全称 | Massive Multitask Language Understanding |
| 类型 | 语言模型评测基准 |
| 学科数量 | 57 个 |
| 题型 | 四选一选择题 |
| 评分指标 | 准确率 |
MMLU(Massive Multitask Language Understanding)即大规模多任务语言理解,是一个用于评测大语言模型知识广度与理解能力的权威基准。它由多项选择题组成,题目涵盖人文、社科、理工和专业领域共 57 个学科,以模型答对题目的比例作为主要评分标准。
随着大模型能力提升,单一任务的评测难以全面反映其水平。MMLU 通过覆盖从初等数学到法律、医学、伦理等广泛主题的题目,考察模型是否掌握了跨领域的知识并能进行基本推理。它常以零样本或少样本方式测试,已成为衡量和比较主流模型能力的标准指标之一。
MMLU 广泛用于学术论文和模型发布报告中,作为对比不同大语言模型综合能力的重要参考。研究者和厂商常引用其得分来展示模型进展,普通用户也可据此大致判断模型的知识水平。
问:MMLU 得分高就代表模型一定好用吗?答:不完全是。MMLU 主要考察知识型选择题,无法覆盖对话流畅度、指令跟随、安全性和长文本生成等维度,需结合其他基准综合评估。
问:MMLU 会存在数据污染问题吗?答:会。如果测试题目泄露进了模型训练语料,分数可能虚高,因此研究者也在推出更难或更新的变体以减少污染影响。

| 全称 | Massive Multitask Language Understanding |
| 类型 | 语言模型评测基准 |
| 学科数量 | 57 个 |
| 题型 | 四选一选择题 |
| 评分指标 | 准确率 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧