加载中...
HumanEval 是 OpenAI 于 2021 年发布的代码生成能力评测基准,包含 164 道手工编写的 Python 编程题。它通过运行单元测试判断模型生成代码是否正确,并以通过率作为核心指标,是评估大模型编程能力的常用标准。

| 发布机构 | OpenAI |
| 发布时间 | 2021 年 |
| 题目数量 | 164 道 |
| 编程语言 | Python |
| 核心指标 | pass at k 通过率 |
HumanEval是 OpenAI 在 2021 年随 Codex 论文一同发布的代码生成评测基准。它由 164 道人工编写的 Python 编程问题组成,每道题给出函数签名和说明文档,要求模型补全函数实现,并通过配套的单元测试来自动判断生成代码是否正确。
评估代码生成不同于评估自然语言,关键在于代码能否真正运行并得到正确结果,而非表面相似。HumanEval 采用执行式评测,直接运行生成代码并检验其是否通过所有测试用例,因此能较客观地反映模型的实际编程能力,已成为该领域的标准基准之一。
HumanEval 被广泛用于比较各类代码大模型的编程水平,几乎所有主流代码模型发布时都会报告其在该基准上的通过率。它也启发了 MBPP、HumanEval+ 等后续基准,共同构成代码智能评测体系。
问:pass at k 是什么意思?答:它表示让模型对每题生成 k 个答案,只要其中有一个通过全部测试就算解决,统计所有题目的成功比例,常用 pass at 1 反映单次生成的正确率。
问:HumanEval 能全面代表编程能力吗?答:不能。它以短小的 Python 函数为主,难以体现大型项目开发、跨文件协作和复杂工程等能力,需配合更综合的基准评估。

| 发布机构 | OpenAI |
| 发布时间 | 2021 年 |
| 题目数量 | 164 道 |
| 编程语言 | Python |
| 核心指标 | pass at k 通过率 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧