SWE-bench是普林斯顿大学2023年推出的软件工程评测基准,取材于真实GitHub仓库的问题单,要求模型生成能通过单元测试的代码补丁。它已成为衡量编程智能体解决真实工程问题能力的事实标准。

| 英文名 | SWE-bench |
| 发布机构 | 普林斯顿大学 |
| 发布时间 | 2023年 |
| 任务类型 | 真实GitHub issue修复 |
| 评测指标 | 解决率(resolved) |
| 常用版本 | Verified(500题)、Lite(300题) |
SWE-bench(Software Engineering Benchmark)是由普林斯顿大学研究者于2023年在论文《SWE-bench: Can Language Models Resolve Real-World GitHub Issues?》中提出的软件工程评测基准。它不考孤立的算法题,而是要求模型面对真实开源项目的问题单(issue),在完整代码仓库中定位并修改代码,生成能通过测试的补丁。
基准从Django、SymPy、scikit-learn等12个流行Python开源项目中收集了2000多个真实issue及对应的修复提交。评测时,模型获得issue描述和出问题时刻的完整仓库快照,需要输出代码补丁;补丁被应用后运行该项目的单元测试,只有原本失败的测试转为通过、且原有测试不被破坏,才算解决。这种以测试通过为准的客观评判方式,使其比人工打分的代码基准更可信。
SWE-bench发布时最强模型解决率不足5%,此后随着编程智能体发展,前沿系统在Verified版上的解决率已提升至70%以上,它因此成为衡量AI编程助手实用性的核心指标,也被广泛用于评估Claude、GPT系列等模型的智能体编程能力。
问:SWE-bench和HumanEval有什么区别?答:HumanEval是从头写独立小函数,SWE-bench是在庞大的既有代码库中修复真实bug或实现需求,后者更接近真实软件工程。
问:为什么常看到SWE-bench Verified的成绩?答:原始数据集中部分题目描述模糊或测试不合理,Verified子集经人工核验剔除了这些问题,成绩更能反映真实能力。

| 英文名 | SWE-bench |
| 发布机构 | 普林斯顿大学 |
| 发布时间 | 2023年 |
| 任务类型 | 真实GitHub issue修复 |
| 评测指标 | 解决率(resolved) |
| 常用版本 | Verified(500题)、Lite(300题) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧