SWE-bench
类型:评测数据集(arXiv:2310.06770,ICLR 2024) 内容:从真实 GitHub 仓库收集的 issue + 对应 PR,要求模型修改代码库让测试通过 规模:2,294 个任务 / 12 个 Python 仓库 子类:Verified(500 题,人工过滤)、Lite(300)、Multilingual(300)、Multimodal(517)
它是”模型能不能真的干活”这一类评测的起点,也是同一模型换框架分数差异巨大这一事实最著名的展示场。
它测什么
真实的软件工程任务:跨函数、跨文件的协同修改,最后用仓库的单元测试判定成败。
论文发表时的基线(对比今天的进步很有意思):
“The best-performing model, Claude 2, is able to solve a mere 1.96% of the issues.”
2023 年榜单刚发布时,表现最好的模型 Claude 2 只能解决 1.96% 的问题——这个数字可以让你对「三年前的智能体编程能力有多原始」有个直观感受。
用它的三条注意事项
1. 必须说明用的是什么 harness
SWE-bench 官网的 Top 榜统一使用 mini-SWE-agent 这一个最小框架。第三方聚合站的数值差异,很大一部分来自 harness 不同。
Codesota 的明确警示:
“Pass-rate depends on agent scaffolding; two runs of the same base model can differ by double digits.”
通过率取决于用的是什么智能体脚手架;同一个基座模型跑两次,分数能差出两位数。(这也是为什么看 SWE-bench 分数必须先问「用的是什么 agent」。)
2. 跨来源的数值会对不上
2026-08-31 抓取时,Claude Opus 4.5 在不同聚合站分别记为 80.9%(BenchLM)、79.2%(Metatext)、80.8%(aitooltier);BenchLM 对 Claude Opus 5 给出的 96% 明显高于其他来源。
引用时必须注明来源与抓取日期。
3. 它正在饱和
BenchLM 的观察:
“The top models are clustered within 1.0 points, suggesting this benchmark is nearing saturation for frontier models.”
排名靠前的模型分数挤在 1 分以内,说明这个榜对前沿模型来说快要饱和、区分不出高下了。看榜时需要注意这点。
2026-08-31 的官方榜(mini-SWE-agent 口径,Top 5)
| 名次 | 模型 | % Resolved | 平均成本 | 日期 |
|---|---|---|---|---|
| 1 | Claude 4.5 Opus high | 76.80 | $0.75 | 2026-02-17 |
| 2 | Gemini 3 Flash high | 75.80 | $0.36 | 2026-02-17 |
| 2 | MiniMax M2.5 high | 75.80 | $0.07 | 2026-02-17 |
| 4 | Claude 4.6 Opus | 75.60 | $0.55 | 2026-02-17 |
| 5 | Claude 4.5 Opus medium | 74.40 | $0.72 | 2025-11-24 |
注意成本列:第一名与并列第二的差值是 0.4 个百分点,而成本差了 10 倍。这是”跑分之外还有性价比”的典型例子。另注意:官网最新条目日期为 2026-02-26,落后于第三方聚合站约半年。
相关页面
- 模型与框架分责 —— 它的分数高度依赖 harness
- Terminal-Bench —— 同类的终端智能体榜
- 工具调用 —— 它实际在测的能力