SWE-bench Verified
500 human-verified GitHub issues. Bash-only runs with the same minimal agent, so models compare like for like.
Claude Opus 4.5
#1 right now
76.8%
Resolved
39
Models ranked
Feb 26, 2026
Board published
Ranking
Best variant per model, as published. Higher is better.
- 176.8%
Claude Opus 4.5
as “Claude 4.5 Opus (high)” - 275.8%
Gemini 3 Flash
as “Gemini 3 Flash (high)” - 275.8%
MiniMax-M2.5
as “MiniMax M2.5 (high)” - 475.6%
Claude Opus 4.6
as “Claude 4.6 Opus” - 574.2%
Gemini 3 Pro
as “Gemini 3 Pro Preview (2025-11-18)” - 672.8%
GLM-5
as “GLM 5 (high)” - 672.8%
GPT-5.2
as “GPT 5.2 (high)” - 672.8%
GPT-5.2 Codex
as “GPT 5.2 Codex” - 971.4%
Claude Sonnet 4.5
as “Claude 4.5 Sonnet (high)” - 1070.8%
Kimi K2.5
as “Kimi K2.5 (high)” - 1170.0%
DeepSeek-V3.2
as “DeepSeek V3.2 (high)” - 1267.6%
Claude Opus 4
as “Claude 4 Opus (20250514)” - 1366.6%
Claude 4.5 Haiku
as “Claude 4.5 Haiku (high)” - 1466.0%
GPT-5.1
as “GPT 5.1 (2025-11-13) (medium)” - 1466.0%
GPT 5.1 Codex
as “GPT 5.1 Codex (medium)” - 1665.0%
GPT-5
as “GPT 5 (2025-08-07) (medium)” - 1764.9%
Claude Sonnet 4
as “Claude 4 Sonnet (20250514)” - 1863.4%
- 1961.0%
- 2059.8%
GPT-5 mini
as “GPT 5 mini (2025-08-07) (medium)” - 2158.4%
o3
as “o3 (2025-04-16)” - 2256.4%
- 2355.4%
GLM 4.6
as “GLM 4.6 (T=1)” - 2355.4%
- 2554.2%
GLM 4.5
as “GLM 4.5 (2025-08-22)”
Rank over time
History builds with every daily capture. One capture so far.
Other coding boards
Scores as published by SWE-bench on the capture date (2026-09-24). Source: swe-bench.github.io leaderboards.json.