Skip to content
Boards/CodingStale since 2026-02-26

SWE-bench Verified

500 human-verified GitHub issues. Bash-only runs with the same minimal agent, so models compare like for like.
SWE-bench
Claude Opus 4.5
#1 right now
76.8%
Resolved
39
Models ranked
Feb 26, 2026
Board published

Ranking

Best variant per model, as published. Higher is better.

  1. 1
    Claude Opus 4.5
    as “Claude 4.5 Opus (high)
    76.8%
  2. 2
    Gemini 3 Flash
    as “Gemini 3 Flash (high)
    75.8%
  3. 2
    MiniMax-M2.5
    as “MiniMax M2.5 (high)
    75.8%
  4. 4
    Claude Opus 4.6
    as “Claude 4.6 Opus
    75.6%
  5. 5
    Gemini 3 Pro
    as “Gemini 3 Pro Preview (2025-11-18)
    74.2%
  6. 6
    GLM-5
    as “GLM 5 (high)
    72.8%
  7. 6
    GPT-5.2
    as “GPT 5.2 (high)
    72.8%
  8. 6
    GPT-5.2 Codex
    as “GPT 5.2 Codex
    72.8%
  9. 9
    Claude Sonnet 4.5
    as “Claude 4.5 Sonnet (high)
    71.4%
  10. 10
    Kimi K2.5
    as “Kimi K2.5 (high)
    70.8%
  11. 11
    DeepSeek-V3.2
    as “DeepSeek V3.2 (high)
    70.0%
  12. 12
    Claude Opus 4
    as “Claude 4 Opus (20250514)
    67.6%
  13. 13
    Claude 4.5 Haiku
    as “Claude 4.5 Haiku (high)
    66.6%
  14. 14
    GPT-5.1
    as “GPT 5.1 (2025-11-13) (medium)
    66.0%
  15. 14
    GPT 5.1 Codex
    as “GPT 5.1 Codex (medium)
    66.0%
  16. 16
    GPT-5
    as “GPT 5 (2025-08-07) (medium)
    65.0%
  17. 17
    Claude Sonnet 4
    as “Claude 4 Sonnet (20250514)
    64.9%
  18. 1863.4%
  19. 1961.0%
  20. 20
    GPT-5 mini
    as “GPT 5 mini (2025-08-07) (medium)
    59.8%
  21. 21
    o3
    as “o3 (2025-04-16)
    58.4%
  22. 2256.4%
  23. 23
    GLM 4.6
    as “GLM 4.6 (T=1)
    55.4%
  24. 2355.4%
  25. 25
    GLM 4.5
    as “GLM 4.5 (2025-08-22)
    54.2%

Rank over time

History builds with every daily capture. One capture so far.

Other coding boards

Scores as published by SWE-bench on the capture date (2026-09-24). Source: swe-bench.github.io leaderboards.json.

www.swebench.com/

Weekly: the AI leaderboards with a new #1, Saturday mornings.