SWE-bench Verified leaderboard: which LLMs score highest
SWE-bench Verified (real GitHub issues resolved) currently has scores for 73 models. The top score is 83.5% by Claude Opus 4.7 (max); the median model scores 56.4% and the lowest scores 0.4%.
| # | Model | Organisation | SWE-bench Verified score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.7 (max) | Anthropic | 83.5% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | DeepSeek v4 Pro (max) | DeepSeek | 77.6% | $0.435 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | Qwen3.7 Max | Alibaba | 77.3% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | Kimi K2.6 | Moonshot | 76.7% | $0.650 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | Qwen 3.6 Max (Preview) | Alibaba | 76.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | Gemini 3 Flash | Google DeepMind | 75.8% | $0.500 | SWE-bench Verified leaderboard | 2026-10-05 |
| 7 | MiniMax-M2.5 | MiniMax | 75.8% | $0.270 | SWE-bench Verified leaderboard | 2026-10-05 |
| 8 | Claude 4.6 Opus | Anthropic | 75.6% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 9 | Claude 4.5 Opus | Anthropic | 74.4% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 10 | Gemini 3 Pro Preview | Google DeepMind | 74.2% | $2.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 11 | GLM-5.1 | Z.ai (Zhipu AI) | 74.2% | $1.05 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | GPT-5 (high) | OpenAI | 73.6% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | claude-opus-4-1-20250805 | Anthropic | 73.3% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | GLM-5 | Z.ai (Zhipu AI) | 72.8% | $0.600 | SWE-bench Verified leaderboard | 2026-10-05 |
| 15 | GPT-5.2 Codex | OpenAI | 72.8% | $1.75 | SWE-bench Verified leaderboard | 2026-10-05 |
| 16 | Claude 4 Sonnet | Anthropic | 70.8% | $3.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 17 | Kimi K2.5 | Moonshot | 70.8% | $0.450 | SWE-bench Verified leaderboard | 2026-10-05 |
| 18 | Claude Opus 4 | Anthropic | 70.7% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | Claude 4.5 Sonnet | Anthropic | 70.6% | $3.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 20 | DeepSeek-V3.2 | DeepSeek | 70.0% | $0.259 | SWE-bench Verified leaderboard | 2026-10-05 |
| 21 | Gemini 3 Pro | Google DeepMind | 69.6% | $2.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 22 | GPT-5.1 (high) | OpenAI | 68.0% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | Claude 4 Opus | Anthropic | 67.6% | $5.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 24 | Claude 4.5 Haiku | Anthropic | 66.6% | $1.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 25 | GPT-5.1 Codex | OpenAI | 66.0% | $1.25 | SWE-bench Verified leaderboard | 2026-10-05 |
| 26 | Kimi K2 | Moonshot AI | 65.4% | $0.550 | SWE-bench Verified leaderboard | 2026-10-05 |
| 27 | o1-preview | OpenAI | 64.6% | $15.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 28 | Kimi K2 Thinking | Moonshot | 63.4% | $0.550 | SWE-bench Verified leaderboard | 2026-10-05 |
| 29 | Claude 3.7 Sonnet w/ Review Heavy | Anthropic | 62.4% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 30 | swe-search | Anthropic | 62.2% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 31 | MiniMax-M2 | MiniMax | 61.0% | $0.300 | SWE-bench Verified leaderboard | 2026-10-05 |
| 32 | claude-3-7-sonnet-20250219 | Anthropic | 61.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | Qwen3-Coder-30B-A3B-Instruct | Qwen | 60.4% | $0.070 | SWE-bench Verified leaderboard | 2026-10-05 |
| 34 | DeepSeek V3.2 Reasoner | deepseek | 60.0% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 35 | TTS(Bo16) | OpenAI | 58.8% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 36 | Qwen 3.6 Plus (2026-04-02) | Alibaba | 57.9% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 37 | Devstral Small (2512) | mistral | 56.4% | $0.070 | SWE-bench Verified leaderboard | 2026-10-05 |
| 38 | GLM-4.6 | Z.ai (Zhipu AI),Tsinghua University | 55.4% | $0.430 | SWE-bench Verified leaderboard | 2026-10-05 |
| 39 | Qwen3-Coder-480B-A35B-Instruct | Alibaba | 55.4% | $0.380 | SWE-bench Verified leaderboard | 2026-10-05 |
| 40 | glm-4.5 | Z.ai (Zhipu AI),Tsinghua University | 54.2% | $0.400 | SWE-bench Verified leaderboard | 2026-10-05 |
| 41 | Devstral (2512) | mistral | 53.8% | $0.400 | SWE-bench Verified leaderboard | 2026-10-05 |
| 42 | Frogboss 32B 2510 | — | 53.6% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 43 | Claude 3.5-Sonnet-20241022 | Anthropic | 51.6% | $3.00 | SWE-bench Verified leaderboard | 2026-10-05 |
| 44 | TTS(Bo8) | Qwen | 47.0% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 45 | DevStral Small 2505 | Mistral | 46.8% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 46 | Frogmini 14B 2510 | — | 45.0% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 47 | Gemini 2.0 Flash (Experimental) | Google DeepMind | 44.2% | $0.150 | SWE-bench Verified leaderboard | 2026-10-05 |
| 48 | Kimi K2 Instruct | Moonshot | 43.8% | $0.500 | SWE-bench Verified leaderboard | 2026-10-05 |
| 49 | Amazon.nova Premier v1:0 | — | 42.4% | — | SWE-bench Verified leaderboard | 2026-10-05 |
| 50 | DeepSWE-Preview | — | 42.2% | — | SWE-bench Verified leaderboard | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to MiniMax-M2.5 at $0.270 per million input tokens (score 75.8%).
What SWE-bench Verified measures
SWE-bench Verified asks a model, wrapped in an agent scaffold, to fix real issues from open-source Python projects. A fix counts only if the project's own tests pass. The Verified subset was hand-checked by people to make sure each task is solvable.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0), SWE-bench Verified leaderboard (unverified) and SWE-bench Verified leaderboard. Scores were last captured 2026-10-05; the Captured column gives each row's date.