ALE-Bench leaderboard: which LLMs score highest
ALE-Bench (AtCoder heuristic-optimisation contests (performance rating)) currently has scores for 78 models. The top score is 2,951 by GPT-6 Astra (max); the median model scores 755 and the lowest scores 138.
| # | Model | Organisation | ALE-Bench score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra (max) | OpenAI | 2,951 | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | GPT-6 Sol (max) | OpenAI | 2,462 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | GPT-5.6 Sol (max) | OpenAI | 2,177 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | GPT-5.6 Terra (max) | OpenAI | 1,951 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | GPT-5.5 (xhigh) | OpenAI | 1,943 | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | GPT-5.6 Luna (max) | OpenAI | 1,667 | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 7 | GPT-5.3 Codex (xhigh) | OpenAI | 1,655 | $1.75 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 8 | Kimi K3 (max) | Moonshot | 1,524 | $1.29 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 9 | Grok 4.6 (xhigh) | xAI | 1,508 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 10 | DeepSeek V4 Pro 0813 (max) | DeepSeek | 1,403 | $0.660 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 11 | Grok 4.5 (high) | xAI | 1,309 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | DeepSeek V4 Flash 0731 (max) | DeepSeek | 1,306 | $0.015 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | GPT-5.2 Codex | OpenAI | 1,300 | $1.75 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | Gemini 3.8 Flash (high) | Google DeepMind | 1,270 | $0.750 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 15 | GPT-5.1 Codex | OpenAI | 1,245 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 16 | GPT-5.1-Codex-Max | OpenAI | 1,209 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 17 | GPT-5.1 (high) | OpenAI | 1,192 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 18 | Qwen3.7 Max | Alibaba | 1,189 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | Gemini 3 Pro Preview | Google DeepMind | 1,177 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 20 | GPT-5 (high) | OpenAI | 1,162 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 21 | grok-4-20 | xAI | 1,150 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 22 | Kimi K2.6 | Moonshot | 1,093 | $0.650 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | deepseek-v4.1-flash-max | DeepSeek | 1,092 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 24 | o3 (high) | OpenAI | 934 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 25 | Gemma 4 26B A4B | Google DeepMind | 927 | $0.076 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 26 | Gemma 4 31B IT | Google DeepMind | 926 | $0.100 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 27 | Gemini 3.7 Flash (high) | Google DeepMind | 904 | $0.750 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 28 | mimo-v2.5-pro | Xiaomi Corp | 900 | $0.435 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 29 | GLM-5.1 | Z.ai (Zhipu AI) | 887 | $1.05 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 30 | Kimi K2.7 Code | Moonshot | 886 | $0.671 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 31 | o4-mini (high) | OpenAI | 826 | $1.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 32 | Kimi K2.5 | Moonshot | 822 | $0.450 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | DeepSeek-R1 (May 2025) | DeepSeek | 804 | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 34 | GPT-5 mini (high) | OpenAI | 800 | $0.250 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 35 | Mercury 2 | Inception Labs | 786 | $0.250 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 36 | gemini-2.5-pro_32K | Google DeepMind | 786 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 37 | mimo-v2-pro | Xiaomi Corp | 785 | $1.10 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 38 | GLM-5 | Z.ai (Zhipu AI) | 766 | $0.600 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 39 | Mistral Medium 3.5 | Mistral AI | 764 | $1.50 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 40 | DeepSeek-V3.1-Terminus | DeepSeek | 745 | $0.270 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 41 | MiMo-V2-Flash | XiaomiMiMo | 738 | $0.110 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 42 | GPT-5 nano (high) | OpenAI | 719 | $0.050 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 43 | Step 3.7 Flash | StepFun | 694 | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 44 | claude-opus-4-1-20250805_16K | Anthropic | 675 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 45 | Qwen 3.6 Plus (2026-04-02) | Alibaba | 670 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 46 | gemini-2.5-flash | Google DeepMind | 662 | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 47 | claude-sonnet-4-20250514_32K | Anthropic | 655 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 48 | claude-haiku-4-5-20251001_32K | Anthropic | 653 | $1.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 49 | MiniMax-M3 | MiniMax | 640 | $0.230 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 50 | MiniMax-M2.1 | MiniMax | 624 | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to GPT-5.6 Luna (max) at $0.200 per million input tokens (score 1,667).
What ALE-Bench measures
ALE-Bench measures AtCoder heuristic-optimisation contests (performance rating).
How to read these scores
Scores are Elo-style ratings (higher is better). Only differences between models mean anything, and small gaps may sit inside the source's own margin of error. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0). Scores were last captured 2026-10-05; the Captured column gives each row's date.