BALROG leaderboard: which LLMs score highest
BALROG (long-horizon game-playing agents) currently has scores for 34 models. The top score is 68.3% by GPT-6 Astra (max); the median model scores 27.6% and the lowest scores 3.7%.
| # | Model | Organisation | BALROG score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra (max) | OpenAI | 68.3% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | Claude Opus 5 (max) | Anthropic | 63.4% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | GPT-5.6 Sol (max) | OpenAI | 60.0% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | Gemini 3 Pro Preview | Google DeepMind | 58.1% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | GPT-5.6 Terra (max) | OpenAI | 53.2% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | GPT-5.6 Luna (max) | OpenAI | 45.6% | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 7 | grok-4-0709 | xAI | 43.6% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 8 | Gemini 2.5 Pro Exp (Mar 2025) | Google DeepMind | 43.3% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 9 | DeepSeek-R1 | DeepSeek | 34.9% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 10 | gemini-2.5-flash | Google DeepMind | 33.5% | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 11 | Claude 3.5 Sonnet (Oct 2024) | Anthropic | 32.6% | $3.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | GPT-4o (May 2024) | OpenAI | 32.3% | $2.50 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | claude-haiku-4-5-20251001 | Anthropic | 31.2% | $1.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | claude-haiku-4-5-20251001_1K | Anthropic | 31.2% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 15 | grok-3-beta | xAI | 29.5% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 16 | Reka Flash 3 | rekaai | 29.2% | $0.100 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 17 | Llama-3.1-70B-Instruct | Meta AI | 27.9% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 18 | Llama-3.2-90B-Vision-Instruct | Meta AI | 27.3% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | Llama-3.3-70B-Instruct | Meta AI | 23.0% | $0.120 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 20 | gemini-1.5-pro-002 | Google DeepMind | 21.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 21 | DeepSeek-R1-Distill-Qwen-32B | DeepSeek | 19.5% | $0.150 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 22 | Claude 3.5 Haiku (Oct 2024) | Anthropic | 19.3% | $0.800 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | Mistral-Nemo-Instruct-2407 | Mistral AI | 17.6% | $0.019 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 24 | gpt-4o-mini-2024-07-18 | OpenAI | 17.4% | $0.150 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 25 | Llama-3.2-11B-Vision-Instruct | Meta AI | 16.8% | $0.049 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 26 | qwen2.5-72b-instruct | Alibaba | 16.2% | $0.120 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 27 | Llama-3.1-8B-Instruct | Meta AI | 15.1% | $0.020 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 28 | gemini-1.5-flash-002 | Google DeepMind | 14.6% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 29 | Qwen2-VL-72B-Instruct | Alibaba | 12.8% | $0.130 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 30 | phi-4 | Microsoft Research | 11.6% | $0.070 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 31 | Llama-3.2-3B-Instruct | Meta AI | 10.1% | $0.020 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 32 | qwen2.5-7b-instruct | Alibaba | 7.8% | $0.040 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | Llama-3.2-1B-Instruct | Meta AI | 6.6% | $0.020 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 34 | Qwen2-VL-7B-Instruct | Alibaba | 3.7% | $0.020 | Epoch AI Benchmarking Hub | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to GPT-5.6 Luna (max) at $0.200 per million input tokens (score 45.6%).
What BALROG measures
BALROG measures long-horizon game-playing agents.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0). Scores were last captured 2026-10-05; the Captured column gives each row's date.