ARC-AGI-2 leaderboard: which LLMs score highest
ARC-AGI-2 (abstract reasoning, ARC Prize public eval set) currently has scores for 89 models. The top score is 95.0% by GPT-6 Astra (max); the median model scores 18.9% and the lowest scores 0.0%.
| # | Model | Organisation | ARC-AGI-2 score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra (max) | OpenAI | 95.0% | $10.00 | ARC Prize official leaderboard | 2026-10-05 |
| 2 | GPT-6.1 Sol (max) | OpenAI | 94.2% | $2.00 | ARC Prize official leaderboard | 2026-10-05 |
| 3 | GPT-5.6 Sol (max) | OpenAI | 92.5% | $2.00 | ARC Prize official leaderboard | 2026-10-05 |
| 4 | Claude Opus 5.5 (max) | Anthropic | 91.7% | $4.00 | ARC Prize official leaderboard | 2026-10-05 |
| 5 | Claude Opus 5 (max) | Anthropic | 90.4% | $5.00 | ARC Prize official leaderboard | 2026-10-05 |
| 6 | Claude Fable 5.1 (max) | Anthropic | 90.0% | $10.00 | ARC Prize official leaderboard | 2026-10-05 |
| 7 | GPT-6 Sol (max) | OpenAI | 89.6% | $2.00 | ARC Prize official leaderboard | 2026-10-05 |
| 8 | Claude Fable 5 (max) | Anthropic | 89.2% | $10.00 | ARC Prize official leaderboard | 2026-10-05 |
| 9 | Gemini 3.8 Flash (high) | Google DeepMind | 89.2% | $0.750 | ARC Prize official leaderboard | 2026-10-05 |
| 10 | GPT-5.5 (xhigh) | OpenAI | 85.0% | $5.00 | ARC Prize official leaderboard | 2026-10-05 |
| 11 | Gemini 3.7 Flash (high) | Google DeepMind | 84.6% | $0.750 | ARC Prize official leaderboard | 2026-10-05 |
| 12 | Gemini 3 Deep Think (2/26) | 84.6% | — | ARC Prize official leaderboard | 2026-10-05 | |
| 13 | GPT-5.5 Pro (xhigh) | OpenAI | 84.2% | $30.00 | ARC Prize official leaderboard | 2026-10-05 |
| 14 | GPT-5.6 Terra (max) | OpenAI | 83.9% | $2.00 | ARC Prize official leaderboard | 2026-10-05 |
| 15 | GPT-5.4 Pro (xhigh) | OpenAI | 83.3% | $30.00 | ARC Prize official leaderboard | 2026-10-05 |
| 16 | Dots3-Note Preview (Max) | — | 76.8% | — | ARC Prize official leaderboard | 2026-10-05 |
| 17 | Claude 4.7 (Max) | Anthropic | 75.8% | — | ARC Prize official leaderboard | 2026-10-05 |
| 18 | GPT-5.4 (xhigh) | OpenAI | 74.0% | $2.50 | ARC Prize official leaderboard | 2026-10-05 |
| 19 | gemini-3.5-flash-high | 72.1% | $1.50 | ARC Prize official leaderboard | 2026-10-05 | |
| 20 | Claude Opus 4.6 (120K, High) | Anthropic | 69.2% | $5.00 | ARC Prize official leaderboard | 2026-10-05 |
| 21 | Claude Opus 4.6 (120K, Max) | Anthropic | 68.8% | $5.00 | ARC Prize official leaderboard | 2026-10-05 |
| 22 | Grok 4.6 (xhigh) | xAI | 67.1% | $1.25 | ARC Prize official leaderboard | 2026-10-05 |
| 23 | Claude Opus 4.6 (120K, Medium) | Anthropic | 66.2% | $5.00 | ARC Prize official leaderboard | 2026-10-05 |
| 24 | GLM-5.3-Flash (max) | Z.ai (Zhipu AI) | 65.8% | $0.110 | ARC Prize official leaderboard | 2026-10-05 |
| 25 | Grok 4.20 (Reasoning) | xAI | 65.1% | $1.25 | ARC Prize official leaderboard | 2026-10-05 |
| 26 | Claude Opus 4.6 (120K, Low) | Anthropic | 64.6% | $5.00 | ARC Prize official leaderboard | 2026-10-05 |
| 27 | DeepSeek V4 Flash 0731 (max) | DeepSeek | 61.4% | $0.015 | ARC Prize official leaderboard | 2026-10-05 |
| 28 | DeepSeek V4 Pro 0813 (max) | DeepSeek | 61.2% | $0.660 | ARC Prize official leaderboard | 2026-10-05 |
| 29 | Gemini 3.6 Flash (High) | 60.4% | $0.750 | ARC Prize official leaderboard | 2026-10-05 | |
| 30 | Kimi K3 (max) | Moonshot | 60.4% | $1.29 | ARC Prize official leaderboard | 2026-10-05 |
| 31 | GPT-5.6 Luna 2026-07-30 (Max) | OpenAI | 59.6% | — | ARC Prize official leaderboard | 2026-10-05 |
| 32 | GPT-5.6 Luna (max) | OpenAI | 59.5% | $0.200 | ARC Prize official leaderboard | 2026-10-05 |
| 33 | GPT-6 Luna (max) | OpenAI | 59.3% | $0.100 | ARC Prize official leaderboard | 2026-10-05 |
| 34 | Claude Sonnet 4.6 (max) | Anthropic | 58.3% | $3.00 | ARC Prize official leaderboard | 2026-10-05 |
| 35 | GPT-5.2 Pro (High) | OpenAI | 54.2% | $21.00 | ARC Prize official leaderboard | 2026-10-05 |
| 36 | GPT-5.2 (xhigh) | OpenAI | 52.9% | $1.75 | ARC Prize official leaderboard | 2026-10-05 |
| 37 | Grok 4.5 (high) | xAI | 52.6% | $2.00 | ARC Prize official leaderboard | 2026-10-05 |
| 38 | Gemini 3 Deep Think (Preview) ² | 45.1% | — | ARC Prize official leaderboard | 2026-10-05 | |
| 39 | Qwen3.8-27B (XHigh) | Alibaba | 42.4% | $0.400 | ARC Prize official leaderboard | 2026-10-05 |
| 40 | Inkling Small (xhigh) | Thinking Machines | 40.1% | $0.450 | ARC Prize official leaderboard | 2026-10-05 |
| 41 | Opus 4.5 (Thinking, 64K) | — | 37.6% | — | ARC Prize official leaderboard | 2026-10-05 |
| 42 | Gemini 3 Flash Preview (High) | 33.6% | $0.500 | ARC Prize official leaderboard | 2026-10-05 | |
| 43 | Gemini 3 Pro | Google DeepMind | 31.1% | $2.00 | ARC Prize official leaderboard | 2026-10-05 |
| 44 | Opus 4.5 (Thinking, 16K) | — | 22.8% | — | ARC Prize official leaderboard | 2026-10-05 |
| 45 | GPT-5.4 mini (xhigh) | OpenAI | 18.9% | $0.750 | ARC Prize official leaderboard | 2026-10-05 |
| 46 | GPT-5 Pro | OpenAI | 18.3% | $15.00 | ARC Prize official leaderboard | 2026-10-05 |
| 47 | GPT-5.1 (Thinking, High) | OpenAI | 17.6% | $1.25 | ARC Prize official leaderboard | 2026-10-05 |
| 48 | Opus 4.5 (Thinking, 8K) | — | 13.9% | — | ARC Prize official leaderboard | 2026-10-05 |
| 49 | Kimi K2.5 | Moonshot | 11.8% | $0.450 | ARC Prize official leaderboard | 2026-10-05 |
| 50 | Gemini 3.5 Flash-Lite (High) | 10.3% | $0.300 | ARC Prize official leaderboard | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to Gemini 3.8 Flash (high) at $0.750 per million input tokens (score 89.2%).
What ARC-AGI-2 measures
ARC-AGI-2 gives a model small coloured-grid puzzles, each needing a new rule to be inferred from a few examples. The tasks are designed to be easy for people and hard for AI, so the score reflects how well a model adapts to something it has not seen.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
ARC Prize official leaderboard. Scores were last captured 2026-10-05; the Captured column gives each row's date.