SimpleBench leaderboard: which LLMs score highest
SimpleBench (trick questions that test common sense) currently has scores for 64 models. The top score is 81.9% by Claude Fable 5 (max); the median model scores 43.3% and the lowest scores 10.7%.
| # | Model | Organisation | SimpleBench score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 (max) | Anthropic | 81.9% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | Gemini 3 Pro Preview | Google DeepMind | 76.4% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | GPT-5.6 Sol (pro, unknown thinking) | OpenAI | 71.7% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | GPT-5.6 Sol (pro, xhigh) | OpenAI | 71.7% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | Qwen3.7 Max | Alibaba | 70.4% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | Qwen 3.6 Max (Preview) | Alibaba | 63.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 7 | Gemini 2.5 Pro Preview (Jun 2025) | Google DeepMind | 62.4% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 8 | GPT-5 Pro | OpenAI | 61.6% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 9 | Kimi K3 (max) | Moonshot | 60.7% | $1.29 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 10 | grok-4-0709 | xAI | 60.5% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 11 | Claude Opus 4.1 (unknown thinking) | Anthropic | 60.0% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | claude-opus-4-1-20250805 | Anthropic | 60.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | Claude Opus 4 | Anthropic | 58.8% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | Kimi K2.7 Code | Moonshot | 57.9% | $0.671 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 15 | GPT-5 (high) | OpenAI | 56.7% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 16 | grok-4-1-fast-non-reasoning | xAI | 56.0% | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 17 | grok-4-1-fast-reasoning | xAI | 56.0% | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 18 | GLM-5.1 | Z.ai (Zhipu AI) | 55.1% | $1.05 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | GLM-5 | Z.ai (Zhipu AI) | 53.2% | $0.600 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 20 | GPT-5.1 (high) | OpenAI | 53.2% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 21 | o3 (high) | OpenAI | 53.1% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 22 | DeepSeek-V3.2-Speciale | DeepSeek | 52.6% | $0.580 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | Gemini 2.5 Pro Exp (Mar 2025) | Google DeepMind | 51.6% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 24 | Gemini 2.5 Pro Preview (Mar 2025) | Google DeepMind | 51.6% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 25 | GLM-4.7 | Z.ai (Zhipu AI) | 47.7% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 26 | GLM-4.7 (Novita) | Z.ai (Zhipu AI) | 47.7% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 27 | Kimi K2.5 | Moonshot | 46.8% | $0.450 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 28 | DeepSeek v4 (unknown) | DeepSeek | 46.3% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 29 | MiniMax-M3 | MiniMax | 45.8% | $0.230 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 30 | Claude Sonnet 4 (unknown thinking) | Anthropic | 45.5% | $3.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 31 | claude-sonnet-4-20250514_12K | Anthropic | 45.5% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 32 | claude-3-7-sonnet-20250219 | Anthropic | 44.9% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | o1-preview | OpenAI | 41.7% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 34 | Claude 3.5 Sonnet (Oct 2024) | Anthropic | 41.4% | $3.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 35 | gemini-2.5-flash | Google DeepMind | 41.2% | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 36 | DeepSeek-R1 (May 2025) | DeepSeek | 40.8% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 37 | o1 (high) | OpenAI | 40.1% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 38 | DeepSeek-V3.1 | DeepSeek | 40.0% | $0.250 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 39 | o4-mini (high) | OpenAI | 38.7% | $1.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 40 | grok-3 | xAI | 36.1% | $3.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 41 | Qwen 3.6 Flash (2026-04-16) | Alibaba | 35.2% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 42 | GPT-4.5 Preview (Feb 2025) | OpenAI | 34.5% | $75.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 43 | gemini-exp-1206 | Google DeepMind,Google | 31.1% | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 44 | qwen3-235b-a22b | Alibaba | 31.0% | $0.180 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 45 | DeepSeek-R1 | DeepSeek | 30.9% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 46 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | 30.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 47 | Llama 4 Maverick | Meta AI | 27.7% | $0.188 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 48 | Claude 3.5 Sonnet (Jun 2024) | Anthropic | 27.5% | $3.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 49 | DeepSeek-V3 (Mar 2025) | DeepSeek | 27.2% | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 50 | gemini-1.5-pro-002 | Google DeepMind | 27.1% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to Qwen3.7 Max at $1.25 per million input tokens (score 70.4%).
What SimpleBench measures
SimpleBench poses short questions with a trick or trap that most people catch using common sense. It is built to expose models that pattern-match instead of reason.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0). Scores were last captured 2026-10-05; the Captured column gives each row's date.