ProofBench leaderboard: which LLMs score highest
ProofBench (writing mathematical proofs) currently has scores for 43 models. The top score is 100.0% by Claude Fable 5.1 (max); the median model scores 20.0% and the lowest scores 0.0%.
| # | Model | Organisation | ProofBench score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max) | Anthropic | 100.0% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | Claude Opus 5.5 (max) | Anthropic | 100.0% | $4.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | Claude Sonnet 5.5 (max) | Anthropic | 100.0% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | Claude Opus 5 (max) | Anthropic | 99.0% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | Claude Fable 5 (max) | Anthropic | 95.0% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | GPT-5.6 Sol (max) | OpenAI | 83.0% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 7 | Claude Sonnet 5 (max) | Anthropic | 77.0% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 8 | Tencent Hy4 preview (unknown) | Tencent | 75.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 9 | GPT-5.6 Luna (max) | OpenAI | 60.0% | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 10 | GPT-5.4 (xhigh) | OpenAI | 56.0% | $2.50 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 11 | Claude Opus 4.7 (max) | Anthropic | 54.0% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | Claude Opus 4.6 (max) | Anthropic | 50.0% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | GPT-5.5 (xhigh) | OpenAI | 50.0% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | GLM-5.3 (max) | Z.ai (Zhipu AI) | 49.0% | $0.070 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 15 | Claude Sonnet 4.6 (max) | Anthropic | 45.0% | $3.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 16 | Grok 4.5 (high) | xAI | 31.0% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 17 | Qwen3.7 Max | Alibaba | 26.0% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 18 | GLM-5.1 | Z.ai (Zhipu AI) | 22.2% | $1.05 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | mimo-v2.5-pro | Xiaomi Corp | 22.0% | $0.435 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 20 | GLM-5.3-Flash (max) | Z.ai (Zhipu AI) | 21.0% | $0.110 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 21 | GPT-5.4 mini (xhigh) | OpenAI | 21.0% | $0.750 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 22 | Gemini 3 Pro Preview | Google DeepMind | 20.0% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | GPT-5 (high) | OpenAI | 18.0% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 24 | MiniMax-M3 | MiniMax | 18.0% | $0.230 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 25 | Muse Spark | Meta AI | 17.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 26 | DeepSeek v4 Pro (max) | DeepSeek | 16.0% | $0.435 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 27 | Kimi K2.6 | Moonshot | 16.0% | $0.650 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 28 | mimo-v2.5 | Xiaomi Corp | 16.0% | $0.140 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 29 | GPT-5.2 (xhigh) | OpenAI | 15.0% | $1.75 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 30 | grok-4.20-0309-reasoning | xAI | 14.0% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 31 | GPT-5 nano (high) | OpenAI | 12.0% | $0.050 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 32 | grok-4.3 (high) | xAI | 11.0% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | GPT-5 mini (high) | OpenAI | 9.0% | $0.250 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 34 | GPT-5.1-Codex-Max | OpenAI | 9.0% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 35 | Mistral Medium 3.5 | Mistral AI | 9.0% | $1.50 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 36 | DeepSeek-V3.2 (Thinking; Fireworks) | DeepSeek | 8.0% | $0.259 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 37 | GLM-4.7 | Z.ai (Zhipu AI) | 6.0% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 38 | grok-4-1-fast-reasoning | xAI | 4.0% | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 39 | MiniMax-M2.5 | MiniMax | 4.0% | $0.270 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 40 | MiniMax-M2.7 | MiniMax | 3.0% | $0.210 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 41 | nemotron-3-ultra | Nvidia | 2.0% | $0.500 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 42 | Laguna M.1 | Poolside | 0.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 43 | Laguna XS.2 | Poolside | 0.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to GPT-5.6 Luna (max) at $0.200 per million input tokens (score 60.0%).
What ProofBench measures
ProofBench measures writing mathematical proofs.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0). Scores were last captured 2026-10-05; the Captured column gives each row's date.