WeirdML leaderboard: which LLMs score highest
WeirdML (unusual machine-learning tasks) currently has scores for 112 models. The top score is 93.6% by GPT-6 Astra (pro, max); the median model scores 41.8% and the lowest scores 1.7%.
| # | Model | Organisation | WeirdML score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra (pro, max) | OpenAI | 93.6% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | GPT-6 Astra (max) | OpenAI | 93.3% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | Claude Fable 5.1 (max) | Anthropic | 92.9% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | Claude Fable 5 (max) | Anthropic | 91.9% | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | Claude Opus 5 (max) | Anthropic | 91.8% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | GPT-5.6 Sol (pro, max) | OpenAI | 89.4% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 7 | GPT-5.6 Sol (max) | OpenAI | 87.0% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 8 | GPT-5.5 (xhigh) | OpenAI | 84.9% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 9 | Kimi K3 (max) | Moonshot | 82.6% | $1.29 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 10 | GPT-5.3 Codex (xhigh) | OpenAI | 77.9% | $1.75 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 11 | GPT-5.4 (xhigh) | OpenAI | 77.7% | $2.50 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | Claude Opus 4.7 (max) | Anthropic | 75.5% | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | GLM-5.3 (max) | Z.ai (Zhipu AI) | 75.4% | $0.070 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | GPT-5.2 (xhigh) | OpenAI | 72.2% | $1.75 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 15 | Gemini 3 Pro Preview | Google DeepMind | 69.9% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 16 | DeepSeek V4 Pro 0813 (max) | DeepSeek | 66.2% | $0.660 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 17 | DeepSeek V4 Flash 0731 (max) | DeepSeek | 63.0% | $0.015 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 18 | GPT-5.1 (high) | OpenAI | 60.8% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | GPT-5 (high) | OpenAI | 60.7% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 20 | GPT-5 Pro | OpenAI | 60.4% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 21 | Muse Spark 1.2 (xhigh) | Meta AI | 60.3% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 22 | o3-pro-2025-06-10 (high) | OpenAI | 58.2% | $20.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | GLM-5.1 | Z.ai (Zhipu AI) | 57.1% | $1.05 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 24 | Kimi K2.6 | Moonshot | 55.9% | $0.650 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 25 | GPT-5-codex (high) | OpenAI | 54.5% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 26 | Kimi K2.7 Code | Moonshot | 54.1% | $0.671 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 27 | gemini-2.5-pro_16K | Google DeepMind | 54.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 28 | GPT-5 mini (high) | OpenAI | 52.7% | $0.250 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 29 | o4-mini (high) | OpenAI | 52.6% | $1.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 30 | o3 (high) | OpenAI | 52.4% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 31 | Gemma 4 31B IT | Google DeepMind | 52.3% | $0.100 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 32 | grok-4-20 | xAI | 52.3% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | DeepSeek v4 Pro (max) | DeepSeek | 48.9% | $0.435 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 34 | GLM-5 | Z.ai (Zhipu AI) | 48.2% | $0.600 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 35 | gpt-oss-120b (high) | OpenAI | 48.2% | $0.030 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 36 | o1-preview | OpenAI | 47.6% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 37 | DeepSeek-V3.2-Speciale | DeepSeek | 46.7% | $0.580 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 38 | claude-sonnet-4-20250514_16K | Anthropic | 46.1% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 39 | o1 (high) | OpenAI | 46.1% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 40 | claude-opus-4-1-20250805_16K | Anthropic | 45.9% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 41 | grok-4-0709 | xAI | 45.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 42 | DeepSeek v4 Flash (max) | DeepSeek | 45.6% | $0.090 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 43 | Kimi K2.5 | Moonshot | 45.6% | $0.450 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 44 | claude-haiku-4-5-20251001 | Anthropic | 45.4% | $1.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 45 | claude-haiku-4-5-20251001_16K | Anthropic | 44.1% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 46 | claude-sonnet-4-20250514 | Anthropic | 43.9% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 47 | Claude Opus 4 | Anthropic | 43.7% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 48 | Mistral Medium 3.5 | Mistral AI | 43.7% | $1.50 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 49 | o3-mini (high) | OpenAI | 43.7% | $1.10 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 50 | nemotron-3-ultra | Nvidia | 43.5% | $0.500 | Epoch AI Benchmarking Hub | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to Kimi K3 (max) at $1.29 per million input tokens (score 82.6%).
What WeirdML measures
WeirdML measures unusual machine-learning tasks.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0). Scores were last captured 2026-10-05; the Captured column gives each row's date.