MMLU-Pro leaderboard: which LLMs score highest
MMLU-Pro (57-subject knowledge + reasoning) currently has scores for 136 models. The top score is 88.1% by Darwin-180B-RSI; the median model scores 55.3% and the lowest scores 10.8%.
| # | Model | Organisation | MMLU-Pro score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | Darwin-180B-RSI | FINAL-Bench | 88.1% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 2 | Intern-S2-Preview | internlm | 88.0% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 3 | MiniMax-M2.1 | MiniMax | 88.0% | $0.300 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 4 | Qwen3.5 397B-A17B | Alibaba | 87.8% | $0.164 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 5 | Kimi K2.5 | Moonshot | 87.1% | $0.450 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 6 | NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 | nvidia | 86.8% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 7 | NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 | nvidia | 86.8% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 8 | Qwen3.5-122B-A10B | Qwen | 86.7% | $0.113 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 9 | Qwen3.6 27B | Alibaba | 86.2% | $0.150 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 10 | Solar-Open2-250B | upstage | 86.2% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 11 | Qwen3.5 27B | Alibaba | 86.1% | $0.195 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 12 | GLM-5 | Z.ai (Zhipu AI) | 86.0% | $0.600 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 13 | Qwen3.6 35B-A3B | Alibaba | 85.2% | $0.050 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 14 | DeepSeek R1 (0528) | deepseek-ai | 85.0% | $0.400 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 15 | glm-4.5 | Z.ai (Zhipu AI),Tsinghua University | 84.6% | $0.400 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 16 | Step-3.5-Flash | stepfun-ai | 84.4% | $0.100 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 17 | DeepSeek-R1 | DeepSeek | 84.0% | $0.400 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 18 | K-EXAONE-236B-A23B | LGAI-EXAONE | 83.8% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 19 | NVIDIA-Nemotron-3-Super-120B-A12B-BF16 | nvidia | 83.7% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 20 | Intern-S1 | internlm | 83.5% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 21 | EXAONE-4.5-33B | LGAI-EXAONE | 83.3% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 22 | Qwen3-235B-A22B-Instruct-2507 | Alibaba | 83.0% | $0.087 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 23 | LongCat-Flash-Chat | meituan-longcat | 82.7% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 24 | seed-oss-36b-instruct | ByteDance-Seed | 82.7% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 25 | MiniMax-M2 | MiniMax | 82.0% | $0.300 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 26 | NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 | nvidia | 81.9% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 27 | NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 | nvidia | 81.6% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 28 | A.X-K1 | skt | 81.5% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 29 | GLM-4.5-Air | Z.ai (Zhipu AI),Tsinghua University | 81.4% | $0.125 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 30 | DeepSeek V3 0324 | DeepSeek | 81.2% | $0.200 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 31 | MiniMax-M1-40k | MiniMaxAI | 81.1% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 32 | JoyAI-LLM-Flash | jdopensource | 81.0% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 33 | Kimi K2 Instruct | Moonshot | 81.0% | $0.500 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 34 | qwen3-30b-a3b-thinking-2507 | Alibaba | 80.9% | $0.200 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 35 | MiniMax-M2.5 | MiniMax | 80.1% | $0.270 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 36 | ERNIE-4.5-300B-A47B-PT | baidu | 78.4% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 37 | LongCat-Flash-Lite | meituan-longcat | 78.3% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 38 | MiniMax-Text-01 | MiniMaxAI | 75.7% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 39 | Qwen2.5-72B | Alibaba | 71.6% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 40 | phi-4 | Microsoft Research | 70.4% | $0.070 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 41 | qwen3-4b-instruct-2507 | Qwen | 69.6% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 42 | ERNIE-4.5-300B-A47B-Base-PT | baidu | 69.5% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 43 | Qwen2.5-32B | Alibaba | 69.2% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 44 | mimo-v2.5-pro | Xiaomi Corp | 68.5% | $0.435 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 45 | qwen3-235b-a22b | Alibaba | 68.2% | $0.180 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 46 | Mistral-Large-Instruct-2411 | mistralai | 67.9% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 47 | Hunyuan-A13B-Instruct | tencent | 67.3% | $0.140 | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 48 | Mistral-Large-Instruct-2407 | mistralai | 65.9% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 49 | DeepSeek-V2.5 | deepseek-ai | 65.8% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
| 50 | NVIDIA-Nemotron-3-Nano-30B-A3B-Base-BF16 | nvidia | 65.1% | β | HuggingFace MMLU-Pro leaderboard | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard β
Among the ten highest scorers, the cheapest listed API price belongs to Qwen3.5-122B-A10B at $0.113 per million input tokens (score 86.7%).
What MMLU-Pro measures
MMLU-Pro extends MMLU with harder, more reasoning-heavy questions and ten answer options instead of four. That lowers the chance of guessing and makes small score gaps more meaningful than on the original MMLU.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
HuggingFace MMLU-Pro leaderboard. Scores were last captured 2026-10-05; the Captured column gives each row's date.