WebDev Arena leaderboard: which LLMs score highest
WebDev Arena (building web apps, crowd-voted (Elo)) currently has scores for 63 models. The top score is 1,820 by Claude Opus 5.5 (max); the median model scores 1,399 and the lowest scores 1,149.
| # | Model | Organisation | WebDev Arena score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 (max) | Anthropic | 1,820 | $4.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | GPT-6 Astra (max) | OpenAI | 1,800 | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | GPT-6.1 Sol (max) | OpenAI | 1,759 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | Claude Fable 5.1 (max) | Anthropic | 1,758 | $10.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | GPT-6 Sol (max) | OpenAI | 1,689 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | Claude Opus 5 (max) | Anthropic | 1,687 | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 7 | Kimi K3 (max) | Moonshot | 1,674 | $1.29 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 8 | Muse Spark 1.3 (max) | Meta AI | 1,652 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 9 | GLM-5.3 (max) | Z.ai (Zhipu AI) | 1,614 | $0.070 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 10 | deepseek-v4.1-flash-max | DeepSeek | 1,614 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 11 | Gemini 3.7 Flash (high) | Google DeepMind | 1,587 | $0.750 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | GPT-6 Luna (max) | OpenAI | 1,582 | $0.100 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | Gemini 3.8 Flash (high) | Google DeepMind | 1,568 | $0.750 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | Muse Spark 1.2 (xhigh) | Meta AI | 1,534 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 15 | Qwen3.7 Max | Alibaba | 1,517 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 16 | Muse Spark | Meta AI | 1,513 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 17 | GPT-5.5 (xhigh) | OpenAI | 1,510 | $5.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 18 | Kimi K2.6 | Moonshot | 1,509 | $0.650 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | GLM-5.1 | Z.ai (Zhipu AI) | 1,508 | $1.05 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 20 | MiniMax-M3 | MiniMax | 1,487 | $0.230 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 21 | Qwen 3.6 Max (Preview) | Alibaba | 1,479 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 22 | mimo-v2.5-pro | Xiaomi Corp | 1,475 | $0.435 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | Kimi K2.7 Code | Moonshot | 1,473 | $0.671 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 24 | Qwen 3.6 Plus (2026-04-02) | Alibaba | 1,461 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 25 | Gemini 3 Pro Preview | Google DeepMind | 1,439 | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 26 | mimo-v2.5 | Xiaomi Corp | 1,437 | $0.140 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 27 | Kimi K2.5 | Moonshot | 1,436 | $0.450 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 28 | GLM-5 | Z.ai (Zhipu AI) | 1,436 | $0.600 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 29 | GLM-4.7 | Z.ai (Zhipu AI) | 1,435 | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 30 | mimo-v2-pro | Xiaomi Corp | 1,433 | $1.10 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 31 | Kimi K2.5 (instant) | Moonshot | 1,406 | $0.450 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 32 | Qwen3.5 Plus | Alibaba | 1,399 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | MiniMax-M2.7 | MiniMax | 1,398 | $0.210 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 34 | Claude Opus 4.1 (unknown thinking) | Anthropic | 1,389 | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 35 | MiniMax-M2.1 | MiniMax | 1,387 | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 36 | claude-opus-4-1-20250805 | Anthropic | 1,386 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 37 | MiniMax-M2.5 | MiniMax | 1,384 | $0.270 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 38 | grok-4-20 | xAI | 1,374 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 39 | Gemma 4 31B IT | Google DeepMind | 1,364 | $0.100 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 40 | Gemma 4 26B A4B | Google DeepMind | 1,361 | $0.076 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 41 | Qwen3.5 27B | Alibaba | 1,357 | $0.195 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 42 | Laguna M.1 | Poolside | 1,347 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 43 | GLM-4.6 | Z.ai (Zhipu AI),Tsinghua University | 1,341 | $0.430 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 44 | GPT-5.2 Codex | OpenAI | 1,339 | $1.75 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 45 | Kimi K2 Thinking Turbo | Moonshot | 1,337 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 46 | GPT-5.1 Codex | OpenAI | 1,336 | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 47 | MiMo-V2-Flash | XiaomiMiMo | 1,331 | $0.110 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 48 | DeepSeek-V3.2 (Thinking; Novita) | DeepSeek | 1,325 | $0.259 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 49 | Laguna XS.2 | Poolside | 1,302 | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 50 | MiniMax-M2 | MiniMax | 1,298 | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to GLM-5.3 (max) at $0.070 per million input tokens (score 1,614).
What WebDev Arena measures
WebDev Arena asks two anonymous models to build the same web app and lets users vote on the better result; the ratings are Elo-style.
How to read these scores
Scores are Elo-style ratings (higher is better). Only differences between models mean anything, and small gaps may sit inside the source's own margin of error. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0). Scores were last captured 2026-10-05; the Captured column gives each row's date.