Aider Polyglot leaderboard: which LLMs score highest
Aider Polyglot (edits across 6 languages (225 exercises)) currently has scores for 49 models. The top score is 83.1% by gemini-2.5-pro-preview-06-05; the median model scores 44.9% and the lowest scores 3.6%.
| # | Model | Organisation | Aider Polyglot score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | gemini-2.5-pro-preview-06-05 | 83.1% | $1.25 | Aider polyglot leaderboard | 2026-10-05 | |
| 2 | Grok 4 | xAI | 79.6% | $3.00 | Aider polyglot leaderboard | 2026-10-05 |
| 3 | o3 + gpt-4.1 | โ | 78.2% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 4 | Gemini 2.5 Pro Preview 05-06 | 76.9% | โ | Aider polyglot leaderboard | 2026-10-05 | |
| 5 | Gemini 2.5 Pro Preview 03-25 | 72.9% | โ | Aider polyglot leaderboard | 2026-10-05 | |
| 6 | claude-opus-4-20250514 | Anthropic | 72.0% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 7 | DeepSeek R1 (0528) | deepseek-ai | 71.4% | $0.400 | Aider polyglot leaderboard | 2026-10-05 |
| 8 | claude-3-7-sonnet-20250219 | Anthropic | 64.9% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 9 | DeepSeek R1 + claude-3-5-sonnet-20241022 | โ | 64.0% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 10 | o1-2024-12-17 | OpenAI | 61.7% | $15.00 | Aider polyglot leaderboard | 2026-10-05 |
| 11 | claude-sonnet-4-20250514 | Anthropic | 61.3% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 12 | Qwen3 235B A22B diff, no think, Alibaba API | Alibaba | 59.6% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 13 | Kimi K2 | Moonshot AI | 59.1% | $0.550 | Aider polyglot leaderboard | 2026-10-05 |
| 14 | DeepSeek-R1 | DeepSeek | 56.9% | $0.400 | Aider polyglot leaderboard | 2026-10-05 |
| 15 | DeepSeek V3 0324 | DeepSeek | 55.1% | $0.200 | Aider polyglot leaderboard | 2026-10-05 |
| 16 | gemini-2.5-flash-preview-05-20 | Google DeepMind | 55.1% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 17 | Quasar Alpha | โ | 54.7% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 18 | grok-3-beta | xAI | 53.3% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 19 | Optimus Alpha | โ | 52.9% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 20 | GPT-4.1 | OpenAI | 52.4% | $2.00 | Aider polyglot leaderboard | 2026-10-05 |
| 21 | Claude 3.5-Sonnet-20241022 | Anthropic | 51.6% | $3.00 | Aider polyglot leaderboard | 2026-10-05 |
| 22 | DeepSeek Chat V3 (prev) | DeepSeek | 48.4% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 23 | gemini-2.5-flash-preview-04-17 | 47.1% | โ | Aider polyglot leaderboard | 2026-10-05 | |
| 24 | chatgpt-4o-latest (2025-03-29) | OpenAI | 45.3% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 25 | gpt-4.5-preview | OpenAI | 44.9% | $75.00 | Aider polyglot leaderboard | 2026-10-05 |
| 26 | Qwen3-32B | Alibaba | 40.0% | $0.080 | Aider polyglot leaderboard | 2026-10-05 |
| 27 | gemini-exp-1206 | Google DeepMind,Google | 38.2% | $0.300 | Aider polyglot leaderboard | 2026-10-05 |
| 28 | Gemini 2.0 Pro exp-02-05 | 35.6% | โ | Aider polyglot leaderboard | 2026-10-05 | |
| 29 | o1-mini-2024-09-12 | OpenAI | 32.9% | $1.10 | Aider polyglot leaderboard | 2026-10-05 |
| 30 | GPT-4.1 mini | OpenAI | 32.4% | $0.400 | Aider polyglot leaderboard | 2026-10-05 |
| 31 | claude-3-5-haiku-20241022 | Anthropic | 28.0% | $1.00 | Aider polyglot leaderboard | 2026-10-05 |
| 32 | chatgpt-4o-latest (2025-02-15) | OpenAI | 27.1% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 33 | QwQ-32B + Qwen 2.5 Coder Instruct | โ | 26.2% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 34 | gpt-4o-2024-08-06 | OpenAI | 23.1% | $2.50 | Aider polyglot leaderboard | 2026-10-05 |
| 35 | gemini-2.0-flash-exp | Google DeepMind,Google | 22.2% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 36 | qwen-max-2025-01-25 | Alibaba | 21.8% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 37 | QwQ-32B | Alibaba | 20.9% | $0.150 | Aider polyglot leaderboard | 2026-10-05 |
| 38 | gemini-2.0-flash-thinking-exp-01-21 | 18.2% | โ | Aider polyglot leaderboard | 2026-10-05 | |
| 39 | gpt-4o-2024-11-20 | OpenAI | 18.2% | $2.50 | Aider polyglot leaderboard | 2026-10-05 |
| 40 | DeepSeek Chat V2.5 | DeepSeek | 17.8% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 41 | Qwen2.5 Coder 32B Instruct | Qwen | 16.4% | $0.060 | Aider polyglot leaderboard | 2026-10-05 |
| 42 | Llama 4 Maverick | Meta AI | 15.6% | $0.188 | Aider polyglot leaderboard | 2026-10-05 |
| 43 | yi-lightning | โ | 12.9% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 44 | command-a-03-2025-quality | Cohere | 12.0% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 45 | Codestral 25.01 | Mistral AI | 11.1% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 46 | openhands-lm-32b-v0.1 | โ | 10.2% | โ | Aider polyglot leaderboard | 2026-10-05 |
| 47 | GPT-4.1 nano | OpenAI | 8.9% | $0.100 | Aider polyglot leaderboard | 2026-10-05 |
| 48 | gemma-3-27b-it | Google DeepMind | 4.9% | $0.080 | Aider polyglot leaderboard | 2026-10-05 |
| 49 | gpt-4o-mini-2024-07-18 | OpenAI | 3.6% | $0.150 | Aider polyglot leaderboard | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard โ
Among the ten highest scorers, the cheapest listed API price belongs to DeepSeek R1 (0528) at $0.400 per million input tokens (score 71.4%).
What Aider Polyglot measures
Aider's polyglot benchmark gives a model 225 hard Exercism exercises in C++, Go, Java, JavaScript, Python and Rust and checks whether its code edits make the tests pass.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Aider polyglot leaderboard. Scores were last captured 2026-10-05; the Captured column gives each row's date.