Aider Code Editing leaderboard: which LLMs score highest
Aider Code Editing (Aider official benchmark) currently has scores for 92 models. The top score is 84.2% by Claude 3.5-Sonnet-20241022; the median model scores 55.6% and the lowest scores 14.3%.
| # | Model | Organisation | Aider Code Editing score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | Claude 3.5-Sonnet-20241022 | Anthropic | 84.2% | $3.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 2 | gemini-exp-1206 | Google DeepMind,Google | 80.5% | $0.300 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 3 | o1-preview | OpenAI | 79.7% | $15.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 4 | claude-3.5-sonnet-20240620 | Anthropic | 77.4% | $3.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 5 | claude-3-5-haiku-20241022 | Anthropic | 75.2% | $1.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 6 | DeepSeek Coder V2 0724 | DeepSeek | 72.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 7 | gpt-4o-2024-05-13 | OpenAI | 72.9% | $5.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 8 | ollama/qwen2.5-coder:32b | Alibaba | 72.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 9 | DeepSeek-V2.5 | deepseek-ai | 72.2% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 10 | DeepSeek-V2.5-1210 | DeepSeek | 72.2% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 11 | openai/chatgpt-4o-latest | OpenAI | 72.2% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 12 | gpt-4o-2024-08-06 | OpenAI | 71.4% | $2.50 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 13 | gpt-4o-2024-11-20 | OpenAI | 71.4% | $2.50 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 14 | Qwen2.5 Coder 32B Instruct | Qwen | 71.4% | $0.060 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 15 | DeepSeek Chat V2 0628 | DeepSeek | 69.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 16 | gemini-2.0-flash-exp | Google DeepMind,Google | 69.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 17 | Qwen2.5-Coder-14B-Instruct | Alibaba | 69.2% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 18 | claude-3-opus-20240229 | Anthropic | 68.4% | $15.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 19 | GPT-4 (0613) | OpenAI | 67.7% | $30.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 20 | Dracarys2-72B-Instruct | β | 66.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 21 | gemini-1.5-pro-exp-0827 | 66.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 | |
| 22 | gpt-4-0125-preview | OpenAI | 66.2% | $10.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 23 | gpt-4-0314 | OpenAI | 66.2% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 24 | Llama-3.1-405B-Instruct | Meta AI | 66.2% | $3.50 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 25 | gemini-1.5-pro-002 | Google DeepMind | 65.4% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 26 | gpt-4-1106-preview | OpenAI | 65.4% | $10.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 27 | mistral-large-2411 | Mistral AI | 65.4% | $2.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 28 | openrouter/qwen/qwen-2.5-coder-32b-instruct | Alibaba | 65.4% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 29 | qwen-2.5-72b-instruct | Alibaba | 65.4% | $0.380 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 30 | yi-lightning | β | 65.4% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 31 | gpt-4-turbo-2024-04-09 | OpenAI | 63.9% | $10.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 32 | nousresearch/hermes-3-llama-3.1-405b | β | 63.9% | $1.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 33 | ollama/Qwen2.5.1-Coder-7B-Instruct-GGUF:Q8_0-32k | Alibaba | 63.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 34 | ollama/qwen2.5-coder:14b | Alibaba | 61.7% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 35 | gemini-exp-1114 | 60.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 | |
| 36 | Mistral Large 2 (2407) | Mistral AI | 60.2% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 37 | Llama-3.3-70B-Instruct | Meta AI | 59.4% | $0.120 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 38 | Grok-2 | xAI | 58.6% | $2.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 39 | Llama-3.1-70B-Instruct | Meta AI | 58.6% | $0.400 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 40 | ollama/qwen2.5:32b-instruct-q8_0 | Alibaba | 58.6% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 41 | gemini-exp-1121 | 57.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 | |
| 42 | gpt-3.5-turbo-0301 | OpenAI | 57.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 43 | Qwen2.5-Coder-7B-Instruct | Alibaba | 57.9% | $0.010 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 44 | gemini-1.5-pro-001 | Google DeepMind | 57.1% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 45 | gpt-3.5-turbo-1106 | OpenAI | 56.1% | $1.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 46 | GPT-4o mini | OpenAI | 55.6% | $0.150 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 47 | qwen2-72b-instruct | Alibaba | 55.6% | $0.900 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 48 | claude-3-sonnet-20240229 | Anthropic | 54.9% | $3.00 | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 49 | Grok-2-mini | xAI | 54.9% | β | Aider Aider Code Editing leaderboard | 2026-10-05 |
| 50 | Llama-3.1-Nemotron-70B-Instruct-HF | NVIDIA | 54.9% | $0.880 | Aider Aider Code Editing leaderboard | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard β
Among the ten highest scorers, the cheapest listed API price belongs to gemini-exp-1206 at $0.300 per million input tokens (score 80.5%).
What Aider Code Editing measures
Aider's code-editing benchmark measures how reliably a model can change existing code by emitting edits that the Aider tool can apply, then running the exercise tests.
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Aider Aider Code Editing leaderboard. Scores were last captured 2026-10-05; the Captured column gives each row's date.