LMArena Search Elo leaderboard: which LLMs score highest
LMArena Search Elo (crowd-voted web-search answers) currently has scores for 28 models. The top score is 1,253 by claude-opus-4-6-search; the median model scores 1,176 and the lowest scores 1,006.
| # | Model | Organisation | LMArena Search Elo score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | claude-opus-4-6-search | Anthropic | 1,253 | โ | LMArena | 2026-10-05 |
| 2 | gpt-5.5-search | OpenAI | 1,242 | โ | LMArena | 2026-10-05 |
| 3 | ernie-5.1 | โ | 1,227 | $0.563 | LMArena | 2026-10-05 |
| 4 | claude-sonnet-4-6-search | Anthropic | 1,221 | โ | LMArena | 2026-10-05 |
| 5 | gemini-3.1-pro-grounding | 1,210 | โ | LMArena | 2026-10-05 | |
| 6 | gemini-3-pro-grounding | 1,207 | โ | LMArena | 2026-10-05 | |
| 7 | gpt-5.2-search | OpenAI | 1,207 | โ | LMArena | 2026-10-05 |
| 8 | grok-4.20-multi-agent-beta-0309 | xAI | 1,204 | $1.25 | LMArena | 2026-10-05 |
| 9 | gpt-5.1-search | OpenAI | 1,199 | โ | LMArena | 2026-10-05 |
| 10 | gemini-3-flash-grounding | 1,198 | โ | LMArena | 2026-10-05 | |
| 11 | gpt-5.4-search | OpenAI | 1,197 | โ | LMArena | 2026-10-05 |
| 12 | claude-sonnet-5-search | Anthropic | 1,194 | โ | LMArena | 2026-10-05 |
| 13 | grok-4.20-beta1 | xAI | 1,189 | โ | LMArena | 2026-10-05 |
| 14 | claude-opus-4-5-search | Anthropic | 1,180 | โ | LMArena | 2026-10-05 |
| 15 | gpt-5.2-search-non-reasoning | OpenAI | 1,172 | โ | LMArena | 2026-10-05 |
| 16 | grok-4-1-fast-search | xAI | 1,171 | โ | LMArena | 2026-10-05 |
| 17 | grok-4-fast-search | xAI | 1,171 | โ | LMArena | 2026-10-05 |
| 18 | claude-sonnet-4-5-search | Anthropic | 1,158 | โ | LMArena | 2026-10-05 |
| 19 | claude-opus-4-1-search | Anthropic | 1,148 | โ | LMArena | 2026-10-05 |
| 20 | o3-search | OpenAI | 1,144 | โ | LMArena | 2026-10-05 |
| 21 | gemini-2.5-pro-grounding | 1,142 | โ | LMArena | 2026-10-05 | |
| 22 | grok-4-search | xAI | 1,142 | โ | LMArena | 2026-10-05 |
| 23 | ppl-sonar-reasoning-pro-high | โ | 1,139 | โ | LMArena | 2026-10-05 |
| 24 | gpt-5-search | OpenAI | 1,133 | โ | LMArena | 2026-10-05 |
| 25 | ppl-sonar-pro-high | โ | 1,130 | โ | LMArena | 2026-10-05 |
| 26 | claude-opus-4-search | Anthropic | 1,126 | โ | LMArena | 2026-10-05 |
| 27 | diffbot-small-xl | โ | 1,023 | โ | LMArena | 2026-10-05 |
| 28 | api-gpt-4o-search | โ | 1,006 | โ | LMArena | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard โ
What LMArena Search Elo measures
LMArena Search Elo measures crowd-voted web-search answers.
How to read these scores
Scores are Elo-style ratings (higher is better). Only differences between models mean anything, and small gaps may sit inside the source's own margin of error. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
LMArena (third-party snapshot 2026-10-05). Scores were last captured 2026-10-05; the Captured column gives each row's date.