LMArena Search Elo leaderboard: which LLMs score highest

LMArena Search Elo (crowd-voted web-search answers) currently has scores for 28 models. The top score is 1,253 by claude-opus-4-6-search; the median model scores 1,176 and the lowest scores 1,006.

LMArena Search Elo leaderboard: top 28 of 28 models (highest-effort row per model)
#ModelOrganisationLMArena Search Elo scoreCheapest input $/MSourceCaptured
1claude-opus-4-6-searchAnthropic1,253โ€”LMArena2026-10-05
2gpt-5.5-searchOpenAI1,242โ€”LMArena2026-10-05
3ernie-5.1โ€”1,227$0.563LMArena2026-10-05
4claude-sonnet-4-6-searchAnthropic1,221โ€”LMArena2026-10-05
5gemini-3.1-pro-groundingGoogle1,210โ€”LMArena2026-10-05
6gemini-3-pro-groundingGoogle1,207โ€”LMArena2026-10-05
7gpt-5.2-searchOpenAI1,207โ€”LMArena2026-10-05
8grok-4.20-multi-agent-beta-0309xAI1,204$1.25LMArena2026-10-05
9gpt-5.1-searchOpenAI1,199โ€”LMArena2026-10-05
10gemini-3-flash-groundingGoogle1,198โ€”LMArena2026-10-05
11gpt-5.4-searchOpenAI1,197โ€”LMArena2026-10-05
12claude-sonnet-5-searchAnthropic1,194โ€”LMArena2026-10-05
13grok-4.20-beta1xAI1,189โ€”LMArena2026-10-05
14claude-opus-4-5-searchAnthropic1,180โ€”LMArena2026-10-05
15gpt-5.2-search-non-reasoningOpenAI1,172โ€”LMArena2026-10-05
16grok-4-1-fast-searchxAI1,171โ€”LMArena2026-10-05
17grok-4-fast-searchxAI1,171โ€”LMArena2026-10-05
18claude-sonnet-4-5-searchAnthropic1,158โ€”LMArena2026-10-05
19claude-opus-4-1-searchAnthropic1,148โ€”LMArena2026-10-05
20o3-searchOpenAI1,144โ€”LMArena2026-10-05
21gemini-2.5-pro-groundingGoogle1,142โ€”LMArena2026-10-05
22grok-4-searchxAI1,142โ€”LMArena2026-10-05
23ppl-sonar-reasoning-pro-highโ€”1,139โ€”LMArena2026-10-05
24gpt-5-searchOpenAI1,133โ€”LMArena2026-10-05
25ppl-sonar-pro-highโ€”1,130โ€”LMArena2026-10-05
26claude-opus-4-searchAnthropic1,126โ€”LMArena2026-10-05
27diffbot-small-xlโ€”1,023โ€”LMArena2026-10-05
28api-gpt-4o-searchโ€”1,006โ€”LMArena2026-10-05

Compare all benchmarks side by side on the live leaderboard โ†’

What LMArena Search Elo measures

LMArena Search Elo measures crowd-voted web-search answers.

How to read these scores

Scores are Elo-style ratings (higher is better). Only differences between models mean anything, and small gaps may sit inside the source's own margin of error. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.

Where the data comes from

LMArena (third-party snapshot 2026-10-05). Scores were last captured 2026-10-05; the Captured column gives each row's date.