Terminal-Bench 4.0 leaderboard: which LLMs score highest

Terminal-Bench 4.0 (real terminal tasks, agent+model config) currently has scores for 15 models. The top score is 58.2% by Codex + GPT-6 Astra; the median model scores 23.6% and the lowest scores 11.2%.

Terminal-Bench 4.0 leaderboard: top 15 of 15 models (highest-effort row per model)
#ModelOrganisationTerminal-Bench 4.0 scoreCheapest input $/MSourceCaptured
1Codex + GPT-6 Astraโ€”58.2%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
2Claude Code + Fable 5.1โ€”57.9%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
3Claude Code + Opus 5โ€”53.9%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
4Claude Code + Fable 5โ€”44.5%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
5Claude Code + GLM-5.3โ€”41.8%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
6Grok Build + Grok 4.7โ€”37.6%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
7Codex + GPT-5.6 Solโ€”37.3%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
8Claude Code + Opus 4.8โ€”23.6%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
9Codex + GPT-5.6 Terraโ€”21.5%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
10Grok Build + Grok 4.6โ€”20.3%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
11mini-SWE-agent + Gemini 3.8 Flashโ€”19.1%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
12Codex + GPT-5.6 Lunaโ€”17.3%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
13Claude Code + Sonnet 5โ€”12.4%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
14Grok Build + Grok 4.5โ€”12.4%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05
15mini-SWE-agent + Gemini 3.7 Flashโ€”11.2%โ€”Terminal-Bench 4.0 official leaderboard2026-10-05

Compare all benchmarks side by side on the live leaderboard โ†’

What Terminal-Bench 4.0 measures

Terminal-Bench tests agents on real tasks in a command-line environment. Scores depend on both the model and the agent harness around it.

How to read these scores

Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.

Where the data comes from

Terminal-Bench 4.0 official leaderboard. Scores were last captured 2026-10-05; the Captured column gives each row's date.