Fiction.liveBench leaderboard: which LLMs score highest
Fiction.liveBench (long-context story comprehension (16k)) currently has scores for 47 models. The top score is 94.4% by grok-4-0709; the median model scores 61.1% and the lowest scores 25.0%.
| # | Model | Organisation | Fiction.liveBench score | Cheapest input $/M | Source | Captured |
|---|---|---|---|---|---|---|
| 1 | grok-4-0709 | xAI | 94.4% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 2 | grok-4-fast | xAI | 94.4% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 3 | Gemini 2.5 Pro Preview (Jun 2025) | Google DeepMind | 91.7% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 4 | Kimi K2.5 | Moonshot | 86.1% | $0.450 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 5 | DeepSeek-V3.2-Exp (high) | DeepSeek | 83.3% | $0.270 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 6 | QwQ-32B | Alibaba | 83.3% | $0.150 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 7 | gemini-2.5-flash-preview-05-20 | Google DeepMind | 77.8% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 8 | DeepSeek-R1 (May 2025) | DeepSeek | 75.0% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 9 | Qwen3-235B-A22B-Thinking-2507 | Alibaba | 75.0% | $0.230 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 10 | Qwen3-32B | Alibaba | 74.2% | $0.080 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 11 | DeepSeek-R1 | DeepSeek | 69.4% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 12 | MiniMax-M1-80k | MiniMax | 69.4% | $0.550 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 13 | qwen3-235b-a22b | Alibaba | 67.7% | $0.180 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 14 | chatgpt-4o-01-29-2025 | OpenAI | 66.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 15 | Gemini 2.5 Pro Exp (Mar 2025) | Google DeepMind | 66.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 16 | Gemini 2.5 Pro Preview (Mar 2025) | Google DeepMind | 66.7% | $1.25 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 17 | Kimi-K2-Instruct-0905 | Moonshot | 66.7% | $0.500 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 18 | qwen-max-2025-01-25 | Alibaba | 66.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 19 | Qwen3-Max-Instruct | Alibaba | 66.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 20 | GPT-4.1 | OpenAI | 63.9% | $2.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 21 | GPT-4.5 Preview (Feb 2025) | OpenAI | 63.9% | $75.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 22 | qwen3-14b | Alibaba | 62.5% | $0.080 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 23 | qwen3-8b | Alibaba | 62.1% | $0.040 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 24 | Claude Opus 4 | Anthropic | 61.1% | $15.00 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 25 | Gemini 2.0 Flash (Feb 2025) | Google DeepMind,Google | 61.1% | $0.150 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 26 | Kimi K2 Instruct | Moonshot | 61.1% | $0.500 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 27 | GLM-4.5-FP8 | Z.ai | 58.3% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 28 | grok-3-beta | xAI | 58.3% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 29 | Qwen3-Next-80B-A3B-Instruct | Alibaba | 55.6% | $0.090 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 30 | parasail-qwen3-235b-a22b-instruct-2507 | Alibaba | 52.9% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 31 | DeepSeek-V3.1 | DeepSeek | 52.8% | $0.250 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 32 | Gemini 2.0 Flash Thinking Exp | Google DeepMind,Google | 52.8% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 33 | claude-3-7-sonnet-20250219 | Anthropic | 50.0% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 34 | DeepSeek-V3 (Mar 2025) | DeepSeek | 50.0% | $0.200 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 35 | Gemini 2.5 Flash Preview (Apr 2025) | Google DeepMind | 47.2% | $0.300 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 36 | gemini-2.5-flash-lite-preview-06-17 (Default thinking length) | Google DeepMind | 47.2% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 37 | claude-sonnet-4-20250514 | Anthropic | 46.9% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 38 | Llama-4-Maverick-17B-128E-Instruct | Meta AI | 46.2% | $0.630 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 39 | GPT-4.1 mini | OpenAI | 44.4% | $0.400 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 40 | gpt-oss-120b (high) | OpenAI | 44.4% | $0.030 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 41 | Gemini 2.0 Pro Exp (Feb 2025) | Google DeepMind | 41.7% | — | Epoch AI Benchmarking Hub | 2026-10-05 |
| 42 | Qwen3-30B-A3B | Alibaba | 40.6% | $0.090 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 43 | Llama-4-Scout-17B-16E-Instruct | Meta AI | 36.0% | $0.050 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 44 | gemma-3-27b-it | Google DeepMind | 33.3% | $0.080 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 45 | Llama-3.3-70B-Instruct | Meta AI | 33.3% | $0.120 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 46 | GPT-4.1 nano | OpenAI | 25.0% | $0.100 | Epoch AI Benchmarking Hub | 2026-10-05 |
| 47 | nvidia.nemotron-nano-9b-v2 | NVIDIA | 25.0% | $0.040 | Epoch AI Benchmarking Hub | 2026-10-05 |
Compare all benchmarks side by side on the live leaderboard →
Among the ten highest scorers, the cheapest listed API price belongs to Qwen3-32B at $0.080 per million input tokens (score 74.2%).
What Fiction.liveBench measures
Fiction.liveBench measures long-context story comprehension (16k).
How to read these scores
Scores are percentages (higher is better): the share of questions or tasks the model completed correctly. Where a model is listed at several reasoning efforts, only its highest-effort row is shown. See the methodology for how rows are chosen.
Where the data comes from
Epoch AI Benchmarking Hub (CC BY 4.0). Scores were last captured 2026-10-05; the Captured column gives each row's date.