ModelsLiveBench
LiveBench
LiveBench is an objective, contamination-resistant benchmark: questions are refreshed so models cannot memorize the test set. Pick a category below: Overall plus Reasoning, Coding, Agentic Coding, Math, Data Analysis, Language, and Instruction Following (IF). Overall is the mean of category averages. This page mirrors the LiveBench-2026-06-25 public release.
Newer flagships (including Grok 4.7) may be absent until the next LiveBench refresh — a missing row is not a score of zero. For human preference across multiple Arena boards, see LMArena boards. For the Artificial Analysis Index cut used elsewhere on the site, see Models. Also: Price vs value · Pricing history.
Snapshot as of Jun 25, 2026 (LiveBench-2026-06-25). Not investment advice. Figures lag the labs. Prefer livebench.ai for the latest release.
Mean of category averages. Higher is better.
Bars scaled to this board's score range (not from zero), so small gaps show up.
- Claude Fable 5.183.4
- Claude Fable 583
- GPT-6 Astra82.2
- Muse Spark 1.381.6
- DeepSeek V4.1 Flash81.1
- GPT-5.6 Sol81
- GPT-5.580.2
- Claude Opus 580.1
- Kimi K379.2
- Gemini 3.7 Flash78.8
- Qwen3.8 Max78.5
- Grok 4.678
- Muse Spark 1.278
- GPT-5.6 Terra77.9
- Gemini 3.1 Pro Preview77
- GPT-5.4 Mini66.4
- Qwen3.6 27B64
- Grok 4.362.3
Full table
Sortable detail across all categories. Models missing a category score show an em dash in that column.
#1 Claude Fable 5.1
Anthropic · Max Effort
- Overall
- 83.4
- Cost / task
- $1.212
- Reasoning
- 91.7
- Coding
- 86.4
- Agentic Coding
- 66.1
- Math
- 97
- Data Analysis
- 80.3
- Language
- 89.5
- IF
- 73
#2 Claude Fable 5
Anthropic · Max Effort
- Overall
- 83
- Cost / task
- $1.439
- Reasoning
- 89.7
- Coding
- 86
- Agentic Coding
- 62.2
- Math
- 96
- Data Analysis
- 80.5
- Language
- 90.7
- IF
- 75.8
#3 GPT-6 Astra
OpenAI · Max Effort
- Overall
- 82.2
- Cost / task
- $0.736
- Reasoning
- 92.7
- Coding
- 80.4
- Agentic Coding
- 57.3
- Math
- 96.8
- Data Analysis
- 83
- Language
- 89.4
- IF
- 75.6
#4 Muse Spark 1.3
Meta · xHigh
- Overall
- 81.6
- Cost / task
- $0.219
- Reasoning
- 89.7
- Coding
- 81.1
- Agentic Coding
- 64.1
- Math
- 95.9
- Data Analysis
- 79.6
- Language
- 82.8
- IF
- 78
#5 DeepSeek V4.1 Flash
DeepSeek · Max · Open
- Overall
- 81.1
- Cost / task
- $0.029
- Reasoning
- 86.7
- Coding
- 80
- Agentic Coding
- 77.3
- Math
- 93.3
- Data Analysis
- 79.3
- Language
- 81.2
- IF
- 70
#6 GPT-5.6 Sol
OpenAI · Max Effort
- Overall
- 81
- Cost / task
- $0.515
- Reasoning
- 91.7
- Coding
- 83.9
- Agentic Coding
- 56.2
- Math
- 96.2
- Data Analysis
- 79.8
- Language
- 87.7
- IF
- 71.8
#7 GPT-5.5
OpenAI · xHigh Thinking
- Overall
- 80.2
- Cost / task
- $0.435
- Reasoning
- 89.7
- Coding
- 82.1
- Agentic Coding
- 54
- Math
- 95.9
- Data Analysis
- 81.6
- Language
- 87.4
- IF
- 70.7
#8 Claude Opus 5
Anthropic · Max Effort Thinking
- Overall
- 80.1
- Cost / task
- $0.699
- Reasoning
- 91.2
- Coding
- 81.4
- Agentic Coding
- 65.2
- Math
- 95.7
- Data Analysis
- 74.6
- Language
- 88.7
- IF
- 63.8
#9 Kimi K3
Moonshot · Open
- Overall
- 79.2
- Cost / task
- $0.348
- Reasoning
- 90.7
- Coding
- 81.4
- Agentic Coding
- 62.2
- Math
- 84.4
- Data Analysis
- 78.7
- Language
- 85.5
- IF
- 71.4
#10 Gemini 3.7 Flash
Google · High
- Overall
- 78.8
- Cost / task
- $0.157
- Reasoning
- 87.8
- Coding
- 78.9
- Agentic Coding
- 58.3
- Math
- 93.5
- Data Analysis
- 68
- Language
- 85.5
- IF
- 79.9
#11 Qwen3.8 Max
Alibaba · Open
- Overall
- 78.5
- Cost / task
- $0.275
- Reasoning
- 88.2
- Coding
- 72.9
- Agentic Coding
- 64.6
- Math
- 91.3
- Data Analysis
- 78.4
- Language
- 79.7
- IF
- 74.1
#12 Grok 4.6
xAI
- Overall
- 78
- Cost / task
- $0.207
- Reasoning
- 90.5
- Coding
- 76.8
- Agentic Coding
- 57
- Math
- 92.6
- Data Analysis
- 73.9
- Language
- 83.7
- IF
- 71.9
#14 Muse Spark 1.2
Meta · xHigh
- Overall
- 78
- Cost / task
- —
- Reasoning
- —
- Coding
- —
- Agentic Coding
- —
- Math
- —
- Data Analysis
- —
- Language
- —
- IF
- —
#13 GPT-5.6 Terra
OpenAI · Max Effort
- Overall
- 77.9
- Cost / task
- $0.352
- Reasoning
- 90.6
- Coding
- 78.2
- Agentic Coding
- 54.9
- Math
- 94.9
- Data Analysis
- 79.3
- Language
- 82.9
- IF
- 64.6
#15 Gemini 3.1 Pro Preview
Google · High
- Overall
- 77
- Cost / task
- $0.286
- Reasoning
- 84
- Coding
- 76.5
- Agentic Coding
- 44.1
- Math
- 91
- Data Analysis
- 78.5
- Language
- 85.4
- IF
- 79.1
#16 GPT-5.4 Mini
OpenAI · xHigh
- Overall
- 66.4
- Cost / task
- $0.334
- Reasoning
- 71.3
- Coding
- 71.6
- Agentic Coding
- 41.7
- Math
- 78.5
- Data Analysis
- 70.8
- Language
- 71
- IF
- 59.8
#17 Qwen3.6 27B
Alibaba · Open
- Overall
- 64
- Cost / task
- $0.202
- Reasoning
- 70.3
- Coding
- 71.8
- Agentic Coding
- 39.3
- Math
- 79.9
- Data Analysis
- 70.4
- Language
- 63.3
- IF
- 53.2
#18 Grok 4.3
xAI
- Overall
- 62.3
- Cost / task
- —
- Reasoning
- —
- Coding
- —
- Agentic Coding
- —
- Math
- —
- Data Analysis
- —
- Language
- —
- IF
- —
| 1 | Claude Fable 5.1 Anthropic · Max Effort | 83.4 | 91.7 | 86.4 | 66.1 | 97 | 80.3 | 89.5 | 73 | $1.212 |
| 2 | Claude Fable 5 Anthropic · Max Effort | 83 | 89.7 | 86 | 62.2 | 96 | 80.5 | 90.7 | 75.8 | $1.439 |
| 3 | GPT-6 Astra OpenAI · Max Effort | 82.2 | 92.7 | 80.4 | 57.3 | 96.8 | 83 | 89.4 | 75.6 | $0.736 |
| 4 | Muse Spark 1.3 Meta · xHigh | 81.6 | 89.7 | 81.1 | 64.1 | 95.9 | 79.6 | 82.8 | 78 | $0.219 |
| 5 | DeepSeek V4.1 Flash DeepSeek · Max | 81.1 | 86.7 | 80 | 77.3 | 93.3 | 79.3 | 81.2 | 70 | $0.029 |
| 6 | GPT-5.6 Sol OpenAI · Max Effort | 81 | 91.7 | 83.9 | 56.2 | 96.2 | 79.8 | 87.7 | 71.8 | $0.515 |
| 7 | GPT-5.5 OpenAI · xHigh Thinking | 80.2 | 89.7 | 82.1 | 54 | 95.9 | 81.6 | 87.4 | 70.7 | $0.435 |
| 8 | Claude Opus 5 Anthropic · Max Effort Thinking | 80.1 | 91.2 | 81.4 | 65.2 | 95.7 | 74.6 | 88.7 | 63.8 | $0.699 |
| 9 | Kimi K3 Moonshot | 79.2 | 90.7 | 81.4 | 62.2 | 84.4 | 78.7 | 85.5 | 71.4 | $0.348 |
| 10 | Gemini 3.7 Flash Google · High | 78.8 | 87.8 | 78.9 | 58.3 | 93.5 | 68 | 85.5 | 79.9 | $0.157 |
| 11 | Qwen3.8 Max Alibaba | 78.5 | 88.2 | 72.9 | 64.6 | 91.3 | 78.4 | 79.7 | 74.1 | $0.275 |
| 12 | Grok 4.6 xAI | 78 | 90.5 | 76.8 | 57 | 92.6 | 73.9 | 83.7 | 71.9 | $0.207 |
| 14 | Muse Spark 1.2 Meta · xHigh | 78 | — | — | — | — | — | — | — | — |
| 13 | GPT-5.6 Terra OpenAI · Max Effort | 77.9 | 90.6 | 78.2 | 54.9 | 94.9 | 79.3 | 82.9 | 64.6 | $0.352 |
| 15 | Gemini 3.1 Pro Preview Google · High | 77 | 84 | 76.5 | 44.1 | 91 | 78.5 | 85.4 | 79.1 | $0.286 |
| 16 | GPT-5.4 Mini OpenAI · xHigh | 66.4 | 71.3 | 71.6 | 41.7 | 78.5 | 70.8 | 71 | 59.8 | $0.334 |
| 17 | Qwen3.6 27B Alibaba | 64 | 70.3 | 71.8 | 39.3 | 79.9 | 70.4 | 63.3 | 53.2 | $0.202 |
| 18 | Grok 4.3 xAI | 62.3 | — | — | — | — | — | — | — | — |
