Benchmark · ReasoningCompetitive

SimpleBench

SimpleBench · tests fundamental reasoning capabilities with straightforward problems designed to expose gaps in basic logical and spatial thinking.

Updated 2026-06-09
Models tested
61
Top score
78.3
Claude Fable 5
Median
29.4
min 1.4
Top-5 spread
σ 3.3
Competitive

Best score over time · one chart, every benchmark

SIMPLEBENCH43 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Apr 25Aug 25Jan 26Jun 26RELEASE DATE →benchgecko.ai/benchmark/simplebench · frontier
Frontier on SimpleBench rose from 28.1 to 78.3 in 18 months · +50.2 points · latest leader Claude Fable 5 from Anthropic.
Pink dots = frontier records · 7 totalClick to open model page

61 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Fable 578.3
2Google DeepMind logoGemini 3.1 Pro Preview75.5
3Google DeepMind logoGemini 3.5 Flash72.0
4Google DeepMind logoGemini 3 Pro71.7
5OpenAI logoGPT-5.4 Pro68.9
6Alibaba Qwen logoQwen3.7 Max64.5
7Anthropic logoClaude Opus 4.661.1
8Anthropic logoClaude Opus 4.857.8
9Alibaba Qwen logoQwen3.6 Max Preview55.6
10Anthropic logoClaude Opus 4.755.5
11Google DeepMind logoGemini 2.5 Pro54.9
12Anthropic logoClaude Opus 4.554.4
13OpenAI logoGPT-5 Pro53.9
14Google DeepMind logoGemini 3 Flash Preview53.3
15xAI logoGrok 452.6
16Anthropic logoClaude Opus 4.152.0
17Anthropic logoClaude Opus 450.6
18z-ai logoGLM 5.150.4
19OpenAI logoGPT-5.2 Pro48.9
20OpenAI logoGPT-548.0
21Anthropic logoClaude Sonnet 4.545.2
22z-ai logoGLM 543.8
23OpenAI logoGPT-5.143.8
24OpenAI logoo343.7
25z-ai logoGLM 4.737.2
26moonshotai logoKimi K2.536.2
27Anthropic logoClaude 3.7 Sonnet35.7
28OpenAI logoGPT-5.235.0
29Anthropic logoClaude Sonnet 434.6
30OpenAI logoo1-preview30.0
31Google DeepMind logoGemini 2.5 Flash29.4
32DeepSeek logoR1 052829.0
33OpenAI logoo128.1
34DeepSeek logoDeepSeek V3.128.0
35OpenAI logoo4 Mini26.4
36xAI logoGrok 323.3
37OpenAI logoGPT-4.521.4
38Google DeepMind logoGemini 2.0 Flash17.3
39Google DeepMind logoGemini 2.0 Flash (Dec 2024)17.3
40Alibaba Qwen logoQwen3 235B A22B17.2
41DeepSeek logoR117.1
42Google DeepMind logoGemini 2.0 Flash Thinking (Jan 2025)16.8
43Meta logoLlama 4 Maverick13.2
44Anthropic logoClaude 3.5 Sonnet13.0
45Google DeepMind logoGemini 1.5 Pro (Feb 2024)12.5
46Google DeepMind logoGemini 1.5 Pro (May 2024)12.5
47OpenAI logoGPT-4.112.4
48moonshotai logoKimi K2 071111.6
49OpenAI logoGPT-4 Turbo10.1
50Anthropic logoClaude 3 Opus8.2
51Meta logoLlama 3.1 405B7.6
52OpenAI logoo3 Mini7.4
53xAI logoGrok-2 (Dec 2024)7.2
54Mistral AI logoMistral Large7.0
55Mistral AI logoMistral Large 24077.0
56OpenAI logogpt-oss-120b6.5
57Meta logoLlama 3.3 70B Instruct (free)3.9
58DeepSeek logoDeepSeek V32.7
59OpenAI logoo1-mini1.7
60OpenAI logoGPT-4o (2024-08-06)1.4
61OpenAI logoGPT-4o (2024-11-20)1.4
Details
Category
Reasoning
Max score
100
Models
61
Updated
2026-06-09

Same category · related evaluations