Benchmark · KnowledgeSettled

Proofbench

Updated 2026-09-28
Models tested
56
Top score
100.0
Claude Fable 5.1
Median
31.0
min 2.0
Top-5 spread
σ 0.5
Settled

Best score over time · one chart, every benchmark

PROOFBENCH54 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Aug 25Nov 25Mar 26Jun 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/proofbench · frontier
Frontier on Proofbench rose from 18.0 to 100.0 in 13 months · +82.0 points · latest leader Claude Fable 5.1 from Anthropic.
Pink dots = frontier records · 9 totalClick to open model page

56 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Fable 5.1100.0
2Anthropic logoClaude Opus 5.5100.0
3Anthropic logoClaude Sonnet 5.5100.0
4Anthropic logoClaude Opus 599.0
5OpenAI logoGPT-6 Astra99.0
6Anthropic logoClaude Fable 595.0
7moonshotai logoKimi K387.0
8OpenAI logoGPT-5.6 Sol83.0
9Anthropic logoClaude Sonnet 577.0
10OpenAI logoGPT-5.6 Terra74.0
11Anthropic logoClaude Opus 4.869.0
12OpenAI logoGPT-5.6 Luna60.0
13Google DeepMind logoGemini 3.7 Flash58.0
14Alibaba Qwen logoQwen3.8 Max (0902)58.0
15DeepSeek logoDeepSeek V4 Flash 073156.0
16OpenAI logoGPT-5.456.0
17Anthropic logoClaude Opus 4.754.0
18DeepSeek logoDeepSeek V4.1 Flash54.0
19xAI logoGrok 4.651.0
20Anthropic logoClaude Opus 4.650.0
21DeepSeek logoDeepSeek V4 Pro 081350.0
22z-ai logoGLM 5.349.0
23Google DeepMind logoGemini 3.8 Flash48.0
24Anthropic logoClaude Sonnet 4.645.0
25Anthropic logoClaude Opus 4.536.0
26Google DeepMind logoGemini 3.6 Flash36.0
27z-ai logoGLM 5.235.0
28Google DeepMind logoGemini 3.5 Flash31.0
29xAI logoGrok 4.531.0
30Google DeepMind logoGemini 3.1 Pro Preview26.0
31Alibaba Qwen logoQwen3.7 Max26.0
32z-ai logoGLM 5.122.2
33z-ai logoGLM 5.3 Flash21.0
34OpenAI logoGPT-5.4 Mini21.0
35Google DeepMind logoGemini 3 Pro20.0
36Anthropic logoClaude Sonnet 4.519.0
37OpenAI logoGPT-518.0
38minimax logoMiniMax M318.0
39
U
Muse Spark
17.0
40DeepSeek logoDeepSeek V4 Pro16.0
41moonshotai logoKimi K2.616.0
42Alibaba Qwen logoQwen3.8 27B16.0
43Google DeepMind logoGemini 3 Flash Preview15.0
44OpenAI logoGPT-5.215.0
45xAI logoGrok 4.2014.0
46Google DeepMind logoGemini 3.5 Flash Lite13.0
47OpenAI logoGPT-5 Nano12.0
48xAI logoGrok 4.311.0
49OpenAI logoGPT-5 Mini9.0
50Mistral AI logoMistral Medium 3.59.0
51DeepSeek logoDeepSeek V3.28.0
52z-ai logoGLM 4.76.0
53OpenAI logoGPT-5.4 Nano5.0
54minimax logoMiniMax M2.54.0
55minimax logoMiniMax M2.73.0
56NVIDIA logoNemotron 3 Ultra2.0

Same category · related evaluations