Benchmark · ReasoningSettled

GPQA diamond

Graduate-Level Google-Proof QA (Diamond set) · expert-crafted questions in physics, biology, and chemistry that are difficult even for domain PhDs.

Updated 2026-06-12

Opus 4.7 hits 94.2%. Five models above 91%. The benchmark is approaching saturation.

Scoring: Exact-match accuracy on 198 multiple-choice questions. Four options per question. No partial credit.

Models tested
117
Top score
94.5
Claude Mythos Preview
Median
55.9
min 1.3
Top-5 spread
σ 0.9
Settled

Best score over time · one chart, every benchmark

GPQA DIAMOND65 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Sep 24Feb 25Jul 25Jan 26Jun 26RELEASE DATE →benchgecko.ai/benchmark/gpqa-diamond · frontier
Frontier on GPQA diamond rose from 35.1 to 94.5 in 17 months · +59.4 points · latest leader Claude Mythos Preview from Anthropic.
Pink dots = frontier records · 11 totalClick to open model page

117 models tested · sorted by score · includes 7 verified scores

#ModelScore
1Anthropic logoClaude Mythos Preview94.5
2Google logoGemini 3.1 Proverified94.3
3OpenAI logoGPT-5.5 Pro94.2
4OpenAI logoGPT-5.593.6
5OpenAI logoGPT-5.4 Pro92.8
6Google DeepMind logoGemini 3.1 Pro Preview92.1
7OpenAI logoGPT-5.491.1
8Google DeepMind logoGemini 3.5 Flash90.4
9Google DeepMind logoGemini 3 Pro90.2
10Alibaba Qwen logoQwen3.7 Max88.8
11OpenAI logoGPT-5.288.5
12Anthropic logoClaude Opus 4.888.0
13moonshotai logoKimi K2.687.7
14Anthropic logoClaude Opus 4.687.4
15Anthropic logoClaude Opus 4.786.9
16
U
Muse Spark
86.4
17moonshotai logoKimi K2.7 Code86.0
18Alibaba Qwen logoQwen3.6 Max Preview85.4
19z-ai logoGLM 583.8
20OpenAI logoGPT-5.183.5
21moonshotai logoKimi K2.583.5
22Anthropic logoClaude Sonnet 4.683.2
23Alibaba Qwen logoQwen3.6 Plus83.2
24xAI logoGrok 482.7
25OpenAI logoGPT-581.6
26Anthropic logoClaude Opus 4.581.4
27z-ai logoGLM 5.180.6
28Google DeepMind logoGemini 2.5 Pro80.4
29Alibaba Qwen logoQwen3.6 Flash79.2
30moonshotai logoKimi K2 Thinking79.0
31Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)78.9
32Alibaba Qwen logoQwen3.5-Flash78.5
33OpenAI logoGPT-5.4 Mini78.1
34DeepSeek logoDeepSeek V3.277.9
35z-ai logoGLM 4.777.8
36Google DeepMind logoGemini 3 Flash Preview77.6
37Anthropic logoClaude Sonnet 4.576.4
38OpenAI logoo375.8
39Alibaba Qwen logoQwen3 235B A22B Thinking 250773.4
40Anthropic logoClaude 3.7 Sonnet73.0
41OpenAI logoo4 Mini72.8
42Anthropic logoClaude Sonnet 472.3
43OpenAI logoGPT-5.4 Nano71.3
44Anthropic logoClaude Opus 4.169.7
45OpenAI logoo3 Mini69.4
46OpenAI logoo169.0
47DeepSeek logoR1 052868.4
48Anthropic logoClaude Opus 468.3
49xAI logoGrok-3 mini68.3
50OpenAI logogpt-oss-120b67.7
51xAI logoGrok 367.7
52OpenAI logoGPT-5 Mini66.7
53Alibaba Qwen logoQwen3 Max63.5
54DeepSeek logoR162.3
55Anthropic logoClaude Haiku 4.561.6
56Alibaba Qwen logoQwen3 235B A22B60.9
57OpenAI logoGPT-5 Nano59.3
58OpenAI logoGPT-4.558.3
59Meta logoLlama 4 Maverick56.0
60OpenAI logoGPT-4.155.9
61OpenAI logoGPT-4.1 Mini54.5
62Google DeepMind logoGemini 2.0 Pro54.2
63Google DeepMind logoGemini 2.0 Flash52.2
64Google DeepMind logoGemini 2.0 Flash (Dec 2024)52.2
65OpenAI logoo1-mini49.8
66Mistral AI logoMistral Medium 346.0
67Google DeepMind logoGemini 2.0 Flash Thinking (Jan 2025)42.8
68DeepSeek logoDeepSeek V342.0
69Alibaba Qwen logoQwen2.5-Max41.5
70Microsoft logoPhi 441.4
71Anthropic logoClaude 3.5 Sonnet38.7
72xAI logoGrok-2 (Dec 2024)38.4
73Meta logoLlama 4 Scout35.8
74Mistral AI logoMistral Large 241135.1
75Meta logoLlama 3.1 405B34.5
76OpenAI logoo1-preview33.8
77OpenAI logoGPT-4o (2024-08-06)32.3
78OpenAI logoGPT-4o (2024-11-20)32.3
79Alibaba Qwen logoQwen2.5 72B Instruct32.2
80Mistral AI logoMistral Large 240732.0
81OpenAI logoGPT-4.1 Nano31.9
82OpenAI logoGPT-4o (2024-05-13)31.9
83Google DeepMind logoGemma 3 27B31.8
84Google DeepMind logoGemma 3 27B (free)31.8
85
U
Magistral Small 1.1
31.2
86Meta logoLlama 3.3 70B Instruct (free)29.9
87Anthropic logoClaude 3 Opus29.6
88Google DeepMind logoGemini 1.5 Pro (Feb 2024)27.8
89Google DeepMind logoGemini 1.5 Pro (May 2024)27.8
90Meta logoLlama 3.1 70B Instruct25.6
91Meta logoLlama 3.2 90B21.4
92Alibaba Qwen logoQwen2-72B21.0
93Anthropic logoClaude 3 Sonnet20.8
94Meta logoLlama 3 70B Instruct20.8
95Meta logoLlama 3-70B20.8
96Google DeepMind logoGemini 1.5 Flash (May 2024)20.5
97Mistral AI logoMistral Large18.4
98Anthropic logoClaude 3.5 Haiku17.5
99OpenAI logoGPT-4o-mini17.0
100OpenAI logoGPT-4o-mini (2024-07-18)17.0
101Google DeepMind logoGemma 2 27B15.3
102Anthropic logoClaude 3 Haiku15.1
103OpenAI logoGPT-4 (older v0314)14.3
104Anthropic logoClaude 212.9
105Mistral AI logoMixtral 8x22B Instruct12.1
106Google DeepMind logoGemini 1.0 Pro11.9
107Anthropic logoClaude 2.110.6
108OpenAI logoGPT-4 Turbo7.5
109Mistral AI logoMixtral 8x7B7.5
110Mistral AI logoMixtral 8x7B Instruct7.5
111Mistral AI logoMistral Nemo6.5
112Microsoft logophi-3-medium 14B3.5
113Google DeepMind logoGemma 2 9B3.3
114OpenAI logoGPT-3.5 Turbo (older v0613)2.9
115Meta logoLlama 2-13B1.8
116Meta logoLlama 3 8B Instruct1.4
117Meta logoLlama 3.1 8B Instruct1.3
Details
Category
Reasoning
Creator
NYU (Rein et al.)
Max score
100
Dataset
198 questions
Modality
Text
Format
JSON
License
CC-BY-4.0
Scoring
Exact-match accuracy on 198 multiple-choice questions. Four options per question. No partial credit.
Models
117
Published
2023-11-20
Updated
2026-06-12
Tests
Expert-level sciencePhysicsBiologyChemistryReasoning under uncertainty
Does not test
CodeLong contextSpeedTool useVisionCreative writing
Gecko's Take

GPQA Diamond served its purpose brilliantly, but the ceiling is cracking. When models outscore the PhDs who wrote the questions, we need GPQA Platinum.

Same category · related evaluations