Benchmark · KnowledgeCompetitive

SimpleQA Verified

SimpleQA Verified · short factual questions with verified answers, measuring factual accuracy and the tendency to hallucinate or provide incorrect information.

Updated 2026-06-12
Models tested
47
Top score
77.3
Gemini 3.1 Pro Preview
Median
38.9
min 5.9
Top-5 spread
σ 3.7
Competitive

Best score over time · one chart, every benchmark

SIMPLEQA VERIFIED41 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Jan 25May 25Oct 25Feb 26Jun 26RELEASE DATE →benchgecko.ai/benchmark/simpleqa-verified · frontier
Frontier on SimpleQA Verified rose from 27.4 to 77.3 in 13 months · +49.9 points · latest leader Gemini 3.1 Pro Preview from Google DeepMind.
Pink dots = frontier records · 5 totalClick to open model page

47 models tested · sorted by score

#ModelScore
1Google DeepMind logoGemini 3.1 Pro Preview77.3
2Google DeepMind logoGemini 3 Pro72.9
3Google DeepMind logoGemini 3.5 Flash68.4
4Anthropic logoClaude Fable 568.3
5Alibaba Qwen logoQwen3 Max67.5
6Google DeepMind logoGemini 3 Flash Preview67.4
7
U
Muse Spark
66.3
8Alibaba Qwen logoQwen3.7 Max58.5
9Alibaba Qwen logoQwen3.6 Max Preview56.9
10Google DeepMind logoGemini 2.5 Pro56.0
11OpenAI logoo353.0
12Anthropic logoClaude Opus 4.750.6
13OpenAI logoGPT-550.6
14Alibaba Qwen logoQwen3 235B A22B Thinking 250750.1
15Alibaba Qwen logoQwen3.6 Plus49.1
16OpenAI logoGPT-5.148.9
17xAI logoGrok 447.9
18OpenAI logoGPT-5.4 Pro47.8
19Anthropic logoClaude Opus 4.646.5
20OpenAI logoGPT-5.444.8
21Anthropic logoClaude Opus 4.541.8
22Anthropic logoClaude Opus 4.839.5
23moonshotai logoKimi K2.7 Code39.2
24OpenAI logoGPT-5.238.9
25moonshotai logoKimi K2.638.7
26z-ai logoGLM 5.137.3
27Anthropic logoClaude Opus 4.134.8
28moonshotai logoKimi K2.533.9
29moonshotai logoKimi K2 Thinking31.6
30z-ai logoGLM 4.731.5
31Anthropic logoClaude Sonnet 4.629.0
32OpenAI logoGPT-5.4 Mini28.6
33DeepSeek logoDeepSeek V3.227.5
34DeepSeek logoR127.4
35DeepSeek logoR1 052827.4
36Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)26.0
37OpenAI logoo4 Mini23.9
38Anthropic logoClaude Sonnet 4.523.6
39Alibaba Qwen logoQwen3.6 Flash21.2
40xAI logoGrok-3 mini21.1
41OpenAI logoGPT-5 Mini21.0
42Alibaba Qwen logoQwen3.5-Flash19.8
43OpenAI logogpt-oss-120b13.9
44OpenAI logoGPT-5 Nano12.2
45OpenAI logoGPT-5.4 Nano12.0
46Anthropic logoClaude 3.5 Haiku6.7
47Anthropic logoClaude Haiku 4.55.9

Same category · related evaluations