Benchmark · KnowledgeCompetitive

Artificial Analysis · Humanity's Last Exam

Updated 2026-09-29
Models tested
66
Top score
61.4
Claude Opus 5.5
Median
20.0
min 1.1
Top-5 spread
σ 3.1
Competitive

Best score over time · one chart, every benchmark

ARTIFICIAL ANALYSIS · HUMANITY'S LAST EXAM66 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Jan 25Jun 25Nov 25Apr 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/aa-humanitys-last-exam · frontier
Frontier on Artificial Analysis · Humanity's Last Exam rose from 3.8 to 61.4 in 21 months · +57.6 points · latest leader Claude Opus 5.5 from Anthropic.
Pink dots = frontier records · 7 totalClick to open model page

66 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Opus 5.561.4
2Anthropic logoClaude Fable 5.159.1
3Anthropic logoClaude Sonnet 5.555.0
4OpenAI logoGPT-6 Astra54.7
5OpenAI logoGPT-6.1 Sol52.9
6xiaomi logoMiMo-V2.6-Pro49.4
7Google DeepMind logoGemini 3.8 Flash47.8
8Google DeepMind logoGemini 3.1 Pro Preview47.0
9moonshotai logoKimi K346.9
10xAI logoGrok 4.743.1
11Alibaba Qwen logoQwen3.8 Max (0902)43.1
12OpenAI logoGPT-5.6 Terra42.9
13OpenAI logoGPT-5.3-Codex42.5
14Alibaba Qwen logoQwen3.8 2.4T A95B42.4
15z-ai logoGLM 5.342.3
16DeepSeek logoDeepSeek V4 Pro41.0
17z-ai logoGLM 5.3 Flash39.9
18DeepSeek logoDeepSeek V4.1 Flash39.2
19minimax logoMiniMax M339.0
20OpenAI logoGPT-6 Luna38.5
21Alibaba Qwen logoQwen3.7 Plus35.6
22xiaomi logoMiMo-V2.6-Flash35.1
23moonshotai logoKimi K2.7 Code35.0
24Alibaba Qwen logoQwen3.8 27B33.9
25meituan logoLongCat 2.033.7
26tencent logoHy333.5
27upstage logoSolar Pro 429.2
28NVIDIA logoNemotron 3 Ultra28.4
29upstage logoSolar Mini 425.8
30Google DeepMind logoGemma 4 31B23.6
31Alibaba Qwen logoQwen3.6 35B A3B22.2
32NVIDIA logoNemotron 3 Super20.8
33OpenAI logoo320.1
34Alibaba Qwen logoQwen3.5 397B A17B19.8
35OpenAI logogpt-oss-120b19.6
36Google DeepMind logoGemma 4 26B A4B 19.3
37Google DeepMind logoGemini 3.5 Flash Lite18.8
38Alibaba Qwen logoQwen3.5-122B-A10B15.9
39arcee-ai logoTrinity Large Thinking15.8
40Mistral AI logoMistral Medium 3.513.8
41Alibaba Qwen logoQwen3 Next 80B A3B Instruct12.6
42Cohere logoCommand A+12.0
43inception logoMercury 2.511.8
44ibm-granite logoGranite 4.2 8B11.2
45Cohere logoNorth Mini Code (free)11.1
46OpenAI logogpt-oss-20b11.0
47
N
Nanbeige4.1 3B
10.9
48DeepSeek logoDeepSeek V4 Pro 081310.6
49NVIDIA logoNemotron 3.5 Lightning10.6
50Alibaba Qwen logoQwen3 Coder Next10.1
51Mistral AI logoMistral Small 49.9
52Alibaba logoQwen3.5 4B9.9
53Alibaba Qwen logoQwen3.5-9B9.4
54liquid logoLFM2.5-2.6B (free)6.2
55ibm-granite logoGranite 4.0 Micro5.0
56Microsoft logoPhi 4 Multimodal Instruct5.0
57Meta logoLlama 4 Maverick4.9
58NVIDIA logoNVIDIA Nemotron Nano 9B V24.9
59Microsoft logoPhi 4 Mini Instruct4.5
60rekaai logoReka Flash 34.4
61allenai logoMolmo2 8B4.3
62Cohere logoCommand A4.0
63Meta logoLlama 4 Scout3.8
64Microsoft logoPhi 43.8
65Alibaba logoQwen3.5 2B2.6
66Alibaba logoQwen3.5 0.8B1.1

Same category · related evaluations