Benchmark · ReasoningSettled

ARC-AGI

ARC-AGI · the original Abstraction and Reasoning Corpus, testing whether AI can solve novel visual pattern recognition tasks without memorization.

Updated 2026-05-27
Models tested
54
Top score
98.0
Gemini 3.1 Pro Preview
Median
52.9
min 0.5
Top-5 spread
σ 1.6
Settled

Best score over time · one chart, every benchmark

ARC-AGI44 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Apr 25Aug 25Jan 26May 26RELEASE DATE →benchgecko.ai/benchmark/arc-agi · frontier
Frontier on ARC-AGI rose from 4.5 to 98.0 in 15 months · +93.5 points · latest leader Gemini 3.1 Pro Preview from Google DeepMind.
Pink dots = frontier records · 12 totalClick to open model page

54 models tested · sorted by score

#ModelScore
1Google DeepMind logoGemini 3.1 Pro Preview98.0
2OpenAI logoGPT-5.595.0
3OpenAI logoGPT-5.4 Pro94.5
4Anthropic logoClaude Opus 4.694.0
5OpenAI logoGPT-5.493.7
6Anthropic logoClaude Opus 4.793.5
7Anthropic logoClaude Opus 4.892.5
8Google DeepMind logoGemini 3.5 Flash92.5
9OpenAI logoGPT-5.2 Pro90.5
10xAI logoGrok 4.2089.5
11Anthropic logoClaude Sonnet 4.686.5
12OpenAI logoGPT-5.286.2
13Anthropic logoClaude Opus 4.580.0
14Google DeepMind logoGemini 3 Pro75.0
15OpenAI logoGPT-5.172.8
16OpenAI logoGPT-5 Pro70.2
17xAI logoGrok 466.7
18OpenAI logoGPT-565.7
19moonshotai logoKimi K2.565.3
20Anthropic logoClaude Sonnet 4.563.7
21OpenAI logoGPT-5.4 Mini63.7
22minimax logoMiniMax M2.563.7
23OpenAI logoo360.8
24OpenAI logoo3 Pro59.3
25OpenAI logoo4 Mini58.7
26DeepSeek logoDeepSeek V3.257.0
27OpenAI logoGPT-5 Mini54.3
28OpenAI logoGPT-5.4 Nano51.5
29xAI logoGrok 4 Fast48.5
30Anthropic logoClaude Haiku 4.547.7
31z-ai logoGLM 544.7
32Google DeepMind logoGemini 2.5 Pro41.0
33Anthropic logoClaude Sonnet 440.0
34Anthropic logoClaude Opus 435.7
35OpenAI logoo3 Mini34.5
36Google DeepMind logoGemini 2.5 Flash32.3
37OpenAI logoo130.7
38Anthropic logoClaude 3.7 Sonnet28.6
39Google DeepMind logoGemini 3 Flash Preview21.5
40DeepSeek logoR1 052821.2
41OpenAI logoGPT-5 Nano20.7
42OpenAI logoo1-preview18.0
43xAI logoGrok-3 mini16.5
44DeepSeek logoR115.8
45OpenAI logoo1-mini14.0
46Alibaba Qwen logoQwen3 235B A22B Instruct 250711.0
47OpenAI logoGPT-4.510.3
48OpenAI logoGPT-4.15.5
49xAI logoGrok 35.5
50
U
Magistral Small 1.1
5.0
51OpenAI logoGPT-4o (2024-11-20)4.5
52Meta logoLlama 4 Maverick4.4
53OpenAI logoGPT-4.1 Mini3.5
54Meta logoLlama 4 Scout0.5

Same category · related evaluations