Benchmark · KnowledgeSettled

Artificial Analysis · CritPt

Updated 2026-09-29
Models tested
43
Top score
31.7
Claude Opus 5.5
Median
9.1
min 0.3
Top-5 spread
σ 0.7
Settled

Best score over time · one chart, every benchmark

ARTIFICIAL ANALYSIS · CRITPT43 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Apr 25Aug 25Jan 26May 26Sep 26RELEASE DATE →benchgecko.ai/benchmark/aa-critpt · frontier
Frontier on Artificial Analysis · CritPt rose from 1.1 to 31.7 in 17 months · +30.6 points · latest leader GPT-6 Astra from OpenAI.
Pink dots = frontier records · 6 totalClick to open model page

43 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Opus 5.531.7
2OpenAI logoGPT-6 Astra31.7
3OpenAI logoGPT-6.1 Sol31.7
4Anthropic logoClaude Sonnet 5.531.4
5OpenAI logoGPT-5.6 Terra30.0
6Anthropic logoClaude Fable 5.129.7
7xiaomi logoMiMo-V2.6-Pro26.6
8moonshotai logoKimi K323.4
9Alibaba Qwen logoQwen3.8 2.4T A95B20.0
10OpenAI logoGPT-6 Luna19.4
11z-ai logoGLM 5.319.1
12Google DeepMind logoGemini 3.8 Flash18.3
13DeepSeek logoDeepSeek V4 Pro18.0
14Google DeepMind logoGemini 3.1 Pro Preview17.7
15xAI logoGrok 4.717.7
16Alibaba Qwen logoQwen3.8 Max (0902)17.7
17OpenAI logoGPT-5.3-Codex16.9
18z-ai logoGLM 5.3 Flash15.4
19DeepSeek logoDeepSeek V4.1 Flash14.3
20xiaomi logoMiMo-V2.6-Flash12.0
21moonshotai logoKimi K2.7 Code10.0
22Alibaba Qwen logoQwen3.7 Plus9.1
23Alibaba Qwen logoQwen3.8 27B5.4
24upstage logoSolar Pro 45.4
25tencent logoHy34.9
26minimax logoMiniMax M33.7
27NVIDIA logoNemotron 3 Super3.1
28NVIDIA logoNemotron 3 Ultra3.1
29meituan logoLongCat 2.02.6
30Google DeepMind logoGemma 4 31B1.4
31OpenAI logogpt-oss-20b1.4
32upstage logoSolar Mini 41.4
33OpenAI logogpt-oss-120b1.1
34OpenAI logoo31.1
35Alibaba Qwen logoQwen3.5 397B A17B0.9
36Alibaba Qwen logoQwen3.5-122B-A10B0.9
37arcee-ai logoTrinity Large Thinking0.9
38Alibaba Qwen logoQwen3.5-9B0.6
39Cohere logoCommand A+0.3
40ibm-granite logoGranite 4.2 8B0.3
41Mistral AI logoMistral Small 40.3
42Cohere logoNorth Mini Code (free)0.3
43Alibaba Qwen logoQwen3.6 35B A3B0.3

Same category · related evaluations