Benchmark · CodeCompetitive

WeirdML

WeirdML · tests models on unusual and adversarial machine learning tasks that require creative problem-solving beyond standard patterns.

Updated 2026-06-09
Models tested
84
Top score
87.8
Claude Fable 5
Median
42.1
min 1.7
Top-5 spread
σ 3.8
Competitive

Best score over time · one chart, every benchmark

WEIRDML56 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Sep 24Feb 25Jul 25Jan 26Jun 26RELEASE DATE →benchgecko.ai/benchmark/weirdml · frontier
Frontier on WeirdML rose from 25.1 to 87.8 in 19 months · +62.7 points · latest leader Claude Fable 5 from Anthropic.
Pink dots = frontier records · 13 totalClick to open model page

84 models tested · sorted by score

#ModelScore
1Anthropic logoClaude Fable 587.8
2Anthropic logoClaude Opus 4.882.9
3OpenAI logoGPT-5.3-Codex79.3
4Anthropic logoClaude Opus 4.678.0
5OpenAI logoGPT-5.477.7
6Anthropic logoClaude Opus 4.776.4
7OpenAI logoGPT-5.272.2
8Google DeepMind logoGemini 3.1 Pro Preview72.1
9Google DeepMind logoGemini 3 Pro69.9
10Anthropic logoClaude Sonnet 4.666.1
11Anthropic logoClaude Opus 4.563.7
12Google DeepMind logoGemini 3.5 Flash62.6
13Google DeepMind logoGemini 3 Flash Preview61.6
14OpenAI logoGPT-5.160.8
15OpenAI logoGPT-560.7
16OpenAI logoGPT-5 Pro60.4
17OpenAI logoGPT-5.4 Mini60.3
18OpenAI logoo3 Pro58.2
19OpenAI logoGPT-5.4 Pro57.4
20z-ai logoGLM 5.157.1
21moonshotai logoKimi K2.655.9
22Google DeepMind logoGemini 2.5 Pro54.0
23OpenAI logoGPT-5 Mini52.7
24OpenAI logoo4 Mini52.6
25OpenAI logoo352.4
26xAI logoGrok 4.2052.3
27OpenAI logoGPT-5.4 Nano49.2
28z-ai logoGLM 548.2
29OpenAI logogpt-oss-120b48.2
30Anthropic logoClaude Sonnet 4.547.7
31OpenAI logoo1-preview47.6
32Anthropic logoClaude Sonnet 446.1
33xAI logoGrok 445.7
34moonshotai logoKimi K2.545.6
35Anthropic logoClaude Haiku 4.545.4
36OpenAI logoo143.8
37OpenAI logoo3 Mini43.7
38Anthropic logoClaude Opus 443.4
39xAI logoGrok 4 Fast42.9
40moonshotai logoKimi K2 Thinking42.8
41Anthropic logoClaude Opus 4.142.8
42xAI logoGrok-3 mini42.6
43DeepSeek logoR1 052841.6
44Alibaba Qwen logoQwen3 235B A22B Thinking 250741.0
45Google DeepMind logoGemini 2.5 Flash41.0
46DeepSeek logoDeepSeek V3.2 Exp39.5
47OpenAI logoGPT-4.539.4
48moonshotai logoKimi K2 071139.4
49OpenAI logoGPT-4.139.0
50Alibaba Qwen logoQwen3 235B A22B Instruct 250738.7
51DeepSeek logoDeepSeek V3.138.4
52OpenAI logoGPT-5 Nano38.1
53OpenAI logoGPT-4.1 Mini37.6
54Alibaba Qwen logoQwen3 235B A22B37.3
55xAI logoGrok 337.2
56DeepSeek logoR136.5
57OpenAI logoo1-mini36.3
58DeepSeek logoDeepSeek V336.1
59Anthropic logoClaude 3.5 Sonnet31.0
60Anthropic logoClaude 3.5 Haiku30.7
61Google DeepMind logoGemini 2.0 Flash25.8
62Google DeepMind logoGemini 2.0 Flash (Dec 2024)25.8
63OpenAI logoGPT-4o (2024-11-20)25.1
64Google DeepMind logoGemini 1.5 Flash (May 2024)24.9
65Meta logoLlama 4 Maverick24.5
66Anthropic logoClaude 3 Opus23.2
67xAI logoGrok-2 (Dec 2024)22.2
68Google DeepMind logoGemini 1.5 Pro (Feb 2024)22.2
69Google DeepMind logoGemini 1.5 Pro (May 2024)22.2
70Meta logoLlama 3.1 405B21.4
71OpenAI logoGPT-4.1 Nano19.0
72Alibaba Qwen logoQwen2.5 72B Instruct16.0
73Meta logoLlama 3.3 70B Instruct (free)14.4
74OpenAI logoGPT-4 Turbo12.4
75OpenAI logoGPT-4o-mini11.8
76OpenAI logoGPT-4o-mini (2024-07-18)11.8
77Alibaba Qwen logoQwen2-72B11.3
78Anthropic logoClaude 3 Sonnet10.2
79Anthropic logoClaude 3 Haiku9.8
80Meta logoLlama 3.1 70B Instruct9.0
81Anthropic logoClaude 2.17.1
82OpenAI logoGPT-3.5 Turbo (older v0613)3.5
83Mistral AI logoMixtral 8x22B Instruct3.2
84Meta logoLlama 3.1 8B Instruct1.7

Same category · related evaluations