Benchmark · MathCompetitive

FrontierMath-2025-02-28-Private

FrontierMath (Feb 2025) · original research-level math problems created by mathematicians, testing capabilities at the boundary of current AI mathematical reasoning.

Updated 2026-05-27
Models tested
65
Top score
50.0
GPT-5.4 Pro
Median
12.4
min 0.3
Top-5 spread
σ 3.3
Competitive

Best score over time · one chart, every benchmark

FRONTIERMATH-2025-02-28-PRIVATE50 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Nov 24Apr 25Aug 25Jan 26May 26RELEASE DATE →benchgecko.ai/benchmark/frontiermath-2025-02-28-private · frontier
Frontier on FrontierMath-2025-02-28-Private rose from 9.3 to 50.0 in 15 months · +40.7 points · latest leader GPT-5.4 Pro from OpenAI.
Pink dots = frontier records · 8 totalClick to open model page

65 models tested · sorted by score

#ModelScore
1OpenAI logoGPT-5.4 Pro50.0
2OpenAI logoGPT-5.447.6
3Anthropic logoClaude Opus 4.847.2
4Anthropic logoClaude Opus 4.743.8
5Anthropic logoClaude Opus 4.640.7
6OpenAI logoGPT-5.240.7
7
U
Muse Spark
39.0
8Google DeepMind logoGemini 3.5 Flash39.0
9moonshotai logoKimi K2.639.0
10Google DeepMind logoGemini 3 Pro37.6
11Google DeepMind logoGemini 3.1 Pro Preview36.9
12Google DeepMind logoGemini 3 Flash Preview35.6
13z-ai logoGLM 5.133.5
14OpenAI logoGPT-532.4
15Anthropic logoClaude Sonnet 4.632.4
16OpenAI logoGPT-5.131.0
17OpenAI logoGPT-5.4 Mini28.3
18moonshotai logoKimi K2.527.9
19OpenAI logoGPT-5 Mini27.2
20Alibaba Qwen logoQwen3.6 Plus26.2
21OpenAI logoGPT-5.4 Nano25.9
22OpenAI logoo4 Mini24.8
23Alibaba Qwen logoQwen3.6 Max Preview23.1
24DeepSeek logoDeepSeek V3.222.1
25moonshotai logoKimi K2 Thinking21.4
26Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)21.0
27Anthropic logoClaude Opus 4.520.7
28xAI logoGrok 419.7
29OpenAI logoo318.7
30z-ai logoGLM 516.4
31Anthropic logoClaude Sonnet 4.515.2
32Google DeepMind logoGemini 2.5 Pro14.1
33OpenAI logoo3 Mini12.4
34Alibaba Qwen logoQwen3.6 Flash10.3
35OpenAI logoo19.3
36Alibaba Qwen logoQwen3 235B A22B Thinking 25078.5
37OpenAI logoGPT-5 Nano8.3
38Anthropic logoClaude Opus 4.17.2
39Alibaba Qwen logoQwen3.5-Flash6.2
40Anthropic logoClaude Haiku 4.55.9
41xAI logoGrok-3 mini5.9
42OpenAI logoGPT-4.15.5
43Google DeepMind logoGemini 2.5 Flash4.8
44Anthropic logoClaude Opus 44.5
45OpenAI logoGPT-4.1 Mini4.5
46Anthropic logoClaude 3.7 Sonnet4.1
47Anthropic logoClaude Sonnet 44.1
48z-ai logoGLM 4.63.8
49xAI logoGrok 33.8
50z-ai logoGLM 4.72.4
51DeepSeek logoDeepSeek V31.7
52Google DeepMind logoGemini 2.0 Flash1.7
53Google DeepMind logoGemini 2.0 Flash (Dec 2024)1.7
54OpenAI logoo1-mini1.7
55Anthropic logoClaude 3.5 Sonnet1.0
56OpenAI logoGPT-4.1 Nano1.0
57Alibaba Qwen logoQwen2.5-Max1.0
58xAI logoGrok-2 (Dec 2024)0.7
59Meta logoLlama 4 Maverick0.7
60Mistral AI logoMistral Medium 30.3
61Anthropic logoClaude 3.5 Haiku0.3
62OpenAI logoGPT-4o (2024-08-06)0.3
63OpenAI logoGPT-4o (2024-11-20)0.3
64Mistral AI logoMistral Large0.3
65Mistral AI logoMistral Large 24110.3

Same category · related evaluations