Best AI Models for Reasoning

AI models ranked by reasoning benchmarks. Compare GPQA Diamond, ARC-AGI, BBH, and other reasoning tests across all providers.

170
Models
15
Providers
80
Open Source
$0.70
Median $/1M in
#ModelAvgARC-AGIARC-AGI-2BBHGPQA diamondHLESimpleBench$/1M inContext
1OpenAI logoGPT-5.5 Pro🇺🇸 OpenAI87.8---94.2--$30.00400K
2OpenAI logoGPT-5.5🇺🇸 OpenAI85.095.0--93.6--$5.00400K
3Anthropic logoClaude Mythos Preview🇺🇸 Anthropic81.8---94.556.8-N/A1.0M
4DeepSeek logoDeepSeek-V2 (MoE-236B, May 2024)🇨🇳 DeepSeekOpen76.5--71.7---N/A0K
5Anthropic logoClaude Fable 5🇺🇸 Anthropic74.4-----78.3$10.001.0M
6
U
PaLM 2-L Unknown
73.4------N/A0K
7Alibaba Qwen logoQwen3.7 Max🇨🇳 Alibaba QwenOpen68.1---88.8-64.5$1.251.0M
8Microsoft logophi-3-small 7.4B🇺🇸 MicrosoftOpen67.4--72.1---N/A0K
9xAI logoGrok 4.20🇺🇸 xAI66.189.565.1----$1.252.0M
10OpenAI logoGPT-5.4 Pro🇺🇸 OpenAI63.294.583.3-92.841.568.9$30.001.1M
11moonshotai logoKimi K2.7 Code🇨🇳 moonshotaiOpen63.1---86.0--$0.61262K
12
U
PaLM 2-M Unknown
63.0------N/A0K
13Google DeepMind logoGemini 3.5 Flash🇺🇸 Google DeepMind62.692.572.1-90.4-72.0$1.501.0M
14Anthropic logoClaude Opus 4.8🇺🇸 Anthropic61.492.572.1-88.0-57.8$5.001.0M
15OpenAI logoo3 Pro🇺🇸 OpenAI61.259.34.9----$20.00200K
16Microsoft logophi-3-mini 3.8B🇺🇸 MicrosoftOpen61.0--62.3---N/A0K
17Alibaba Qwen logoQwen-14B🇨🇳 Alibaba QwenOpen60.7--40.0---N/A0K
18Google DeepMind logoGemini 3 Pro🇺🇸 Google DeepMind60.475.031.1-90.234.471.7N/A0K
19Alibaba Qwen logoQwen3.6 Plus🇨🇳 Alibaba QwenOpen59.9---83.2--$0.331.0M
20z-ai logoGLM 5.1🇨🇳 z-aiOpen59.8---80.6-50.4$0.97203K
21DeepSeek logoDeepSeek V3🇨🇳 DeepSeekOpen59.0--83.342.0-2.7$0.20131K
22
U
internlm-20b Unknown
59.0--36.7---N/A0K
23OpenAI logoGPT-5.4🇺🇸 OpenAI58.993.774.0-91.133.0-$2.501.1M
24
U
PaLM 2-S Unknown
58.9------N/A0K
25Microsoft logophi-3-medium 14B🇺🇸 MicrosoftOpen58.6--75.23.5--N/A0K
26Alibaba Qwen logoQwen3 Max🇨🇳 Alibaba QwenOpen58.3---63.5--$0.78262K
27Anthropic logoClaude Opus 4.7🇺🇸 Anthropic58.293.575.8-86.933.055.5$5.001.0M
28TII logoFalcon 2 11B TIIOpen58.0------N/A0K
29DeepSeek logoR1 0528🇨🇳 DeepSeekOpen57.921.21.1-68.4-29.0$0.50164K
30Mistral AI logoMixtral 8x7B🇫🇷 Mistral AIOpen57.8---7.5--N/A0K
31Mistral AI logoMixtral 8x7B Instruct🇫🇷 Mistral AIOpen57.8---7.5--$0.5433K
32Anthropic logoClaude Opus 4.6🇺🇸 Anthropic57.194.069.2-87.431.161.1$5.001.0M
33Google DeepMind logoGemini 3.1 Pro Preview🇺🇸 Google DeepMind56.698.077.1-92.143.775.5$2.001.0M
34Alibaba Qwen logoQwen3 235B A22B🇨🇳 Alibaba QwenOpen56.4---60.9-17.2$0.46131K
35OpenAI logoGPT-5.2 Pro🇺🇸 OpenAI56.290.554.2---48.9$21.00400K
36moonshotai logoKimi K2 0711🇨🇳 moonshotaiOpen56.2-----11.6$0.57131K
37z-ai logoGLM 5🇨🇳 z-aiOpen56.144.74.9-83.8-43.8$0.60203K
38Alibaba Qwen logoQwen3 235B A22B Thinking 2507🇨🇳 Alibaba QwenOpen55.9---73.4--$0.15262K
39
U
Muse Spark Unknown
55.5---86.437.6-N/A0K
40minimax logoMiniMax M2.5🇨🇳 minimaxOpen55.163.74.9----$0.15205K
41OpenAI logoGPT-4 (older v0314)🇺🇸 OpenAI55.0---14.3--$30.008K
42xAI logoGrok 4🇺🇸 xAI54.866.716.0-82.7-52.6N/A0K
43OpenAI logoGPT-5 Mini🇺🇸 OpenAI54.354.34.4-66.715.4-$0.25400K
44OpenAI logoo3🇺🇸 OpenAI53.960.86.5-75.816.343.7$2.00200K
45Google DeepMind logoGemini 2.0 Pro🇺🇸 Google DeepMind53.7---54.2--N/A0K
46OpenAI logoGPT-5.2🇺🇸 OpenAI53.686.252.9-88.524.235.0$1.75400K
47
U
Nemotron-4 15B Unknown
53.4--44.9---N/A0K
48xAI logoGrok-3 mini🇺🇸 xAI53.316.50.4-68.3--N/A0K
49moonshotai logoKimi K2 Thinking🇨🇳 moonshotaiOpen53.3---79.0--$0.60262K
50OpenAI logoGPT-5🇺🇸 OpenAI53.265.79.9-81.621.648.0$1.25400K
51Alibaba Qwen logoQwen2.5 Coder 32B Instruct🇨🇳 Alibaba QwenOpen53.1------$0.66128K
52Google DeepMind logoGemini 2.5 Pro🇺🇸 Google DeepMind52.741.04.9-80.417.754.9$1.251.0M
53Alibaba Qwen logoQwen2.5-Coder-3B🇨🇳 Alibaba QwenOpen52.2------N/A0K
54moonshotai logoKimi K2.5🇨🇳 moonshotaiOpen52.065.311.8-83.520.636.2$0.38262K
55moonshotai logoKimi K2.6🇨🇳 moonshotaiOpen51.7---87.7--$0.66262K
56Alibaba Qwen logoQwen2.5 72B Instruct🇨🇳 Alibaba QwenOpen51.6--73.132.2--$0.36131K
57DeepSeek logoDeepSeek V3.2🇨🇳 DeepSeekOpen51.257.04.0-77.9--$0.21131K
58Alibaba Qwen logoQwen3.6 Max Preview🇨🇳 Alibaba QwenOpen51.2---85.4-55.6$1.04262K
59DeepSeek logoDeepSeek V3.1🇨🇳 DeepSeekOpen51.1-----28.0$0.21164K
60OpenAI logoGPT-4o (2024-05-13)🇺🇸 OpenAI51.1---31.9--$5.00128K
61OpenAI logoGPT-4 Turbo🇺🇸 OpenAI51.0--66.87.5-10.1$10.00128K
62OpenAI logoo4 Mini🇺🇸 OpenAI50.958.76.1-72.813.926.4$1.10200K
63DeepSeek logoDeepSeek-Coder-V2-Lite-Base🇨🇳 DeepSeekOpen50.8------N/A0K
64z-ai logoGLM 4.7🇨🇳 z-aiOpen50.5---77.8-37.2$0.40203K
65xAI logoGrok 4 Fast🇺🇸 xAI50.448.55.3----N/A0K
66Alibaba logoQwen2.5 Coder 14B Instruct🇨🇳 AlibabaOpen50.0------N/A0K
67Alibaba Qwen logoQwen3.6 Flash🇨🇳 Alibaba QwenOpen49.8---79.2--$0.191.0M
68OpenAI logoGPT-5.1🇺🇸 OpenAI49.672.817.6-83.519.843.8$1.25400K
69OpenAI logoo1🇺🇸 OpenAI49.630.7--69.03.328.1$15.00200K
70Alibaba Qwen logoQwen3 235B A22B Instruct 2507🇨🇳 Alibaba QwenOpen48.511.01.3----$0.09262K
71Anthropic logoClaude Sonnet 4.6🇺🇸 Anthropic48.086.560.4-83.2--$3.001.0M
72Google DeepMind logoGemini 2.0 Flash🇺🇸 Google DeepMind48.0-1.3-52.2-17.3$0.101.0M
73Google DeepMind logoGemini 2.0 Flash (Dec 2024)🇺🇸 Google DeepMind48.0-1.3-52.2-17.3N/A0K
74
U
Stable Beluga 2 Unknown
47.8--59.1---N/A0K
75Anthropic logoClaude 3.7 Sonnet🇺🇸 Anthropic47.728.60.9-73.03.435.7N/A0K
76Google DeepMind logoGemini 3 Flash Preview🇺🇸 Google DeepMind47.721.533.6-77.6-53.3$0.501.0M
77Google DeepMind logoGemini 1.5 Flash (May 2024)🇺🇸 Google DeepMind47.3---20.5--N/A0K
78OpenAI logogpt-oss-120b🇺🇸 OpenAIOpen46.9---67.7-6.5$0.04131K
79OpenAI logoGPT-3.5 Turbo (older v0613)🇺🇸 OpenAI45.8--48.82.9--$1.004K
80Mistral AI logoMistral Large 2411🇫🇷 Mistral AIOpen45.8---35.1--$2.00131K
81xAI logoGrok 3🇺🇸 xAI45.55.50.0-67.7-23.3N/A0K
82DeepSeek logoR1🇨🇳 DeepSeekOpen45.115.81.3-62.3-17.1$0.70164K
83OpenAI logoGPT-4.1 Mini🇺🇸 OpenAI44.53.50.0-54.5--$0.401.0M
84TII logoFalcon-180B TIIOpen44.4--16.1---N/A0K
85Alibaba logoQwen2.5 Coder 7B Instruct🇨🇳 AlibabaOpen44.4------N/A0K
86Alibaba Qwen logoQwen2.5 Coder 7B Instruct🇨🇳 Alibaba QwenOpen44.4------$0.0333K
87Anthropic logoClaude Opus 4.5🇺🇸 Anthropic43.680.037.6-81.421.454.4$5.00200K
88Anthropic logoClaude Sonnet 4🇺🇸 Anthropic43.340.05.9-72.33.134.6$3.001.0M
89OpenAI logoGPT-4.1🇺🇸 OpenAI43.35.50.4-55.90.612.4$2.001.0M
90OpenAI logoGPT-5 Nano🇺🇸 OpenAI43.320.72.6-59.3--$0.05400K
91OpenAI logoGPT-4o-mini (2024-07-18)🇺🇸 OpenAI43.2-0.1-17.0--$0.15128K
92Microsoft logoPhi 4🇺🇸 MicrosoftOpen43.2---41.4--$0.0716K
93Meta logoLlama 2-13B🇺🇸 MetaOpen42.5--44.31.8--N/A0K
94Anthropic logoClaude 3.5 Sonnet🇺🇸 Anthropic42.3---38.7-13.0N/A0K
95Google DeepMind logoGemma 3 27B🇺🇸 Google DeepMindOpen42.2---31.8--$0.08131K
96Google DeepMind logoGemma 3 27B (free)🇺🇸 Google DeepMindOpen42.2---31.8--Free131K
97OpenAI logoGPT-5 Pro🇺🇸 OpenAI42.270.218.3--28.253.9$15.00400K
98Anthropic logoClaude Opus 4🇺🇸 Anthropic41.735.78.6-68.36.250.6$15.00200K
99Mistral AI logoMistral 7B V0.1🇫🇷 Mistral AIOpen41.6--41.5---N/A0K
100Google DeepMind logoGemini 1.5 Pro (May 2024)🇺🇸 Google DeepMind41.5-0.885.627.8-12.5N/A0K
101OpenAI logoo1-preview🇺🇸 OpenAI41.518.0--33.8-30.0N/A0K
102Google DeepMind logoGemini 1.5 Pro (Feb 2024)🇺🇸 Google DeepMind41.3-0.878.727.8-12.5N/A0K
103Alibaba Qwen logoQwen2.5-Max🇨🇳 Alibaba QwenOpen41.0---41.5--N/A0K
104
U
Baichuan 2-7B Unknown
40.3--22.1---N/A0K
105Google DeepMind logoGemma 2 27B🇺🇸 Google DeepMindOpen40.1---15.3--$0.658K
106Mistral AI logoMistral Medium 3🇫🇷 Mistral AIOpen40.0---46.0--$0.40131K
107Anthropic logoClaude Sonnet 4.5🇺🇸 Anthropic39.663.713.6-76.49.445.2$3.001.0M
108OpenAI logoGPT-4o-mini🇺🇸 OpenAI39.6-0.0-17.0--$0.15128K
109Mistral AI logoMistral Large 2407🇫🇷 Mistral AIOpen39.1---32.0-7.0$2.00131K
110Alibaba Qwen logoQwen2-72B🇨🇳 Alibaba QwenOpen39.0---21.0--N/A0K
111Alibaba logoQwen2.5 Coder 1.5B Instruct🇨🇳 AlibabaOpen38.8------N/A0K
112Google DeepMind logoGemini 2.5 Flash🇺🇸 Google DeepMind38.532.32.5--7.729.4$0.301.0M
113OpenAI logoGPT-5.4 Mini🇺🇸 OpenAI38.363.718.9-78.1--$0.75400K
114Meta logoLlama 3.1 405B🇺🇸 MetaOpen38.0--77.234.5-7.6N/A0K
115Meta logoLlama 3.1 70B Instruct🇺🇸 MetaOpen37.8---25.6--$0.40131K
116Google DeepMind logoGemini 2.0 Flash Thinking (Jan 2025)🇺🇸 Google DeepMind37.7---42.81.916.8N/A0K
117Anthropic logoClaude 2🇺🇸 Anthropic37.2---12.9--N/A0K
118Anthropic logoClaude 3.5 Haiku🇺🇸 Anthropic37.2---17.5--N/A0K
119Mistral AI logoMistral Nemo🇫🇷 Mistral AIOpen37.2---6.5--$0.02131K
120Anthropic logoClaude Opus 4.1🇺🇸 Anthropic37.0---69.77.152.0$15.00200K
121OpenAI logoGPT-4o (2024-11-20)🇺🇸 OpenAI36.44.50.0-32.3-1.4$2.50128K
122Meta logoLlama 3.2 90B🇺🇸 MetaOpen36.1---21.4--N/A0K
123Google DeepMind logoGemma 2 9B🇺🇸 Google DeepMindOpen36.0---3.3--$0.038K
124OpenAI logoGPT-4.5🇺🇸 OpenAI35.910.30.8-58.30.721.4N/A0K
125OpenAI logoGPT-4o (2024-08-06)🇺🇸 OpenAI35.6---32.3-1.4$2.50128K
126OpenAI logoGPT-4.1 Nano🇺🇸 OpenAI35.20.00.0-31.9--$0.101.0M
127OpenAI logoo3 Mini🇺🇸 OpenAI35.234.53.0-69.4-7.4$1.10200K
128Alibaba Qwen logoQwen3.5-Flash🇨🇳 Alibaba QwenOpen35.0---78.5--$0.071.0M
129Meta logoLLaMA-13B🇺🇸 MetaOpen34.9--17.2---N/A0K
130OpenAI logoo1-mini🇺🇸 OpenAI34.914.00.8-49.8-1.7N/A0K
131Alibaba Qwen logoQwen 3.5 Plus (hosted 397B-A17B)🇨🇳 Alibaba QwenOpen34.8---78.9--N/A0K
132Anthropic logoClaude Haiku 4.5🇺🇸 Anthropic34.347.74.0-61.6--$1.00200K
133
U
XGen-7B Unknown
33.9------N/A0K
134Anthropic logoClaude 3 Opus🇺🇸 Anthropic33.7---29.6-8.2N/A0K
135OpenAI logoGPT-5.4 Nano🇺🇸 OpenAI33.651.55.7-71.3--$0.20400K
136xAI logoGrok-2 (Dec 2024)🇺🇸 xAI33.2---38.4-7.2N/A0K
137
U
vicuna-13b-v1.1 Unknown
32.5--24.1---N/A0K
138Meta logoLlama 3 70B Instruct🇺🇸 MetaOpen32.4---20.8--$0.518K
139Meta logoopen_llama_7b🇺🇸 MetaOpen32.0------N/A0K
140
U
MPT-30B Unknown
31.7--17.3---N/A0K
141
U
Yi 6B UnknownOpen
31.4--29.6---N/A0K
142Meta logoLlama 3 8B Instruct🇺🇸 MetaOpen30.8---1.4--$0.148K
143Microsoft logoPhi 2🇺🇸 MicrosoftOpen30.2--45.9---N/A0K
144Mistral AI logoMistral Large🇫🇷 Mistral AIOpen30.0---18.4-7.0$2.00128K
145
U
Dolly 2.0-12b Unknown
29.2------N/A0K
146Google DeepMind logoGemma 2B🇺🇸 Google DeepMindOpen29.1--13.6---N/A0K
147Meta logoLlama 3.3 70B Instruct (free)🇺🇸 MetaOpen29.1---29.9-3.9Free131K
148Anthropic logoClaude 3 Haiku🇺🇸 Anthropic28.7---15.1--$0.25200K
149Alibaba Qwen logoQwen-1_8B🇨🇳 Alibaba QwenOpen28.7--4.3---N/A0K
150Anthropic logoClaude 3 Sonnet🇺🇸 Anthropic28.3---20.8--N/A0K
151Meta logoLlama 4 Maverick🇺🇸 MetaOpen28.04.40.0-56.00.913.2$0.151.0M
152Meta logoLlama 3.1 8B Instruct🇺🇸 MetaOpen27.4---1.3--$0.02131K
153DeepSeek logoDeepSeek Coder 33B🇨🇳 DeepSeekOpen25.4------N/A0K
154Meta logoLlama 3-70B🇺🇸 MetaOpen24.7---20.8--N/A0K
155
U
StarCoder 2 15B UnknownOpen
24.3------N/A0K
156
U
Baichuan1-7B Unknown
23.7--10.0---N/A0K
157Mistral AI logoMixtral 8x22B Instruct🇫🇷 Mistral AIOpen23.5---12.1--$2.0066K
158OpenAI logoCerebras-GPT-13B🇺🇸 OpenAI23.4------N/A0K
159Alibaba Qwen logoCodeQwen1.5-7B🇨🇳 Alibaba QwenOpen23.1------N/A0K
160Google DeepMind logoGemini 1.0 Pro🇺🇸 Google DeepMind21.1---11.9--N/A0K
161Anthropic logoClaude 2.1🇺🇸 Anthropic21.0---10.6--N/A0K
162Alibaba logoQwen2.5 Coder 0.5B Instruct🇨🇳 AlibabaOpen20.8------N/A0K
163
U
INTELLECT-1 Unknown
20.2--13.1---N/A0K
164Meta logoLlama 4 Scout🇺🇸 MetaOpen18.90.50.0-35.8--$0.1010.0M
165
U
RedPajama-INCITE-7B-Base Unknown
18.0------N/A0K
166DeepSeek logoDeepSeek Coder 6.7B🇨🇳 DeepSeekOpen16.7------N/A0K
167
U
Magistral Small 1.1 Unknown
16.55.00.0-31.2--N/A0K
168Microsoft logoPhi-1.5🇺🇸 MicrosoftOpen16.3------N/A0K
169
U
stablelm-tuned-alpha-7b Unknown
13.6------N/A0K
170DeepSeek logoDeepSeek Coder 1.3B🇨🇳 DeepSeekOpen3.2------N/A0K
90+ Gold 80-89 70-79 60-69 <60Scores in % unless noted. Avg = unweighted mean across tested benchmarks.

Models ranked by reasoning performance across GPQA Diamond, ARC-AGI, BBH, and other logic and reasoning benchmarks. These tests measure abstract thinking, pattern recognition, and multi-step inference.

Which AI model has the best reasoning?

Reasoning rankings shift as new models launch. The live leaderboard above shows current standings based on GPQA Diamond, ARC-AGI, and other reasoning benchmarks.

What is GPQA Diamond?

GPQA Diamond is a graduate-level question answering benchmark designed to test deep reasoning. Questions are written by domain experts and verified to be answerable only with genuine understanding.

How does ARC-AGI measure reasoning?

ARC-AGI tests abstract reasoning through visual pattern puzzles that require novel inference, not memorization. It is considered one of the hardest AI benchmarks.