Benchmark · KnowledgeSettled

MMLU

Massive Multitask Language Understanding · 57 subjects spanning STEM, humanities, social sciences, and more. The standard benchmark for broad knowledge.

Updated 2025-04-15
Models tested
80
Top score
82.9
DeepSeek V3
Median
60.8
min 1.1
Top-5 spread
σ 0.6
Settled

Best score over time · one chart, every benchmark

MMLU13 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Sep 24Nov 24Dec 24Feb 25Apr 25RELEASE DATE →benchgecko.ai/benchmark/mmlu · frontier
Only 13 models have been tested on MMLU · not enough history to compute a frontier yet.
Pink dots = frontier records · 1 totalClick to open model page

80 models tested · sorted by score

#ModelScore
1DeepSeek logoDeepSeek V382.9
2Anthropic logoClaude 3.5 Sonnet82.0
3OpenAI logoGPT-4 (older v0314)81.9
4Meta logoLlama 3.3 70B Instruct (free)81.7
5Google DeepMind logoGemini 1.5 Pro (May 2024)81.2
6Alibaba Qwen logoQwen2.5 72B Instruct80.4
7Microsoft logoPhi 479.7
8Anthropic logoClaude 3 Opus79.5
9Meta logoLlama 3.1 405B79.3
10OpenAI logoGPT-4o (2024-08-06)79.1
11OpenAI logoGPT-4o (2024-11-20)79.1
12OpenAI logoGPT-4o (2024-05-13)78.9
13Google DeepMind logoGemini 1.5 Pro (Feb 2024)76.9
14OpenAI logoGPT-4 Turbo76.5
15Alibaba Qwen logoQwen2-72B76.5
16OpenAI logoGPT-4o-mini75.7
17OpenAI logoGPT-4o-mini (2024-07-18)75.7
18Meta logoLlama 3.2 90B73.7
19Meta logoLlama 3.1 70B Instruct73.5
20Mistral AI logoMistral Large 240773.3
21Google DeepMind logoGemini 2.0 Flash72.9
22Google DeepMind logoGemini 2.0 Flash (Dec 2024)72.9
23Meta logoLlama 3 70B Instruct72.4
24Meta logoLlama 3-70B72.4
25Alibaba Qwen logoQwen2.5 Coder 32B Instruct72.1
26Anthropic logoClaude 271.3
27DeepSeek logoDeepSeek-V2 (MoE-236B, May 2024)71.2
28Microsoft logophi-3-medium 14B70.7
29Google DeepMind logoGemini 1.5 Flash (May 2024)70.5
30Mistral AI logoMixtral 8x22B Instruct70.4
31Anthropic logoClaude 3 Sonnet67.9
32Google DeepMind logoGemma 2 27B67.6
33Microsoft logophi-3-small 7.4B67.6
34Alibaba logoQwen2.5 Coder 14B Instruct66.9
35Anthropic logoClaude 3.5 Haiku65.7
36Anthropic logoClaude 3 Haiku65.1
37Anthropic logoClaude 2.164.7
38Anthropic logoClaude Instant64.5
39Google DeepMind logoGemma 2 9B62.8
40TII logoFalcon-180B60.8
41Mistral AI logoMixtral 8x7B60.8
42Mistral AI logoMixtral 8x7B Instruct60.8
43Google DeepMind logoGemini 1.0 Pro60.0
44Meta logoLlama 3 8B Instruct58.4
45Mistral AI logoMistral Large58.4
46Microsoft logophi-3-mini 3.8B58.4
47
U
Stable Beluga 2
58.1
48Alibaba logoQwen2.5 Coder 7B Instruct57.3
49Alibaba Qwen logoQwen2.5 Coder 7B Instruct57.3
50OpenAI logoGPT-3.5 Turbo (older v0613)56.4
51Alibaba Qwen logoQwen-14B55.1
52
U
StarCoder 2 15B
52.1
53
U
Yi 6B
52.0
54Mistral AI logoMistral 7B V0.150.0
55DeepSeek logoDeepSeek-Coder-V2-Lite-Base47.3
56
U
Nemotron-4 15B
44.9
57TII logoFalcon 2 11B44.5
58Microsoft logoPhi 244.5
59Meta logoLlama 3.1 8B Instruct41.5
60Meta logoLlama 2-13B40.8
61
U
Baichuan 2-7B
38.9
62Alibaba logoQwen2.5 Coder 1.5B Instruct38.1
63
U
internlm-20b
34.7
64
U
INTELLECT-1
33.2
65
U
MPT-30B
30.5
66Meta logoLLaMA-13B30.3
67
U
Baichuan1-7B
23.1
68Google DeepMind logoGemma 2B23.1
69Alibaba logoQwen2.5 Coder 0.5B Instruct22.7
70Alibaba Qwen logoCodeQwen1.5-7B20.7
71DeepSeek logoDeepSeek Coder 33B19.2
72Microsoft logoPhi-1.516.8
73DeepSeek logoDeepSeek Coder 6.7B15.2
74
U
XGen-7B
15.1
75Meta logoopen_llama_7b6.5
76Alibaba Qwen logoQwen-1_8B4.3
77
U
RedPajama-INCITE-7B-Base
1.7
78OpenAI logoCerebras-GPT-13B1.6
79
U
Dolly 2.0-12b
1.6
80DeepSeek logoDeepSeek Coder 1.3B1.1

Same category · related evaluations