Benchmark · KnowledgeSettled

IFEval

Updated 2025-10-17
Models tested
78
Top score
90.0
Llama 3.3 70B Instruct
Median
39.8
min 6.0
Top-5 spread
σ 2.1
Competitive

Best score over time · one chart, every benchmark

IFEVAL34 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Aug 24Nov 24Mar 25Jul 25Oct 25RELEASE DATE →benchgecko.ai/benchmark/hf-ifeval · frontier
Only 34 models have been tested on IFEval · not enough history to compute a frontier yet.
Pink dots = frontier records · 1 totalClick to open model page

78 models tested · sorted by score

#ModelScore
1Meta logoLlama 3.3 70B Instruct90.0
2Meta logoLlama 3.1 70B Instruct86.7
3Alibaba Qwen logoQwen2.5 72B Instruct86.4
4
HA
Qwen2.5 72B Instruct Abliterated
85.9
5Alibaba logoQwen2.5 32B Instruct83.5
6Alibaba logoQwen2.5 14B Instruct81.4
7Google DeepMind logoGemma 2 27B79.8
8nousresearch logoHermes 3 70B Instruct76.6
9Alibaba Qwen logoQwen2.5 7B Instruct75.8
10Google DeepMind logoGemma 2 9B74.4
11Meta logoMeta Llama 3 8B Instruct74.1
12Meta logoLlama 3.2 3B Instruct73.9
13Microsoft logoPhi 4 Mini Instruct73.8
14Microsoft logoPhi 4 Mini Instruct73.8
15Alibaba Qwen logoQwen2.5 Coder 32B Instruct72.7
16Alibaba logoQwen2.5 Coder 14B Instruct69.1
17Microsoft logoPhi 468.8
18Alibaba logoQwen2.5 3B Instruct64.8
19Alibaba logoQwen2.5 Coder 7B Instruct61.0
20Alibaba Qwen logoQwen2.5 Coder 7B Instruct61.0
21Meta logoLlama 3.2 1B Instruct58.1
22Microsoft logoPhi 3.5 Mini Instruct57.8
23Alibaba logoQwen2 7B Instruct56.8
24Google DeepMind logoGemma 2 2b It56.7
25anthracite-org logoMagnum v4 72B56.3
26Mistral AI logoMistral 7B Instruct V0.255.0
27Microsoft logoPhi 3 Mini 4k Instruct54.8
28nousresearch logoHermes 2 Pro - Llama-3 8B53.6
29Microsoft logoWizardLM-2 8x22B52.7
30Meta logoLlama 3.1 8B Instruct50.6
31Alibaba logoQwen2 VL 7B Instruct46.0
32Mistral AI logoMistral 7B Instruct v0.144.9
33Alibaba logoQwen2.5 1.5B Instruct44.8
34DeepSeek logoDeepSeek R1 Distill Qwen 14B43.8
35DeepSeek logoR1 Distill Llama 70B43.4
36DeepSeek logoDeepSeek R1 Distill Qwen 32B41.9
37DeepSeek logoR1 Distill Qwen 32B41.9
38DeepSeek logoDeepSeek R1 Distill Qwen 7B40.4
39Meta logoLlama 2 7b Chat Hf39.9
40Alibaba Qwen logoQwQ 32B39.8
41
D
Dolphin 2.9.1 Yi 1.5 34b
38.5
42Alibaba Qwen logoQwen2-72B38.2
43
U
Stable Beluga 2
37.9
44DeepSeek logoDeepSeek R1 Distill Llama 8B37.8
45DeepSeek logoDeepSeek R1 Distill Qwen 1.5B34.6
46Alibaba logoQwen2 1.5B Instruct33.7
47Meta logoLlama 3-70B33.2
48TII logoFalcon-180B32.6
49Alibaba logoQwen2.5 0.5B Instruct31.5
50
U
Yi 6B
30.5
51
HF
SmolLM2 135M Instruct
28.8
52
U
StarCoder 2 15B
27.8
53Microsoft logoPhi 227.4
54Google DeepMind logoGemma 2B26.6
55Meta logoLLaMA-13B25.3
56Meta logoLlama 2 7b Hf25.2
57Meta logoLlama 3 8B Instruct24.0
58Mistral AI logoMistral 7B V0.123.9
59
L
Vicuna 7b V1.5
23.5
60Alibaba logoQwen2 0.5B Instruct22.5
61OpenAI logoGpt2 Medium22.1
62
U
MPT-30B
21.5
63
U
RedPajama-INCITE-7B-Base
20.8
64OpenAI logoGpt2 Large20.5
65Microsoft logoPhi-1.520.3
66Google DeepMind logoGemma 2 2b20.2
67eleutherai logoGpt Neo 125m19.1
68Alibaba logoQwen2 0.5B18.7
69
HF
SmolLM2 135M
18.2
70eleutherai logoPythia 160m18.2
71Meta logoLlama 3.1 405B18.1
72OpenAI logoGpt217.9
73
U
INTELLECT-1
17.6
74Meta logoMeta Llama 3 8B16.0
75z-ai logoGLM 4 32B 14.3
76Meta logoLlama 3.2 3B Instruct (free)13.4
77
D
Distilgpt2
6.1
78
T
TinyLlama 1.1B Chat V1.0
6.0

Same category · related evaluations