Benchmark · ReasoningSettled

Winogrande

WinoGrande · large-scale commonsense reasoning benchmark where models must resolve ambiguous pronouns in carefully constructed sentence pairs.

Updated 2025-04-15
Models tested
53
Top score
78.4
Llama 3.1 405B
Median
46.8
min 3.0
Top-5 spread
σ 1.5
Settled

Best score over time · one chart, every benchmark

WINOGRANDE8 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Sep 24Nov 24Dec 24Feb 25Apr 25RELEASE DATE →benchgecko.ai/benchmark/winogrande · frontier
Only 8 models have been tested on Winogrande · not enough history to compute a frontier yet.
Pink dots = frontier records · 0 totalClick to open model page

53 models tested · sorted by score

#ModelScore
1Meta logoLlama 3.1 405B78.4
2Anthropic logoClaude 3 Opus77.0
3OpenAI logoGPT-4 (older v0314)75.0
4OpenAI logoGPT-4 Turbo75.0
5TII logoFalcon-180B74.2
6DeepSeek logoDeepSeek-V2 (MoE-236B, May 2024)72.6
7DeepSeek logoDeepSeek V370.4
8Meta logoLlama 3 70B Instruct67.0
9Meta logoLlama 3-70B67.0
10
U
PaLM 2-L
66.0
11Alibaba Qwen logoQwen2.5 72B Instruct64.6
12OpenAI logoGPT-3.5 Turbo (older v0613)63.2
13Microsoft logophi-3-medium 14B63.0
14Microsoft logophi-3-small 7.4B63.0
15Alibaba Qwen logoQwen2.5 Coder 32B Instruct61.6
16
U
PaLM 2-M
58.4
17TII logoFalcon 2 11B56.6
18
U
Nemotron-4 15B
56.0
19
U
PaLM 2-S
55.8
20Mistral AI logoMixtral 8x7B54.4
21Mistral AI logoMixtral 8x7B Instruct54.4
22Alibaba logoQwen2.5 Coder 14B Instruct53.6
23Meta logoLlama 3 8B Instruct51.4
24Mistral AI logoMistral 7B V0.150.6
25Anthropic logoClaude 3 Sonnet50.2
26Anthropic logoClaude 3 Haiku48.4
27Microsoft logoPhi-1.546.8
28Meta logoLLaMA-13B46.0
29DeepSeek logoDeepSeek-Coder-V2-Lite-Base45.8
30Alibaba logoQwen2.5 Coder 7B Instruct45.8
31Alibaba Qwen logoQwen2.5 Coder 7B Instruct45.8
32Meta logoLlama 2-13B45.6
33
U
Yi 6B
42.6
34
U
MPT-30B
42.0
35Microsoft logophi-3-mini 3.8B41.6
36
U
vicuna-13b-v1.1
41.6
37Alibaba Qwen logoQwen2.5-Coder-3B34.8
38Meta logoopen_llama_7b34.0
39
U
INTELLECT-1
31.6
40Google DeepMind logoGemma 2B30.8
41
U
XGen-7B
29.8
42
U
StarCoder 2 15B
28.6
43
U
RedPajama-INCITE-7B-Base
27.6
44DeepSeek logoDeepSeek Coder 33B24.0
45
U
Dolly 2.0-12b
23.6
46OpenAI logoCerebras-GPT-13B21.6
47Alibaba logoQwen2.5 Coder 1.5B Instruct21.4
48Alibaba Qwen logoCodeQwen1.5-7B19.6
49DeepSeek logoDeepSeek Coder 6.7B15.2
50Alibaba logoQwen2.5 Coder 0.5B Instruct9.6
51Microsoft logoPhi 29.4
52DeepSeek logoDeepSeek Coder 1.3B6.6
53
U
stablelm-tuned-alpha-7b
3.0
Details
Category
Reasoning
Max score
100
Models
53
Updated
2025-04-15

Same category · related evaluations