Benchmark · KnowledgeSettled

LiveBench · Reasoning

Updated 2026-06-16
Models tested
40
Top score
84.6
GPT-5.1-Codex-Max
Median
62.5
min 17.4
Top-5 spread
σ 0.9
Settled

Best score over time · one chart, every benchmark

LIVEBENCH · REASONING40 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Jul 25Oct 25Jan 26Mar 26Jun 26RELEASE DATE →benchgecko.ai/benchmark/livebench-reasoning · frontier
Frontier on LiveBench · Reasoning rose from 58.4 to 84.6 in 5 months · +26.1 points · latest leader GPT-5.1-Codex-Max from OpenAI.
Pink dots = frontier records · 6 totalClick to open model page

Same category · related evaluations