Benchmark · CodeCompetitive

GSO-Bench

GSO-Bench · evaluates AI models on real-world open-source software engineering tasks, testing the ability to understand and resolve actual GitHub issues.

Updated 2026-04-16
Models tested
20
Top score
44.1
Claude Opus 4.7
Median
9.3
min 1.3
Top-5 spread
σ 7.2
wide open

Best score over time · one chart, every benchmark

GSO-BENCH17 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Jan 25May 25Sep 25Dec 25Apr 26RELEASE DATE →benchgecko.ai/benchmark/gso-bench · frontier
Frontier on GSO-Bench rose from 1.3 to 44.1 in 15 months · +42.8 points · latest leader Claude Opus 4.7 from Anthropic.
Pink dots = frontier records · 7 totalClick to open model page

Same category · related evaluations