Benchmark · ReasoningCompetitive

Balrog

Balrog · benchmarks AI agents on text-based adventure games, testing language understanding, strategic planning, and long-horizon reasoning.

Updated 2026-02-19
Models tested
27
Top score
58.1
Gemini 3 Pro
Median
29.5
min 11.6
Top-5 spread
σ 6.3
wide open

Best score over time · one chart, every benchmark

BALROG12 MODELS · FRONTIER RUNNING MAX0255075100SCORE ↑Sep 24Jan 25Jun 25Oct 25Feb 26RELEASE DATE →benchgecko.ai/benchmark/balrog · frontier
Frontier on Balrog rose from 34.9 to 57.0 in 13 months · +22.1 points · latest leader Gemini 3.1 Pro Preview from Google DeepMind.
Pink dots = frontier records · 5 totalClick to open model page
Details
Category
Reasoning
Max score
100
Models
27
Updated
2026-02-19

Same category · related evaluations