Context · 128K+

Cheapest 128K context LLMs

Every LLM with a 128,000+ token context window. Ranked by input price per 1M tokens.

Models40
Cheapest$-1000000.00
Min context128K tokens
What this page is
128K is the modern baseline for LLM context. Every model priced per 1M tokens at 128K+ is listed here, cheapest first. For RAG pipelines, long conversations, and mid-sized documents, this is the sweet spot.

128K+ context models, cheapest first.

#ModelIn $/1MOut $/1MType
1openrouter logoAuto Router$-1000000.00$-1000000.00Closed
2openrouter logoBody Builder (beta)$-1000000.00$-1000000.00Closed
3openrouter logoFusion$-1000000.00$-1000000.00Closed
4openrouter logoPareto Code Router$-1000000.00$-1000000.00Closed
5openrouter logoElephant$0.00$0.00Closed
6openrouter logoFree Models Router$0.00$0.00Closed
7Google DeepMind logoGemma 3 27B (free)$0.00$0.00OSS
8Google DeepMind logoGemma 4 26B A4B (free)$0.00$0.00OSS
9Google DeepMind logoGemma 4 31B (free)$0.00$0.00OSS
10z-ai logoGLM 4.5 Air (free)$0.00$0.00OSS
11OpenAI logogpt-oss-120b (free)$0.00$0.00OSS
12OpenAI logogpt-oss-20b (free)$0.00$0.00OSS
13nousresearch logoHermes 3 405B Instruct (free)$0.00$0.00OSS
14tencent logoHy3 (free)$0.00$0.00Closed
15tencent logoHy3 preview (free)$0.00$0.00Closed
16
P
Laguna M.1 (free)
$0.00$0.00OSS
17
P
Laguna XS.2 (free)
$0.00$0.00OSS
18Meta logoLlama 3.2 3B Instruct (free)$0.00$0.00OSS
19Meta logoLlama 3.3 70B Instruct (free)$0.00$0.00OSS
20Meta logoLlama Guard 4 12B (free)$0.00$0.00Closed
21Google DeepMind logoLyria 3 Clip Preview$0.00$0.00Closed
22Google DeepMind logoLyria 3 Pro Preview$0.00$0.00Closed
23minimax logoMiniMax M2.5 (free)$0.00$0.00OSS
24Mistral AI logoMistral Small 3.1 24B (free)$0.00$0.00OSS
25NVIDIA logoNemotron 3 Nano 30B A3B (free)$0.00$0.00OSS
26NVIDIA logoNemotron 3 Nano Omni (free)$0.00$0.00OSS
27NVIDIA logoNemotron 3 Super (free)$0.00$0.00OSS
28NVIDIA logoNemotron 3 Ultra (free)$0.00$0.00OSS
29NVIDIA logoNemotron 3.5 Content Safety (free)$0.00$0.00OSS
30NVIDIA logoNemotron Nano 12B 2 VL (free)$0.00$0.00OSS
31NVIDIA logoNemotron Nano 9B V2 (free)$0.00$0.00OSS
32nex-agi logoNex-N2-Pro (free)$0.00$0.00OSS
33Cohere logoNorth Mini Code (free)$0.00$0.00OSS
34openrouter logoOwl Alpha$0.00$0.00Closed
35Alibaba Qwen logoQwen3 Coder 480B A35B (free)$0.00$0.00OSS
36Alibaba Qwen logoQwen3 Next 80B A3B Instruct (free)$0.00$0.00OSS
37Alibaba Qwen logoQwen3.6 Plus (free)$0.00$0.00Closed
38Alibaba Qwen logoQwen3.6 Plus Preview (free)$0.00$0.00OSS
39stepfun logoStep 3.5 Flash (free)$0.00$0.00OSS
40arcee-ai logoTrinity Large Preview (free)$0.00$0.00OSS
Cheapest
Auto Router
$-1000000.00/M
$ per 1M input tokens
Why the gap

At 128K, premium pricing pays for reasoning quality and vendor reliability, not window size. For RAG backbones, the cheap end almost always wins.

Most expensive
Elephant
$0.00/M
$ per 1M input tokens
For most production use cases, yes. 128K fits 300+ pages, a full API spec, or a large function library. Only reach for 200K+ when you regularly exceed 100K token prompts.