Compare · ModelsLive · 2 picked · head to head

gpt-oss-20b vs Qwen3 235B A22B Instruct 2507

Side by side · benchmarks, pricing, and signals you can act on.

Winner summary

Qwen3 235B A22B Instruct 2507 wins 6 of 10 shared benchmarks. Leads in arena · general · knowledge.

Category leads
arena·Qwen3 235B A22B Instruct 2507general·Qwen3 235B A22B Instruct 2507math·gpt-oss-20bknowledge·Qwen3 235B A22B Instruct 2507language·gpt-oss-20bcoding·gpt-oss-20b
Hype vs Reality
gpt-oss-20b
#97 by perf·no signal
QUIET
Qwen3 235B A22B Instruct 2507
#134 by perf·#2 by attention
DESERVED
Best value
6.5x better value than Qwen3 235B A22B Instruct 2507
gpt-oss-20b
983.3 pts/$
$0.05/M
Qwen3 235B A22B Instruct 2507
150.9 pts/$
$0.32/M
Vendor risk
OpenAI logo
OpenAI
$840.0B·Tier 1
Medium risk
Alibaba Qwen logo
Alibaba (Qwen)
$293.0B·Tier 1
Low risk
Head to head
gpt-oss-20bQwen3 235B A22B Instruct 2507
Chatbot Arena Elo · Overall
Qwen3 235B A22B Instruct 2507 leads by +104.8
gpt-oss-20b
1317.6
Qwen3 235B A22B Instruct 2507
1422.4
Dtbench
Qwen3 235B A22B Instruct 2507 leads by +17.3
gpt-oss-20b
46.7
Qwen3 235B A22B Instruct 2507
64.0
Lmca
Qwen3 235B A22B Instruct 2507 leads by +10.6
gpt-oss-20b
17.1
Qwen3 235B A22B Instruct 2507
27.7
OpenCompass · AIME2025
gpt-oss-20b leads by +18.4
gpt-oss-20b
87.9
Qwen3 235B A22B Instruct 2507
69.5
OpenCompass · GPQA-Diamond
Qwen3 235B A22B Instruct 2507 leads by +6.6
gpt-oss-20b
68.9
Qwen3 235B A22B Instruct 2507
75.5
OpenCompass · HLE
Qwen3 235B A22B Instruct 2507 leads by +0.7
gpt-oss-20b
11.6
Qwen3 235B A22B Instruct 2507
12.3
OpenCompass · IFEval
gpt-oss-20b leads by +0.6
gpt-oss-20b
88.9
Qwen3 235B A22B Instruct 2507
88.3
OpenCompass · LiveCodeBenchV6
gpt-oss-20b leads by +25.4
gpt-oss-20b
68.4
Qwen3 235B A22B Instruct 2507
43.0
OpenCompass · MMLU-Pro
Qwen3 235B A22B Instruct 2507 leads by +6.4
gpt-oss-20b
72.8
Qwen3 235B A22B Instruct 2507
79.2
WeirdML
gpt-oss-20b leads by +2.2
WeirdML · tests models on unusual and adversarial machine learning tasks that require creative problem-solving beyond standard patterns.
gpt-oss-20b
40.9
Qwen3 235B A22B Instruct 2507
38.7
Full benchmark table
Benchmarkgpt-oss-20bQwen3 235B A22B Instruct 2507
Chatbot Arena Elo · Overall
1317.61422.4
Dtbench
46.764.0
Lmca
17.127.7
OpenCompass · AIME2025
87.969.5
OpenCompass · GPQA-Diamond
68.975.5
OpenCompass · HLE
11.612.3
OpenCompass · IFEval
88.988.3
OpenCompass · LiveCodeBenchV6
68.443.0
OpenCompass · MMLU-Pro
72.879.2
WeirdML
WeirdML · tests models on unusual and adversarial machine learning tasks that require creative problem-solving beyond standard patterns.
40.938.7
Pricing · per 1M tokens · projected $/mo at 10M tokens
ModelInputOutputContextProjected $/mo
OpenAI logogpt-oss-20b$0.02$0.09131K tokens (~66 books)$0.36
Alibaba Qwen logoQwen3 235B A22B Instruct 2507$0.09$0.55262K tokens (~131 books)$2.05