Compare · ModelsLive · 2 picked · head to head

RedPajama-INCITE-7B-Base vs Phi-1.5

Side by side · benchmarks, pricing, and signals you can act on.

Winner summary

Phi-1.5 wins 8 of 11 shared benchmarks. Leads in knowledge · general · math.

Category leads
knowledge·Phi-1.5general·Phi-1.5language·RedPajama-INCITE-7B-Basemath·Phi-1.5reasoning·Phi-1.5
Hype vs Reality
RedPajama-INCITE-7B-Base
#257 by perf·no signal
QUIET
Phi-1.5
#260 by perf·no signal
QUIET
Best value
RedPajama-INCITE-7B-Base
no price
Phi-1.5
no price
Vendor risk
U
Unknown
private · undisclosed
Unknown
Microsoft logo
Microsoft
$3.00T·Big Tech
Low risk
Head to head
RedPajama-INCITE-7B-BasePhi-1.5
ARC AI2
Phi-1.5 leads by +7.1
AI2 Reasoning Challenge · tests grade-school level science knowledge with multiple-choice questions requiring reasoning beyond simple retrieval.
RedPajama-INCITE-7B-Base
18.8
Phi-1.5
25.9
HellaSwag
RedPajama-INCITE-7B-Base leads by +30.3
HellaSwag · tests commonsense reasoning by asking models to predict the most plausible continuation of everyday scenarios.
RedPajama-INCITE-7B-Base
60.4
Phi-1.5
30.1
BBH (HuggingFace)
Phi-1.5 leads by +2.4
RedPajama-INCITE-7B-Base
5.1
Phi-1.5
7.5
GPQA
Phi-1.5 leads by +1.7
RedPajama-INCITE-7B-Base
0.7
Phi-1.5
2.4
IFEval
RedPajama-INCITE-7B-Base leads by +0.5
RedPajama-INCITE-7B-Base
20.8
Phi-1.5
20.3
MATH Level 5
Phi-1.5 leads by +0.2
RedPajama-INCITE-7B-Base
1.6
Phi-1.5
1.8
MMLU-PRO
Phi-1.5 leads by +5.5
RedPajama-INCITE-7B-Base
2.2
Phi-1.5
7.7
MUSR
Phi-1.5 leads by +0.4
RedPajama-INCITE-7B-Base
3.0
Phi-1.5
3.4
MMLU
Phi-1.5 leads by +15.1
Massive Multitask Language Understanding · 57 subjects spanning STEM, humanities, social sciences, and more. The standard benchmark for broad knowledge.
RedPajama-INCITE-7B-Base
1.7
Phi-1.5
16.8
OpenBookQA
RedPajama-INCITE-7B-Base leads by +3.7
OpenBookQA · science questions that require combining a given core fact with broad common knowledge, mimicking an open-book exam setting.
RedPajama-INCITE-7B-Base
20.0
Phi-1.5
16.3
Winogrande
Phi-1.5 leads by +19.2
WinoGrande · large-scale commonsense reasoning benchmark where models must resolve ambiguous pronouns in carefully constructed sentence pairs.
RedPajama-INCITE-7B-Base
27.6
Phi-1.5
46.8
Full benchmark table
BenchmarkRedPajama-INCITE-7B-BasePhi-1.5
ARC AI2
AI2 Reasoning Challenge · tests grade-school level science knowledge with multiple-choice questions requiring reasoning beyond simple retrieval.
18.825.9
HellaSwag
HellaSwag · tests commonsense reasoning by asking models to predict the most plausible continuation of everyday scenarios.
60.430.1
BBH (HuggingFace)
5.17.5
GPQA
0.72.4
IFEval
20.820.3
MATH Level 5
1.61.8
MMLU-PRO
2.27.7
MUSR
3.03.4
MMLU
Massive Multitask Language Understanding · 57 subjects spanning STEM, humanities, social sciences, and more. The standard benchmark for broad knowledge.
1.716.8
OpenBookQA
OpenBookQA · science questions that require combining a given core fact with broad common knowledge, mimicking an open-book exam setting.
20.016.3
Winogrande
WinoGrande · large-scale commonsense reasoning benchmark where models must resolve ambiguous pronouns in carefully constructed sentence pairs.
27.646.8
Pricing · per 1M tokens · projected $/mo at 10M tokens
ModelInputOutputContextProjected $/mo
U
RedPajama-INCITE-7B-Base
Microsoft logoPhi-1.5