Tutti i sistemi · Tracked
Ogni sistema IA su scala rack di ogni produttore. Numero di GPU, FP8 PFLOPS, consumo energetico, tipo di raffreddamento, TCO per PFLOPS e deployment nei datacenter noti · da schede tecniche, earnings call e infrastrutture dichiarate.
- $973
- $1,469
- $1,768
- $2,063
- $3,306
- $14,734
- DGX GB300 NVL72 offre il TCO più basso a $973/PFLOPS/anno
- I sistemi raffreddati a liquido hanno in media un TCO inferiore del 6% rispetto a quelli raffreddati ad aria
- 4 sistemi su 8 in classifica sono basati su NVIDIA
Tabella sistemi
10 sistemi · ordinati per PFLOPS FP8 · tutti i produttori
| Sistema | GPU | FP8 PFLOPS |
|---|---|---|
TPU v5p Pod Google | 8,960 | 8,100 |
DGX GB300 NVL72 NVIDIA | 72 | 1,440 |
DGX GB200 NVL72 NVIDIA | 72 | 720 |
TPU v6e Pod Google | 256 | 230 |
Maia 100 Rack Microsoft | 32 | 96 |
DGX B200 NVIDIA | 8 | 80 |
MI325X Platform AMD | 8 | 48 |
Trn2 UltraServer AWS | 16 | 48 |
HGX H100 NVIDIA | 8 | 32 |
CS-3 Cerebras | 1 | n/d |
Confronto TCO
$/PFLOPS/anno · hardware ammortizzato su 3 anni + energia a $0,05/kWh · meno è meglio
Dettaglio raffreddamento
Liquido vs aria · statistiche di potenza · confronto efficienza
Il raffreddamento a liquido consente un PUE da 1,05 a 1,15 contro l'1,3-1,5 dell'aria. Su scala datacenter, questo si traduce in costi energetici inferiori del 15-30%. I sistemi a liquido permettono anche una maggiore densità di GPU per rack, riducendo la latenza di interconnessione e l'ingombro fisico. Ogni nuovo rack IA di punta (DGX GB200, cluster MI350X) viene consegnato con raffreddamento a liquido di serie.
Deployment noti
19 implementazioni dichiarate · chi costruisce cosa
| Operatore | Sistema |
|---|---|
OC Oracle Cloud | |
Tutti i sistemi
10 sistemi · 6 produttori
Google's high-performance TPU pod for large-scale training. 8,960 TPU v5p chips in a single pod connected via ICI 3.0 fabric. Powers Gemini ...
Next-gen liquid-cooled rack with Blackwell Ultra GPUs. 72x B300 GPUs with 288 GB HBM3e per GPU (vs 192 GB on B200). Designed for reasoning-h...
NVIDIA's flagship liquid-cooled rack. 72 Blackwell GPUs + 36 Grace CPUs connected via NVLink 5.0 in a single 72-GPU domain. Designed for tri...
Google's latest custom AI accelerator in pod configuration. 256 TPU v6e chips connected via custom ICI (Inter-Chip Interconnect). Optimized ...
Microsoft's first custom AI silicon at rack scale. Maia 100 chips fabricated at TSMC on N5 with HBM3e. Designed for Azure AI inference and f...
8-GPU Blackwell node for enterprises that don't need the full NVL72 rack. Air-cooled with NVLink 4.0 interconnect. The workhorse for inferen...
AMD's latest 8-GPU OAM platform with MI325X accelerators. 256 GB HBM3e per GPU for the largest memory footprint in its class. Infinity Fabri...
AWS custom silicon training server. 16x Trainium2 chips in a single UltraServer node connected via NeuronLink. Designed to compete with NVID...
The system that launched the AI infrastructure boom. 8x H100 SXM GPUs connected via NVLink 4.0. Still the most widely deployed AI training s...
Wafer-scale AI compute appliance. A single CS-3 contains one WSE-3 chip (the largest chip ever made, using an entire 300mm wafer). 44 GB of ...
Domande frequenti
Estratte dal dataset live · aggiornate ogni giorno
Che cos'è un DGX GB200 NVL72?
Il DGX GB200 NVL72 è il rack di calcolo AI di punta di NVIDIA. Contiene 72 GPU Blackwell e 36 CPU Grace in un singolo rack raffreddato a liquido, collegati tramite NVLink 5.0. Offre fino a 720 PFLOPS di calcolo FP8 e richiede oltre 120 kW di potenza. È il sistema che addestra i più grandi modelli AI di Microsoft, Oracle, CoreWeave e xAI.
Che cosa significa TCO per PFLOPS?
Il costo totale di proprietà per PFLOPS all'anno riporta il costo dei diversi sistemi AI a una metrica confrontabile. Include il costo dell'hardware (ammortizzato su 3 anni) più i costi energetici (a una tariffa media da datacenter di $0,05/kWh), divisi per la capacità di calcolo FP8 del sistema in PFLOPS. Più basso è meglio. È la metrica che gli operatori di datacenter ottimizzano quando scelgono tra NVIDIA, AMD, Google TPU o silicio personalizzato.
Perché alcuni sistemi richiedono il raffreddamento a liquido?
I chip AI moderni consumano 700-1200 W ciascuno. Un rack NVL72 con 72 GPU da 1000 W genera 72 kW di calore solo dalle GPU. Il raffreddamento ad aria non riesce a smaltire in modo efficiente tanto calore. Il raffreddamento a liquido (direct-to-chip o a immersione) è da 10 a 100 volte più efficace nel trasferimento di calore, e consente una maggiore densità di GPU per rack, un PUE più basso (1,1 contro 1,3-1,5 dell'aria) e prestazioni più alte dei chip grazie a una migliore gestione termica.
Come si confronta un pod TPU con un rack NVIDIA DGX?
I pod Google TPU e i rack NVIDIA DGX hanno architetture fondamentalmente diverse. Un pod TPU v5p può contenere 8.960 chip in un unico dominio interconnesso tramite fabric ICI. L'NVL72 di NVIDIA è un sistema su scala di rack da 72 GPU. I pod TPU offrono un parallelismo enorme per le architetture di modelli di Google, ma sono disponibili solo su Google Cloud. I sistemi DGX sono disponibili presso vari OEM per l'installazione on-premise.
Che cos'è il Cerebras CS-3 e perché è diverso?
Il Cerebras CS-3 usa un singolo chip WSE-3, il più grande mai realizzato, che occupa un intero wafer di silicio da 300 mm. Invece di usare stack HBM, dispone di 44 GB di SRAM on-chip per un accesso alla memoria a latenza zero. Questo elimina il collo di bottiglia della banda di memoria che limita i sistemi GPU convenzionali. Il compromesso è un costo più alto per sistema e un modello di programmazione diverso.
Perché gli hyperscaler costruiscono silicio personalizzato?
Google (TPU), AWS (Trainium), Microsoft (Maia) e Meta (MTIA) stanno tutti realizzando chip AI personalizzati per ridurre la dipendenza da NVIDIA, ottimizzare per i propri carichi di lavoro e abbassare i costi su larga scala. Ai volumi degli hyperscaler (centinaia di migliaia di chip), anche un guadagno di efficienza del 10-20% rispetto a NVIDIA si traduce in miliardi di risparmi. Il silicio personalizzato offre inoltre una diversificazione della catena di fornitura.
Vedi anche
Continua a esplorare il grafo compute