Chaque système · Tracked
Chaque système IA à l'échelle du rack, de chaque fabricant. Nombre de GPU, PFLOPS FP8, puissance, type de refroidissement, TCO par PFLOPS et déploiements connus · issus des fiches techniques, appels de résultats et builds d'infrastructure divulgués.
- $973
- $1,469
- $1,768
- $2,063
- $3,306
- $14,734
- DGX GB300 NVL72 offre le TCO le plus bas à $973/PFLOPS/an
- Les systèmes refroidis par liquide ont un TCO inférieur de 6 % en moyenne à ceux refroidis par air
- 4 des 8 systèmes classés sont basés sur NVIDIA
Table des systèmes
10 systèmes · triés par PFLOPS FP8 · tous fabricants
| Système | GPU | FP8 PFLOPS |
|---|---|---|
TPU v5p Pod Google | 8,960 | 8,100 |
DGX GB300 NVL72 NVIDIA | 72 | 1,440 |
DGX GB200 NVL72 NVIDIA | 72 | 720 |
TPU v6e Pod Google | 256 | 230 |
Maia 100 Rack Microsoft | 32 | 96 |
DGX B200 NVIDIA | 8 | 80 |
MI325X Platform AMD | 8 | 48 |
Trn2 UltraServer AWS | 16 | 48 |
HGX H100 NVIDIA | 8 | 32 |
CS-3 Cerebras | 1 | n/d |
Comparaison TCO
$/PFLOPS/an · matériel amorti sur 3 ans + énergie à 0,05$/kWh · plus bas = mieux
Répartition du refroidissement
Liquide vs air · stats de puissance · comparaison d'efficacité
Le refroidissement liquide permet un PUE de 1,05 à 1,15 contre 1,3 à 1,5 pour l'air. À l'échelle d'un datacenter, cela se traduit par 15 à 30% de coûts énergétiques en moins. Les systèmes refroidis par liquide permettent aussi une densité GPU par rack plus élevée, réduisant la latence d'interconnexion et l'empreinte physique. Chaque nouveau rack IA majeur (DGX GB200, cluster MI350X) est livré refroidi par liquide par défaut.
Déploiements connus
19 déploiements divulgués · qui construit quoi
| Opérateur | Système |
|---|---|
OC Oracle Cloud | |
Tous les systèmes
10 systèmes · 6 fabricants
Google's high-performance TPU pod for large-scale training. 8,960 TPU v5p chips in a single pod connected via ICI 3.0 fabric. Powers Gemini ...
Next-gen liquid-cooled rack with Blackwell Ultra GPUs. 72x B300 GPUs with 288 GB HBM3e per GPU (vs 192 GB on B200). Designed for reasoning-h...
NVIDIA's flagship liquid-cooled rack. 72 Blackwell GPUs + 36 Grace CPUs connected via NVLink 5.0 in a single 72-GPU domain. Designed for tri...
Google's latest custom AI accelerator in pod configuration. 256 TPU v6e chips connected via custom ICI (Inter-Chip Interconnect). Optimized ...
Microsoft's first custom AI silicon at rack scale. Maia 100 chips fabricated at TSMC on N5 with HBM3e. Designed for Azure AI inference and f...
8-GPU Blackwell node for enterprises that don't need the full NVL72 rack. Air-cooled with NVLink 4.0 interconnect. The workhorse for inferen...
AMD's latest 8-GPU OAM platform with MI325X accelerators. 256 GB HBM3e per GPU for the largest memory footprint in its class. Infinity Fabri...
AWS custom silicon training server. 16x Trainium2 chips in a single UltraServer node connected via NeuronLink. Designed to compete with NVID...
The system that launched the AI infrastructure boom. 8x H100 SXM GPUs connected via NVLink 4.0. Still the most widely deployed AI training s...
Wafer-scale AI compute appliance. A single CS-3 contains one WSE-3 chip (the largest chip ever made, using an entire 300mm wafer). 44 GB of ...
Questions fréquentes
Extrait du dataset live · mis à jour chaque jour
Qu'est-ce que le DGX GB200 NVL72 ?
Le DGX GB200 NVL72 est le rack de calcul IA phare de NVIDIA. Il réunit 72 GPU Blackwell et 36 CPU Grace dans un seul rack refroidi par liquide, reliés par NVLink 5.0. Il délivre jusqu'à 720 PFLOPS en FP8 et exige plus de 120 kW de puissance. C'est le système qui entraîne les plus grands modèles d'IA chez Microsoft, Oracle, CoreWeave et xAI.
Que signifie le TCO par PFLOPS ?
Le coût total de possession par PFLOPS et par an ramène le coût de différents systèmes d'IA à une métrique comparable. Il inclut le coût du matériel (amorti sur 3 ans) plus le coût énergétique (au tarif moyen de 0,05 $/kWh pour un datacenter), divisés par la puissance de calcul FP8 du système en PFLOPS. Plus c'est bas, mieux c'est. C'est la métrique que les exploitants de datacenters optimisent pour choisir entre NVIDIA, AMD, Google TPU ou du silicium sur mesure.
Pourquoi certains systèmes exigent-ils un refroidissement liquide ?
Les puces IA modernes consomment 700 à 1200 W chacune. Un rack NVL72 avec 72 GPU de 1000 W produit 72 kW de chaleur rien que pour les GPU. Le refroidissement par air ne peut pas évacuer autant de chaleur efficacement. Le refroidissement liquide (direct sur la puce ou par immersion) transfère la chaleur 10 à 100 fois mieux, ce qui permet une plus forte densité de GPU par rack, un PUE plus bas (1,1 contre 1,3 à 1,5 pour l'air) et de meilleures performances grâce à une meilleure gestion thermique.
Comment un pod TPU se compare-t-il à un rack NVIDIA DGX ?
Les pods Google TPU et les racks NVIDIA DGX reposent sur des architectures fondamentalement différentes. Un pod TPU v5p peut contenir 8 960 puces dans un seul domaine interconnecté via le fabric ICI. Le NVL72 de NVIDIA est un système de 72 GPU à l'échelle du rack. Les pods TPU offrent un parallélisme massif pour les architectures de modèles de Google, mais ne sont disponibles que sur Google Cloud. Les systèmes DGX sont proposés par plusieurs OEM pour un déploiement sur site.
Qu'est-ce que le Cerebras CS-3 et en quoi est-il différent ?
Le Cerebras CS-3 utilise une seule puce WSE-3, la plus grande jamais fabriquée, qui occupe une tranche de silicium entière de 300 mm. Au lieu de piles HBM, elle dispose de 44 Go de SRAM sur puce pour un accès mémoire sans latence. Cela supprime le goulet d'étranglement de bande passante mémoire des systèmes GPU classiques. En contrepartie, le coût par système est plus élevé et le modèle de programmation diffère.
Pourquoi les hyperscalers conçoivent-ils leur propre silicium ?
Google (TPU), AWS (Trainium), Microsoft (Maia) et Meta (MTIA) conçoivent tous des puces IA sur mesure pour réduire leur dépendance à NVIDIA, optimiser leurs charges de travail spécifiques et baisser les coûts à grande échelle. Au volume des hyperscalers (des centaines de milliers de puces), un gain d'efficacité de 10 à 20 % face à NVIDIA représente des milliards d'économies. Le silicium sur mesure permet aussi de diversifier la chaîne d'approvisionnement.
Voir aussi
Continuez à explorer le graphe de compute