Cada Sistema · Tracked
Cada sistema IA em escala de rack de cada fabricante. Contagem de GPUs, FP8 PFLOPS, consumo de energia, tipo de resfriamento, TCO por PFLOPS e implantações conhecidas · extraído de datasheets, earnings calls e builds de infraestrutura divulgados.
- $973
- $1,469
- $1,768
- $2,063
- $3,306
- $14,734
- DGX GB300 NVL72 oferece o menor TCO, de $973/PFLOPS/ano
- Sistemas com refrigeração líquida têm em média 6% menos TCO que os refrigerados a ar
- 4 de 8 sistemas no ranking são baseados em NVIDIA
Tabela de sistemas
10 sistemas · ordenados por FP8 PFLOPS · todos os fabricantes
| Sistema | GPUs | FP8 PFLOPS |
|---|---|---|
TPU v5p Pod Google | 8,960 | 8,100 |
DGX GB300 NVL72 NVIDIA | 72 | 1,440 |
DGX GB200 NVL72 NVIDIA | 72 | 720 |
TPU v6e Pod Google | 256 | 230 |
Maia 100 Rack Microsoft | 32 | 96 |
DGX B200 NVIDIA | 8 | 80 |
MI325X Platform AMD | 8 | 48 |
Trn2 UltraServer AWS | 16 | 48 |
HGX H100 NVIDIA | 8 | 32 |
CS-3 Cerebras | 1 | n/d |
Comparação de TCO
$/PFLOPS/ano · hardware amortizado em 3 anos + energia a $0.05/kWh · menor é melhor
Detalhamento de resfriamento
Líquido vs ar · estatísticas de potência · comparação de eficiência
Resfriamento líquido permite PUE de 1.05 a 1.15 vs 1.3 a 1.5 pra ar. Em escala de datacenter, isso se traduz em 15 a 30% menos custo de energia. Sistemas com resfriamento líquido também permitem maior densidade de GPU por rack, reduzindo latência de interconexão e área física. Cada novo rack IA relevante (DGX GB200, MI350X cluster) vem com resfriamento líquido de fábrica.
Implantações conhecidas
19 implantações divulgadas · quem está construindo o quê
| Operador | Sistema |
|---|---|
OC Oracle Cloud | |
Todos os sistemas
10 sistemas · 6 fabricantes
Google's high-performance TPU pod for large-scale training. 8,960 TPU v5p chips in a single pod connected via ICI 3.0 fabric. Powers Gemini ...
Next-gen liquid-cooled rack with Blackwell Ultra GPUs. 72x B300 GPUs with 288 GB HBM3e per GPU (vs 192 GB on B200). Designed for reasoning-h...
NVIDIA's flagship liquid-cooled rack. 72 Blackwell GPUs + 36 Grace CPUs connected via NVLink 5.0 in a single 72-GPU domain. Designed for tri...
Google's latest custom AI accelerator in pod configuration. 256 TPU v6e chips connected via custom ICI (Inter-Chip Interconnect). Optimized ...
Microsoft's first custom AI silicon at rack scale. Maia 100 chips fabricated at TSMC on N5 with HBM3e. Designed for Azure AI inference and f...
8-GPU Blackwell node for enterprises that don't need the full NVL72 rack. Air-cooled with NVLink 4.0 interconnect. The workhorse for inferen...
AMD's latest 8-GPU OAM platform with MI325X accelerators. 256 GB HBM3e per GPU for the largest memory footprint in its class. Infinity Fabri...
AWS custom silicon training server. 16x Trainium2 chips in a single UltraServer node connected via NeuronLink. Designed to compete with NVID...
The system that launched the AI infrastructure boom. 8x H100 SXM GPUs connected via NVLink 4.0. Still the most widely deployed AI training s...
Wafer-scale AI compute appliance. A single CS-3 contains one WSE-3 chip (the largest chip ever made, using an entire 300mm wafer). 44 GB of ...
Perguntas frequentes
Extraído do dataset ao vivo · atualizado diariamente
O que é um DGX GB200 NVL72?
O DGX GB200 NVL72 é o rack de computação de IA principal da NVIDIA. Ele reúne 72 GPUs Blackwell e 36 CPUs Grace em um único rack refrigerado a líquido, conectados via NVLink 5.0. Entrega até 720 PFLOPS de computação FP8 e exige mais de 120 kW de energia. É o sistema que treina os maiores modelos de IA na Microsoft, Oracle, CoreWeave e xAI.
O que significa TCO por PFLOPS?
O Custo Total de Propriedade por PFLOPS por ano normaliza o custo de diferentes sistemas de IA em uma métrica comparável. Inclui o custo de hardware (amortizado em 3 anos) mais o custo de energia (a uma tarifa média de datacenter de US$ 0,05/kWh), dividido pela capacidade de computação FP8 do sistema em PFLOPS. Quanto menor, melhor. Essa é a métrica que operadores de datacenter otimizam ao escolher entre NVIDIA, AMD, Google TPU ou silício customizado.
Por que alguns sistemas exigem refrigeração líquida?
Chips de IA modernos consomem de 700 a 1200 W cada. Um rack NVL72 com 72 GPUs de 1000 W gera 72 kW de calor só nas GPUs. A refrigeração a ar não consegue remover tanto calor de forma eficiente. A refrigeração líquida (direct-to-chip ou por imersão) é de 10 a 100 vezes mais eficaz na transferência de calor, permitindo maior densidade de GPUs por rack, PUE menor (1,1 contra 1,3 a 1,5 do ar) e melhor desempenho dos chips graças ao melhor gerenciamento térmico.
Como um pod TPU se compara a um rack NVIDIA DGX?
Pods TPU do Google e racks NVIDIA DGX têm arquiteturas fundamentalmente diferentes. Um pod TPU v5p pode conter 8.960 chips em um único domínio interconectado via ICI. O NVL72 da NVIDIA é um sistema em escala de rack com 72 GPUs. Os pods TPU oferecem paralelismo massivo para as arquiteturas de modelo do próprio Google, mas só estão disponíveis no Google Cloud. Os sistemas DGX estão disponíveis em vários OEMs para implantação on-premise.
O que é o Cerebras CS-3 e por que ele é diferente?
O Cerebras CS-3 usa um único chip WSE-3, o maior já fabricado, ocupando um wafer de silício inteiro de 300 mm. Em vez de pilhas de HBM, ele tem 44 GB de SRAM no chip, com acesso à memória sem latência. Isso elimina o gargalo de largura de banda de memória que limita os sistemas de GPU convencionais. Em contrapartida, o custo por sistema é maior e o modelo de programação é diferente.
Por que os hyperscalers estão criando silício customizado?
Google (TPU), AWS (Trainium), Microsoft (Maia) e Meta (MTIA) estão desenvolvendo chips de IA próprios para reduzir a dependência da NVIDIA, otimizar para suas cargas de trabalho específicas e cortar custos em escala. No volume de um hyperscaler (centenas de milhares de chips), até um ganho de eficiência de 10 a 20% sobre a NVIDIA representa bilhões em economia. O silício customizado também diversifica a cadeia de suprimentos.
Veja também
Continue explorando o grafo de compute