Compute · SistemasInfraestrutura IA em escala de rack · Data as of 14 de abr. de 2026 · curated dataset

Cada Sistema · Tracked

Cada sistema IA em escala de rack de cada fabricante. Contagem de GPUs, FP8 PFLOPS, consumo de energia, tipo de resfriamento, TCO por PFLOPS e implantações conhecidas · extraído de datasheets, earnings calls e builds de infraestrutura divulgados.

TCO rastreadoResfriamento perfiladoImplantações mapeadasPFLOPS por kW
Índice de TCO
Melhor TCO por PFLOPS por ano
Quanto menor, melhor. Hardware amortizado em 3 anos + energia a US$ 0,05/kWh. Média de todos os sistemas: $9,046/PFLOPS/ano.
Ranking de TCO · US$/PFLOPS/ano
Principais insights
  • DGX GB300 NVL72 oferece o menor TCO, de $973/PFLOPS/ano
  • Sistemas com refrigeração líquida têm em média 6% menos TCO que os refrigerados a ar
  • 4 de 8 sistemas no ranking são baseados em NVIDIA
Hub de computação completo
Dados de April 14, 2026 · todas as alterações preservadas
10
Sistemas
9,433
Total GPUs
6
Fabricantes
914 TB
Total HBM
8100
Max PFLOPS
6
Resfriamento líquido
8
Em produção
4.81
PFLOPS/kW médio

10 sistemas · ordenados por FP8 PFLOPS · todos os fabricantes

SistemaGPUsFP8 PFLOPS
Google logo
TPU v5p Pod
Google
8,9608,100
NVIDIA logo
DGX GB300 NVL72
NVIDIA
721,440
NVIDIA logo
DGX GB200 NVL72
NVIDIA
72720
Google logo
TPU v6e Pod
Google
256230
Microsoft logo
Maia 100 Rack
Microsoft
3296
NVIDIA logo
DGX B200
NVIDIA
880
AMD logo
MI325X Platform
AMD
848
AWS logo
Trn2 UltraServer
AWS
1648
NVIDIA logo
HGX H100
NVIDIA
832
Cerebras logo
CS-3
Cerebras
1n/d

$/PFLOPS/ano · hardware amortizado em 3 anos + energia a $0.05/kWh · menor é melhor

3.NVIDIA logoDGX B200Ar
8 GPUs$1,768
5.NVIDIA logoHGX H100Ar
8 GPUs$3,306
6.Google logoTPU v6e PodLíquida
256 GPUs$14,734
7.Google logoTPU v5p PodLíquida
8960 GPUs$17,926
8.AWS logoTrn2 UltraServerAr
16 GPUs$30,131
TCO médio de todos os sistemas ranqueados
$9,046/PFLOPS/yr

Líquido vs ar · estatísticas de potência · comparação de eficiência

Resfriamento líquido6 sistemas
Potência média
481 kW
PFLOPS/kW médio
5.15
Resfriamento a ar4 sistemas
Potência média
12 kW
PFLOPS/kW médio
4.38
Por que resfriamento importa pro TCO

Resfriamento líquido permite PUE de 1.05 a 1.15 vs 1.3 a 1.5 pra ar. Em escala de datacenter, isso se traduz em 15 a 30% menos custo de energia. Sistemas com resfriamento líquido também permitem maior densidade de GPU por rack, reduzindo latência de interconexão e área física. Cada novo rack IA relevante (DGX GB200, MI350X cluster) vem com resfriamento líquido de fábrica.

19 implantações divulgadas · quem está construindo o quê

OperadorSistema
Google DeepMind logoGoogle DeepMind
Google logoTPU v5p Pod
Anthropic logoAnthropic
Google logoTPU v5p Pod
Microsoft Azure logoMicrosoft Azure
NVIDIA logoDGX GB200 NVL72
Oracle Cloud
NVIDIA logoDGX GB200 NVL72
CoreWeave logoCoreWeave
NVIDIA logoDGX GB200 NVL72
xAI logoxAI
NVIDIA logoDGX GB200 NVL72
Google DeepMind logoGoogle DeepMind
Google logoTPU v6e Pod
Google Cloud logoGoogle Cloud
Google logoTPU v6e Pod
Microsoft Azure logoMicrosoft Azure
Microsoft logoMaia 100 Rack
Enterprise customers logoEnterprise customers
NVIDIA logoDGX B200
Microsoft Azure logoMicrosoft Azure
AMD logoMI325X Platform
Meta logoMeta
AMD logoMI325X Platform
Amazon AGI logoAmazon AGI
AWS logoTrn2 UltraServer
Anthropic logoAnthropic
AWS logoTrn2 UltraServer
Meta logoMeta
NVIDIA logoHGX H100
Microsoft Azure logoMicrosoft Azure
NVIDIA logoHGX H100
Google Cloud logoGoogle Cloud
NVIDIA logoHGX H100
Cerebras Inference logoCerebras Inference
Cerebras logoCS-3
Mayo Clinic logoMayo Clinic
Cerebras logoCS-3

10 sistemas · 6 fabricantes

Google logoTPU v5p PodEm entrega

Google's high-performance TPU pod for large-scale training. 8,960 TPU v5p chips in a single pod connected via ICI 3.0 fabric. Powers Gemini ...

GPUs
8960
FP8 PFLOPS
8100
Potência
2500
kW
Pod / clusterLíquidaGoogle TPU v5p
HBM: 860 TB·ICI 3.0
ImplantadoGoogle DeepMind logoGoogle DeepMindAnthropic logoAnthropic
NVIDIA logoDGX GB300 NVL72Anunciado

Next-gen liquid-cooled rack with Blackwell Ultra GPUs. 72x B300 GPUs with 288 GB HBM3e per GPU (vs 192 GB on B200). Designed for reasoning-h...

GPUs
72
FP8 PFLOPS
1440
Potência
140
kW
Rack completoLíquidaNVIDIA B300
HBM: 20.7 TB·NVLink 5.0+
$4.0M de tabela · $973/PFLOPS/yr
NVIDIA logoDGX GB200 NVL72Em entrega

NVIDIA's flagship liquid-cooled rack. 72 Blackwell GPUs + 36 Grace CPUs connected via NVLink 5.0 in a single 72-GPU domain. Designed for tri...

GPUs
72
FP8 PFLOPS
720
Potência
120
kW
Rack completoLíquidaNVIDIA B200
HBM: 13.8 TB·NVLink 5.0
$3.0M de tabela · $1,469/PFLOPS/yr
ImplantadoMicrosoft Azure logoMicrosoft AzureOracle CloudCoreWeave logoCoreWeave+1
Google logoTPU v6e PodEm entrega

Google's latest custom AI accelerator in pod configuration. 256 TPU v6e chips connected via custom ICI (Inter-Chip Interconnect). Optimized ...

GPUs
256
FP8 PFLOPS
230
Potência
60
kW
Pod / clusterLíquidaGoogle TPU v6e
HBM: 8 TB·ICI 4.0
ImplantadoGoogle DeepMind logoGoogle DeepMindGoogle Cloud logoGoogle Cloud
Microsoft logoMaia 100 RackEm ramp-up

Microsoft's first custom AI silicon at rack scale. Maia 100 chips fabricated at TSMC on N5 with HBM3e. Designed for Azure AI inference and f...

GPUs
32
FP8 PFLOPS
96
Potência
40
kW
Rack completoLíquidaMicrosoft Maia 100
HBM: 6.1 TB·Custom Ethernet fabric
ImplantadoMicrosoft Azure logoMicrosoft Azure
NVIDIA logoDGX B200Em entrega

8-GPU Blackwell node for enterprises that don't need the full NVL72 rack. Air-cooled with NVLink 4.0 interconnect. The workhorse for inferen...

GPUs
8
FP8 PFLOPS
80
Potência
14.3
kW
Nó de servidorArNVIDIA B200
HBM: 1.5 TB·NVLink 4.0
$0.4M de tabela · $1,768/PFLOPS/yr
ImplantadoEnterprise customers logoEnterprise customers
AMD logoMI325X PlatformEm entrega

AMD's latest 8-GPU OAM platform with MI325X accelerators. 256 GB HBM3e per GPU for the largest memory footprint in its class. Infinity Fabri...

GPUs
8
FP8 PFLOPS
48
Potência
10
kW
Nó de servidorArAMD MI325X
HBM: 2 TB·Infinity Fabric
$0.3M de tabela · $2,063/PFLOPS/yr
ImplantadoMicrosoft Azure logoMicrosoft AzureMeta logoMeta
AWS logoTrn2 UltraServerEm entrega

AWS custom silicon training server. 16x Trainium2 chips in a single UltraServer node connected via NeuronLink. Designed to compete with NVID...

GPUs
16
FP8 PFLOPS
48
Potência
12
kW
Nó de servidorArAWS Trainium2
HBM: 1.5 TB·NeuronLink
ImplantadoAmazon AGI logoAmazon AGIAnthropic logoAnthropic
NVIDIA logoHGX H100Em entrega

The system that launched the AI infrastructure boom. 8x H100 SXM GPUs connected via NVLink 4.0. Still the most widely deployed AI training s...

GPUs
8
FP8 PFLOPS
32
Potência
10.2
kW
Nó de servidorArNVIDIA H100 SXM
HBM: 0.64 TB·NVLink 4.0
$0.3M de tabela · $3,306/PFLOPS/yr
ImplantadoMeta logoMetaMicrosoft Azure logoMicrosoft AzureGoogle Cloud logoGoogle Cloud
Cerebras logoCS-3Em entrega

Wafer-scale AI compute appliance. A single CS-3 contains one WSE-3 chip (the largest chip ever made, using an entire 300mm wafer). 44 GB of ...

GPUs
1
FP8 PFLOPS
n/d
Potência
23
kW
ApplianceLíquidaCerebras WSE-3
HBM: 0 TB·SwarmX
$3.5M de tabela
ImplantadoCerebras Inference logoCerebras InferenceMayo Clinic logoMayo Clinic

Extraído do dataset ao vivo · atualizado diariamente

O que é um DGX GB200 NVL72?

O DGX GB200 NVL72 é o rack de computação de IA principal da NVIDIA. Ele reúne 72 GPUs Blackwell e 36 CPUs Grace em um único rack refrigerado a líquido, conectados via NVLink 5.0. Entrega até 720 PFLOPS de computação FP8 e exige mais de 120 kW de energia. É o sistema que treina os maiores modelos de IA na Microsoft, Oracle, CoreWeave e xAI.

O que significa TCO por PFLOPS?

O Custo Total de Propriedade por PFLOPS por ano normaliza o custo de diferentes sistemas de IA em uma métrica comparável. Inclui o custo de hardware (amortizado em 3 anos) mais o custo de energia (a uma tarifa média de datacenter de US$ 0,05/kWh), dividido pela capacidade de computação FP8 do sistema em PFLOPS. Quanto menor, melhor. Essa é a métrica que operadores de datacenter otimizam ao escolher entre NVIDIA, AMD, Google TPU ou silício customizado.

Por que alguns sistemas exigem refrigeração líquida?

Chips de IA modernos consomem de 700 a 1200 W cada. Um rack NVL72 com 72 GPUs de 1000 W gera 72 kW de calor só nas GPUs. A refrigeração a ar não consegue remover tanto calor de forma eficiente. A refrigeração líquida (direct-to-chip ou por imersão) é de 10 a 100 vezes mais eficaz na transferência de calor, permitindo maior densidade de GPUs por rack, PUE menor (1,1 contra 1,3 a 1,5 do ar) e melhor desempenho dos chips graças ao melhor gerenciamento térmico.

Como um pod TPU se compara a um rack NVIDIA DGX?

Pods TPU do Google e racks NVIDIA DGX têm arquiteturas fundamentalmente diferentes. Um pod TPU v5p pode conter 8.960 chips em um único domínio interconectado via ICI. O NVL72 da NVIDIA é um sistema em escala de rack com 72 GPUs. Os pods TPU oferecem paralelismo massivo para as arquiteturas de modelo do próprio Google, mas só estão disponíveis no Google Cloud. Os sistemas DGX estão disponíveis em vários OEMs para implantação on-premise.

O que é o Cerebras CS-3 e por que ele é diferente?

O Cerebras CS-3 usa um único chip WSE-3, o maior já fabricado, ocupando um wafer de silício inteiro de 300 mm. Em vez de pilhas de HBM, ele tem 44 GB de SRAM no chip, com acesso à memória sem latência. Isso elimina o gargalo de largura de banda de memória que limita os sistemas de GPU convencionais. Em contrapartida, o custo por sistema é maior e o modelo de programação é diferente.

Por que os hyperscalers estão criando silício customizado?

Google (TPU), AWS (Trainium), Microsoft (Maia) e Meta (MTIA) estão desenvolvendo chips de IA próprios para reduzir a dependência da NVIDIA, otimizar para suas cargas de trabalho específicas e cortar custos em escala. No volume de um hyperscaler (centenas de milhares de chips), até um ganho de eficiência de 10 a 20% sobre a NVIDIA representa bilhões em economia. O silício customizado também diversifica a cadeia de suprimentos.

Continue explorando o grafo de compute