算力 · 系统机架级 AI 基础设施 · Data as of 2026年4月14日 · curated dataset

每套系统 · Tracked

来自每家制造商的每套机架级 AI 系统。GPU 数量、FP8 PFLOPS、功耗、散热类型、每 PFLOPS TCO 和已知数据中心部署 · 来源于规格表、财报电话和已披露的基础设施建设。

TCO 追踪散热分析部署映射每 kW PFLOPS
TCO 指数
每 PFLOPS 每年最优 TCO
越低越好。 硬件按 3 年摊销 + 电力按 $0.05/kWh 计算。所有系统平均值:$9,046/PFLOPS/年。
TCO 排名 · $/PFLOPS/年
关键洞察
  • DGX GB300 NVL72 的 TCO 最低,为 $973/PFLOPS/年
  • 液冷系统的平均 TCO 比风冷低 6%
  • 上榜的 8 个系统中有 4 个基于 NVIDIA
完整算力中心
数据截至 April 14, 2026 · 保留每次变更
10
系统
9,433
总 GPU
6
制造商
914 TB
总 HBM
8100
最大 PFLOPS
6
液冷
8
已出货
4.81
平均 PFLOPS/kW

10 个系统 · 按 FP8 PFLOPS 排序 · 所有厂商

系统GPUFP8 PFLOPS
Google logo
TPU v5p Pod
Google
8,9608,100
NVIDIA logo
DGX GB300 NVL72
NVIDIA
721,440
NVIDIA logo
DGX GB200 NVL72
NVIDIA
72720
Google logo
TPU v6e Pod
Google
256230
Microsoft logo
Maia 100 Rack
Microsoft
3296
NVIDIA logo
DGX B200
NVIDIA
880
AMD logo
MI325X Platform
AMD
848
AWS logo
Trn2 UltraServer
AWS
1648
NVIDIA logo
HGX H100
NVIDIA
832
Cerebras logo
CS-3
Cerebras
1暂无

$/PFLOPS/年 · 硬件 3 年摊销 + 电力 $0.05/kWh · 越低越好

2.NVIDIA logoDGX GB200 NVL72液冷
72 块 GPU$1,469
3.NVIDIA logoDGX B200风冷
8 块 GPU$1,768
5.NVIDIA logoHGX H100风冷
8 块 GPU$3,306
6.Google logoTPU v6e Pod液冷
256 块 GPU$14,734
7.Google logoTPU v5p Pod液冷
8960 块 GPU$17,926
8.AWS logoTrn2 UltraServer风冷
16 块 GPU$30,131
所有排名系统的平均 TCO
$9,046/PFLOPS/yr

液冷 vs 风冷 · 功耗数据 · 效率对比

液冷6 个系统
平均功耗
481 kW
平均 PFLOPS/kW
5.15
风冷4 个系统
平均功耗
12 kW
平均 PFLOPS/kW
4.38
为何散热对 TCO 至关重要

液冷 PUE 为 1.05 到 1.15,风冷为 1.3 到 1.5。在数据中心规模下,这意味着电力成本降低 15% 到 30%。液冷系统还允许每机架更高的 GPU 密度,减少互连延迟和物理占地面积。每套主要新 AI 机架(DGX GB200、MI350X 集群)默认液冷出厂。

19 个已披露部署 · 谁在建设什么

运营商系统
Google DeepMind logoGoogle DeepMind
Google logoTPU v5p Pod
Anthropic logoAnthropic
Google logoTPU v5p Pod
Microsoft Azure logoMicrosoft Azure
NVIDIA logoDGX GB200 NVL72
Oracle Cloud
NVIDIA logoDGX GB200 NVL72
CoreWeave logoCoreWeave
NVIDIA logoDGX GB200 NVL72
xAI logoxAI
NVIDIA logoDGX GB200 NVL72
Google DeepMind logoGoogle DeepMind
Google logoTPU v6e Pod
Google Cloud logoGoogle Cloud
Google logoTPU v6e Pod
Microsoft Azure logoMicrosoft Azure
Microsoft logoMaia 100 Rack
Enterprise customers logoEnterprise customers
NVIDIA logoDGX B200
Microsoft Azure logoMicrosoft Azure
AMD logoMI325X Platform
Meta logoMeta
AMD logoMI325X Platform
Amazon AGI logoAmazon AGI
AWS logoTrn2 UltraServer
Anthropic logoAnthropic
AWS logoTrn2 UltraServer
Meta logoMeta
NVIDIA logoHGX H100
Microsoft Azure logoMicrosoft Azure
NVIDIA logoHGX H100
Google Cloud logoGoogle Cloud
NVIDIA logoHGX H100
Cerebras Inference logoCerebras Inference
Cerebras logoCS-3
Mayo Clinic logoMayo Clinic
Cerebras logoCS-3

10 个系统 · 6 家厂商

Google logoTPU v5p Pod已出货

Google's high-performance TPU pod for large-scale training. 8,960 TPU v5p chips in a single pod connected via ICI 3.0 fabric. Powers Gemini ...

GPU
8960
FP8 PFLOPS
8100
功耗
2500
kW
Pod / 集群液冷Google TPU v5p
HBM:860 TB·ICI 3.0
已部署Google DeepMind logoGoogle DeepMindAnthropic logoAnthropic
NVIDIA logoDGX GB300 NVL72已发布

Next-gen liquid-cooled rack with Blackwell Ultra GPUs. 72x B300 GPUs with 288 GB HBM3e per GPU (vs 192 GB on B200). Designed for reasoning-h...

GPU
72
FP8 PFLOPS
1440
功耗
140
kW
整机柜液冷NVIDIA B300
HBM:20.7 TB·NVLink 5.0+
标价 $4.0M · $973/PFLOPS/yr
NVIDIA logoDGX GB200 NVL72已出货

NVIDIA's flagship liquid-cooled rack. 72 Blackwell GPUs + 36 Grace CPUs connected via NVLink 5.0 in a single 72-GPU domain. Designed for tri...

GPU
72
FP8 PFLOPS
720
功耗
120
kW
整机柜液冷NVIDIA B200
HBM:13.8 TB·NVLink 5.0
标价 $3.0M · $1,469/PFLOPS/yr
已部署Microsoft Azure logoMicrosoft AzureOracle CloudCoreWeave logoCoreWeave+1
Google logoTPU v6e Pod已出货

Google's latest custom AI accelerator in pod configuration. 256 TPU v6e chips connected via custom ICI (Inter-Chip Interconnect). Optimized ...

GPU
256
FP8 PFLOPS
230
功耗
60
kW
Pod / 集群液冷Google TPU v6e
HBM:8 TB·ICI 4.0
已部署Google DeepMind logoGoogle DeepMindGoogle Cloud logoGoogle Cloud
Microsoft logoMaia 100 Rack产能爬坡中

Microsoft's first custom AI silicon at rack scale. Maia 100 chips fabricated at TSMC on N5 with HBM3e. Designed for Azure AI inference and f...

GPU
32
FP8 PFLOPS
96
功耗
40
kW
整机柜液冷Microsoft Maia 100
HBM:6.1 TB·Custom Ethernet fabric
已部署Microsoft Azure logoMicrosoft Azure
NVIDIA logoDGX B200已出货

8-GPU Blackwell node for enterprises that don't need the full NVL72 rack. Air-cooled with NVLink 4.0 interconnect. The workhorse for inferen...

GPU
8
FP8 PFLOPS
80
功耗
14.3
kW
服务器节点风冷NVIDIA B200
HBM:1.5 TB·NVLink 4.0
标价 $0.4M · $1,768/PFLOPS/yr
已部署Enterprise customers logoEnterprise customers
AMD logoMI325X Platform已出货

AMD's latest 8-GPU OAM platform with MI325X accelerators. 256 GB HBM3e per GPU for the largest memory footprint in its class. Infinity Fabri...

GPU
8
FP8 PFLOPS
48
功耗
10
kW
服务器节点风冷AMD MI325X
HBM:2 TB·Infinity Fabric
标价 $0.3M · $2,063/PFLOPS/yr
已部署Microsoft Azure logoMicrosoft AzureMeta logoMeta
AWS logoTrn2 UltraServer已出货

AWS custom silicon training server. 16x Trainium2 chips in a single UltraServer node connected via NeuronLink. Designed to compete with NVID...

GPU
16
FP8 PFLOPS
48
功耗
12
kW
服务器节点风冷AWS Trainium2
HBM:1.5 TB·NeuronLink
已部署Amazon AGI logoAmazon AGIAnthropic logoAnthropic
NVIDIA logoHGX H100已出货

The system that launched the AI infrastructure boom. 8x H100 SXM GPUs connected via NVLink 4.0. Still the most widely deployed AI training s...

GPU
8
FP8 PFLOPS
32
功耗
10.2
kW
服务器节点风冷NVIDIA H100 SXM
HBM:0.64 TB·NVLink 4.0
标价 $0.3M · $3,306/PFLOPS/yr
已部署Meta logoMetaMicrosoft Azure logoMicrosoft AzureGoogle Cloud logoGoogle Cloud
Cerebras logoCS-3已出货

Wafer-scale AI compute appliance. A single CS-3 contains one WSE-3 chip (the largest chip ever made, using an entire 300mm wafer). 44 GB of ...

GPU
1
FP8 PFLOPS
暂无
功耗
23
kW
一体机液冷Cerebras WSE-3
HBM:0 TB·SwarmX
标价 $3.5M
已部署Cerebras Inference logoCerebras InferenceMayo Clinic logoMayo Clinic

来自实时数据集 · 每日更新

什么是 DGX GB200 NVL72?

DGX GB200 NVL72 是 NVIDIA 的旗舰 AI 算力机柜。单个液冷机柜内含 72 颗 Blackwell GPU 和 36 颗 Grace CPU,通过 NVLink 5.0 互连。FP8 算力最高可达 720 PFLOPS,功耗需 120 kW 以上。微软、Oracle、CoreWeave 和 xAI 都用它训练最大规模的 AI 模型。

每 PFLOPS 的 TCO 是什么意思?

每 PFLOPS 每年的总拥有成本(TCO)把不同 AI 系统的成本统一为可比较的指标。它包括硬件成本(按 3 年摊销)加上电力成本(按数据中心平均 $0.05/kWh 计算),再除以系统的 FP8 算力(PFLOPS)。数值越低越好。数据中心运营商在 NVIDIA、AMD、Google TPU 或自研芯片之间选择时,会以此为优化指标。

为什么有些系统需要液冷?

现代 AI 芯片单颗功耗为 700-1200W。一个配备 72 颗 GPU、每颗 1000W 的 NVL72 机柜,仅 GPU 就产生 72 kW 热量,风冷无法高效散热。液冷(直接芯片冷却或浸没式)的传热效率高 10-100 倍,可实现更高的单机柜 GPU 密度、更低的 PUE(1.1,而风冷为 1.3-1.5),并因更好的热管理而提升芯片性能。

TPU pod 与 NVIDIA DGX 机柜相比如何?

Google TPU pod 与 NVIDIA DGX 机柜的架构截然不同。一个 TPU v5p pod 可通过 ICI 互连在单一互联域内容纳 8,960 颗芯片。NVIDIA 的 NVL72 则是 72 GPU 的机柜级系统。TPU pod 为 Google 自家模型架构提供大规模并行能力,但只能在 Google Cloud 上使用。DGX 系统可通过多家 OEM 进行本地部署。

Cerebras CS-3 是什么,有何不同?

Cerebras CS-3 采用单颗 WSE-3 芯片,这是迄今最大的芯片,占据整片 300mm 晶圆。它不使用 HBM 堆栈,而是配备 44 GB 片上 SRAM,实现零延迟内存访问,消除了限制传统 GPU 系统的内存带宽瓶颈。代价是单系统成本更高,且编程模型不同。

为什么超大规模云厂商要自研芯片?

Google(TPU)、AWS(Trainium)、微软(Maia)和 Meta(MTIA)都在自研 AI 芯片,以减少对 NVIDIA 的依赖、针对自身工作负载优化,并在大规模下降低成本。在超大规模云厂商的采购量(数十万颗芯片)下,即使比 NVIDIA 效率高 10-20%,也意味着数十亿美元的节省。自研芯片还能实现供应链多元化。

继续探索算力图谱