每套系统 · Tracked
来自每家制造商的每套机架级 AI 系统。GPU 数量、FP8 PFLOPS、功耗、散热类型、每 PFLOPS TCO 和已知数据中心部署 · 来源于规格表、财报电话和已披露的基础设施建设。
- $973
- $1,469
- $1,768
- $2,063
- $3,306
- $14,734
系统表格
10 个系统 · 按 FP8 PFLOPS 排序 · 所有厂商
| 系统 | GPU | FP8 PFLOPS |
|---|---|---|
TPU v5p Pod Google | 8,960 | 8,100 |
DGX GB300 NVL72 NVIDIA | 72 | 1,440 |
DGX GB200 NVL72 NVIDIA | 72 | 720 |
TPU v6e Pod Google | 256 | 230 |
Maia 100 Rack Microsoft | 32 | 96 |
DGX B200 NVIDIA | 8 | 80 |
MI325X Platform AMD | 8 | 48 |
Trn2 UltraServer AWS | 16 | 48 |
HGX H100 NVIDIA | 8 | 32 |
CS-3 Cerebras | 1 | 暂无 |
TCO 对比
$/PFLOPS/年 · 硬件 3 年摊销 + 电力 $0.05/kWh · 越低越好
散热分类
液冷 vs 风冷 · 功耗数据 · 效率对比
液冷 PUE 为 1.05 到 1.15,风冷为 1.3 到 1.5。在数据中心规模下,这意味着电力成本降低 15% 到 30%。液冷系统还允许每机架更高的 GPU 密度,减少互连延迟和物理占地面积。每套主要新 AI 机架(DGX GB200、MI350X 集群)默认液冷出厂。
已知部署
19 个已披露部署 · 谁在建设什么
| 运营商 | 系统 |
|---|---|
OC Oracle Cloud | |
所有系统
10 个系统 · 6 家厂商
Google's high-performance TPU pod for large-scale training. 8,960 TPU v5p chips in a single pod connected via ICI 3.0 fabric. Powers Gemini ...
Next-gen liquid-cooled rack with Blackwell Ultra GPUs. 72x B300 GPUs with 288 GB HBM3e per GPU (vs 192 GB on B200). Designed for reasoning-h...
NVIDIA's flagship liquid-cooled rack. 72 Blackwell GPUs + 36 Grace CPUs connected via NVLink 5.0 in a single 72-GPU domain. Designed for tri...
Google's latest custom AI accelerator in pod configuration. 256 TPU v6e chips connected via custom ICI (Inter-Chip Interconnect). Optimized ...
Microsoft's first custom AI silicon at rack scale. Maia 100 chips fabricated at TSMC on N5 with HBM3e. Designed for Azure AI inference and f...
8-GPU Blackwell node for enterprises that don't need the full NVL72 rack. Air-cooled with NVLink 4.0 interconnect. The workhorse for inferen...
AMD's latest 8-GPU OAM platform with MI325X accelerators. 256 GB HBM3e per GPU for the largest memory footprint in its class. Infinity Fabri...
AWS custom silicon training server. 16x Trainium2 chips in a single UltraServer node connected via NeuronLink. Designed to compete with NVID...
The system that launched the AI infrastructure boom. 8x H100 SXM GPUs connected via NVLink 4.0. Still the most widely deployed AI training s...
Wafer-scale AI compute appliance. A single CS-3 contains one WSE-3 chip (the largest chip ever made, using an entire 300mm wafer). 44 GB of ...
常见问题
来自实时数据集 · 每日更新
什么是 DGX GB200 NVL72?
DGX GB200 NVL72 是 NVIDIA 的旗舰 AI 算力机柜。单个液冷机柜内含 72 颗 Blackwell GPU 和 36 颗 Grace CPU,通过 NVLink 5.0 互连。FP8 算力最高可达 720 PFLOPS,功耗需 120 kW 以上。微软、Oracle、CoreWeave 和 xAI 都用它训练最大规模的 AI 模型。
每 PFLOPS 的 TCO 是什么意思?
每 PFLOPS 每年的总拥有成本(TCO)把不同 AI 系统的成本统一为可比较的指标。它包括硬件成本(按 3 年摊销)加上电力成本(按数据中心平均 $0.05/kWh 计算),再除以系统的 FP8 算力(PFLOPS)。数值越低越好。数据中心运营商在 NVIDIA、AMD、Google TPU 或自研芯片之间选择时,会以此为优化指标。
为什么有些系统需要液冷?
现代 AI 芯片单颗功耗为 700-1200W。一个配备 72 颗 GPU、每颗 1000W 的 NVL72 机柜,仅 GPU 就产生 72 kW 热量,风冷无法高效散热。液冷(直接芯片冷却或浸没式)的传热效率高 10-100 倍,可实现更高的单机柜 GPU 密度、更低的 PUE(1.1,而风冷为 1.3-1.5),并因更好的热管理而提升芯片性能。
TPU pod 与 NVIDIA DGX 机柜相比如何?
Google TPU pod 与 NVIDIA DGX 机柜的架构截然不同。一个 TPU v5p pod 可通过 ICI 互连在单一互联域内容纳 8,960 颗芯片。NVIDIA 的 NVL72 则是 72 GPU 的机柜级系统。TPU pod 为 Google 自家模型架构提供大规模并行能力,但只能在 Google Cloud 上使用。DGX 系统可通过多家 OEM 进行本地部署。
Cerebras CS-3 是什么,有何不同?
Cerebras CS-3 采用单颗 WSE-3 芯片,这是迄今最大的芯片,占据整片 300mm 晶圆。它不使用 HBM 堆栈,而是配备 44 GB 片上 SRAM,实现零延迟内存访问,消除了限制传统 GPU 系统的内存带宽瓶颈。代价是单系统成本更高,且编程模型不同。
为什么超大规模云厂商要自研芯片?
Google(TPU)、AWS(Trainium)、微软(Maia)和 Meta(MTIA)都在自研 AI 芯片,以减少对 NVIDIA 的依赖、针对自身工作负载优化,并在大规模下降低成本。在超大规模云厂商的采购量(数十万颗芯片)下,即使比 NVIDIA 效率高 10-20%,也意味着数十亿美元的节省。自研芯片还能实现供应链多元化。
另见
继续探索算力图谱