すべてのシステム · Tracked
すべてのメーカーからのすべてのラックスケールAIシステム。GPU数、FP8 PFLOPS、消費電力、冷却方式、PFLOPSあたりTCO、既知のデータセンター展開 · スペックシート、決算発表、開示されたインフラ構築から取得。
- $973
- $1,469
- $1,768
- $2,063
- $3,306
- $14,734
- DGX GB300 NVL72が$973/PFLOPS/年で最も低いTCOを実現
- 液冷システムのTCOは空冷より平均6%低い
- ランクイン8システム中4システムがNVIDIAベース
システム表
10システム · FP8 PFLOPS順 · 全メーカー
| システム | GPU数 | FP8 PFLOPS |
|---|---|---|
TPU v5p Pod Google | 8,960 | 8,100 |
DGX GB300 NVL72 NVIDIA | 72 | 1,440 |
DGX GB200 NVL72 NVIDIA | 72 | 720 |
TPU v6e Pod Google | 256 | 230 |
Maia 100 Rack Microsoft | 32 | 96 |
DGX B200 NVIDIA | 8 | 80 |
MI325X Platform AMD | 8 | 48 |
Trn2 UltraServer AWS | 16 | 48 |
HGX H100 NVIDIA | 8 | 32 |
CS-3 Cerebras | 1 | 該当なし |
TCO比較
$/PFLOPS/年 · ハードウェア3年償却 + 電力$0.05/kWh · 低いほど良い
冷却方式内訳
液冷vs空冷 · 電力統計 · 効率比較
液冷式はPUE 1.05〜1.15を実現し、空冷式の1.3〜1.5と比較して優れています。データセンター規模では、これは15〜30%の電力コスト削減に相当します。液冷システムはラックあたりのGPU密度を高め、相互接続レイテンシと物理的フットプリントを削減します。すべての主要な新型AIラック(DGX GB200、MI350Xクラスター)はデフォルトで液冷式で出荷されます。
既知のデプロイメント
公表済みの導入19件 · 誰が何を構築しているか
| オペレーター | システム |
|---|---|
OC Oracle Cloud | |
すべてのシステム
10システム · 6メーカー
Google's high-performance TPU pod for large-scale training. 8,960 TPU v5p chips in a single pod connected via ICI 3.0 fabric. Powers Gemini ...
Next-gen liquid-cooled rack with Blackwell Ultra GPUs. 72x B300 GPUs with 288 GB HBM3e per GPU (vs 192 GB on B200). Designed for reasoning-h...
NVIDIA's flagship liquid-cooled rack. 72 Blackwell GPUs + 36 Grace CPUs connected via NVLink 5.0 in a single 72-GPU domain. Designed for tri...
Google's latest custom AI accelerator in pod configuration. 256 TPU v6e chips connected via custom ICI (Inter-Chip Interconnect). Optimized ...
Microsoft's first custom AI silicon at rack scale. Maia 100 chips fabricated at TSMC on N5 with HBM3e. Designed for Azure AI inference and f...
8-GPU Blackwell node for enterprises that don't need the full NVL72 rack. Air-cooled with NVLink 4.0 interconnect. The workhorse for inferen...
AMD's latest 8-GPU OAM platform with MI325X accelerators. 256 GB HBM3e per GPU for the largest memory footprint in its class. Infinity Fabri...
AWS custom silicon training server. 16x Trainium2 chips in a single UltraServer node connected via NeuronLink. Designed to compete with NVID...
The system that launched the AI infrastructure boom. 8x H100 SXM GPUs connected via NVLink 4.0. Still the most widely deployed AI training s...
Wafer-scale AI compute appliance. A single CS-3 contains one WSE-3 chip (the largest chip ever made, using an entire 300mm wafer). 44 GB of ...
よくある質問
ライブデータセットから抽出 · 毎日更新
DGX GB200 NVL72とは何ですか?
DGX GB200 NVL72は、NVIDIAのフラッグシップAIコンピュートラックです。1基の液冷ラックに72基のBlackwell GPUと36基のGrace CPUを搭載し、NVLink 5.0で接続されます。FP8で最大720 PFLOPSの演算性能を発揮し、120kW以上の電力を必要とします。Microsoft、Oracle、CoreWeave、xAIで最大級のAIモデルを学習しているシステムです。
PFLOPSあたりのTCOとは何ですか?
PFLOPSあたりの年間総所有コスト(TCO)は、異なるAIシステムのコストを比較可能な指標に揃えたものです。ハードウェア費用(3年で償却)と電力費用(データセンター平均の$0.05/kWh)の合計を、システムのFP8演算性能(PFLOPS)で割って算出します。低いほど優れています。データセンター事業者がNVIDIA、AMD、Google TPU、独自シリコンを選ぶ際に最適化する指標です。
なぜ液冷が必要なシステムがあるのですか?
最新のAIチップは1基あたり700〜1200Wを消費します。1基1000WのGPUを72基搭載するNVL72ラックでは、GPUだけで72kWの熱が発生します。空冷ではこれほどの熱を効率的に除去できません。液冷(ダイレクトチップ方式または浸漬方式)は熱伝達が10〜100倍効率的で、ラックあたりのGPU密度を高め、PUEを低減(空冷の1.3〜1.5に対し1.1)し、熱管理の改善でチップ性能も向上させます。
TPU PodとNVIDIA DGXラックはどう違いますか?
Google TPU PodとNVIDIA DGXラックは、根本的に異なるアーキテクチャです。TPU v5p Podは、ICIファブリックで接続された単一ドメインに8,960基のチップを含められます。NVIDIAのNVL72は72GPUのラック規模システムです。TPU PodはGoogle独自のモデル構造に対して大規模な並列性を提供しますが、Google Cloudでのみ利用できます。DGXシステムは複数のOEMからオンプレミス向けに入手できます。
Cerebras CS-3とは何で、何が違うのですか?
Cerebras CS-3は、史上最大のチップであるWSE-3を1基使用し、300mmシリコンウェハー全体を占有します。HBMスタックの代わりに44GBのオンチップSRAMを備え、遅延ゼロのメモリアクセスを実現します。これにより、従来のGPUシステムを制約するメモリ帯域のボトルネックが解消されます。トレードオフは、システムあたりのコストが高いことと、プログラミングモデルが異なることです。
なぜハイパースケーラーは独自シリコンを開発しているのですか?
Google(TPU)、AWS(Trainium)、Microsoft(Maia)、Meta(MTIA)は、NVIDIAへの依存を減らし、自社のワークロードに最適化し、大規模運用でのコストを下げるために独自のAIチップを開発しています。ハイパースケーラー規模(数十万チップ)では、NVIDIAより10〜20%効率が高いだけで数十億ドルの節約になります。独自シリコンはサプライチェーンの分散にもつながります。
関連項目
コンピュートグラフの探索を続ける