KOL Digest
Semianalysis · 2026.04.20 週一 · Substack

How Much Do GPU Clusters Really Cost?

看原始內容 5 個主題 · 5 個標的/題材

GPU cluster TCO框架:真實成本遠超GPU-hr定價

  • 傳統採購只看GPU-hr報價,但Storage、Networking、Control Plane、Support、Goodput損耗、Setup、Debugging七大隱性成本可以讓實際TCO大幅偏離
  • 兩家相同GPU-hr報價的供應商,TCO可以差15%以上,主因是downtime、setup時間、network調試工程師成本
  • SemiAnalysis釋出免費的GPU Cluster TCO Calculator與Goodput Calculator(clustermax.ai/tco),可自行輸入參數試算
AI基建 中期

GPU cluster已成為AI公司最大支出項目,多家公司超過80%初始資金花在GPU上;TCO計算框架有助於做出更合理的採購決策

Goodput理論:大規模訓練叢集的有效工作量損耗

  • Goodput = 叢集實際產生有用訓練吞吐量的比例;硬體故障、NCCL stall、OOM都會侵蝕goodput
  • 叢集越大、單一job佔比越高,MTBF越短、goodput損耗越嚴重——4096 GPU上跑單一job,一次故障就需10-15分鐘重啟,所有GPU都在空轉
  • Gold-tier vs Silver-tier在大型LLM pretrain場景下goodput差距可達6%對21%,實質TCO差距高達15%
AI算力 中期

Goodput損耗是大規模訓練叢集最被忽視的隱性成本,SemiAnalysis提出量化框架將其納入TCO計算,對規模超過1k GPU的客戶尤其關鍵

Fault-tolerant訓練框架比較:TorchFT vs HyperPod Checkpointless vs TorchPass

  • TorchFT(Meta開源):blast radius = replica group大小,故障時整個FSDP shard停止;跨group用GLOO通訊造成>10%性能overhead
  • AWS HyperPod Checkpointless:僅限Kubernetes + NeMo Megatron;記憶體redundancy帶來GPU memory壓力,需降低batch size,約5%性能影響;恢復時間1分45秒 vs checkpoint restart的15分鐘
  • TorchPass(Clockwork.io授權軟體):唯一零性能overhead選項,代價是需要idle spare nodes或preemption;recovery時間與checkpointless相當
  • 三種方案都有trade-off;fault-tolerant inference已是8-way單節點標準,但fault-tolerant training仍是前沿實驗室的秘密武器或需付費授權
AI基建 看多 中期

Fault-tolerant訓練框架生態系快速演進,開源選項(TorchFT)仍有明顯limitation,商業授權方案(TorchPass)提供更完整功能 #催化劑

雲端供應商TCO實測:Gold-tier vs Hyperscaler vs Silver-tier

  • 大型LLM Pretrain(5184 GB300,GPU定價拉平):Gold 1x、Hyperscaler 1.10x、Silver 1.15x;主因分別是AWS支援費+EFA調試、goodput損耗+storage
  • Multimodal RL Research(2048 B200):Gold $2.40/GPU-hr vs Hyperscaler $3.10/GPU-hr;TCO差距1x vs 1.61x,主因是GPU定價本身
  • Inference Endpoints(512 H200):Gold/Silver差距<1%(故障容忍推論框架抵消reliability差異);Hyperscaler仍貴59%,主因GPU定價
  • Gold-tier = Nebius, Fluidstack, Crusoe;Hyperscaler = Oracle, Azure, AWS, GCP;Silver-tier = Together, Lambda, Vultr, Voltage Park等
AI基建 看多 中期

Gold-tier neocloud在large training workload的TCO優勢明確(比hyperscaler便宜10%、比silver便宜15%),但在fault-tolerant inference場景差距近乎消失,silver-tier供應商找到利基 #比較

ClusterMAX 2.1更新:新增供應商評級

  • Core42(G42旗下,UAE + 美國Buffalo AMD MI300X站點):AMD驅動與Broadcom Thor-II NIC相容問題嚴重,但工程支援積極;若推出新GPU或放寬合規限制,有望進入Silver-tier
  • BitDeer:馬來西亞站點2節點GB200 NVL72初測,IMEX domain未完成配置,NVLink驗證受限;仍需觀察大叢集orchestration與reliability
  • FPT Smart Cloud(越南):PKey/SAKey配置錯誤,可看到所有其他客戶端點——嚴重安全問題,阻擋Silver-tier資格 #風險
  • Radiant/Ori(Brookfield收購):同樣PKey/SAKey問題,加上NetworkOperator NIC配置錯誤,18小時內無自動告警或節點替換——Q2 2026目標推出監控儀表板 #催化劑
  • 新增追蹤:Tatra Supercompute(Slovakia)、QumulusAI、Boostrun、SK Telecom、BytePlus(ByteDance)等
AI基建 短期

ClusterMAX 2.1揭示多家新興neocloud存在基本安全配置問題(PKey/SAKey),顯示市場仍有大量品質參差不齊的供應商 #風險