KOL Digest
Semianalysis · 2026.08.24 週一 · Substack

AgentX - InferenceXv3: Does CUDA Moat Hold up in Agentic Inferencing?

看原始內容 3 個主題 · 5 個標的/題材

AgentX 1.0 發布:多輪長文本 Agentic 推論成為 AI 算力評測新基準

  • 長文本與多輪 Agentic 工作負載已成為生產環境 AI 推論的主流,傳統單輪固定長度測試無法反映真實系統瓶頸
  • Agentic 推論本質是跨節點 KV Cache 傳輸、記憶體卸載與 Router 調度的系統級工程問題
AI算力 看多 中期

多輪 Agentic 工作負載推動推論需求從單晶片 Kernel 運算轉向系統級 KV Cache 跨節點傳輸與動態調度。傳統固定長度基準已無法反映真實硬體表現,極高 Prefix 重用率與動態 Subagent 將使硬體架構與軟體生態成為 AI 算力服務商的核心競爭力。Agentic 推論成為市場主流將倒逼晶片廠升級 HBM 容量與高頻寬跨節點互連系統

晶片廠商 Agentic 推論大決戰:NVIDIA 依靠軟體生態優勢領先,AMD ATOM 展現競爭力但 vLLM 仍需補強

  • NVIDIA GB300 與 GB200 在 DeepSeek V4、MiniMax M3 及 Qwen3.5 等模型推論中依賴強大軟體生態與大 HBM 容量取得領先
  • AMD MI355X 透過專有 ATOM 引擎在延遲與特定巨型模型上超越 B200,但開源 vLLM 與 SGLang 表現仍落後
$NVDA 看多 中期

GB300 與 B300 憑藉增加 50% 的 HBM 容量與 Dynamo / TRT-LLM 優化,在 DeepSeek V4 與 MiniMax M3 的 Agentic 推論表現出色。雖然在部分單點被 $AMD 特化引擎追上,但完整的軟體生態與 Context Parallelism 仍構築極高護城河。HBM 容量優勢搭配完善的推論生態系,使 NVIDIA 在多輪長文本推論成本效率上維持絕對領先

$AMD 中性 中期

MI355X 搭配專有 ATOM 引擎在 DeepSeek V4 與 Kimi K3 表現亮眼,部分延遲區間性價比超越 $NVDA GB300。然而開源 vLLM 與 SGLang 的適配度依然嚴重落後,且客戶不願在生產環境採用專有 ATOM。硬體規格具備競爭力但開源軟體生態落後,需加速將 ATOM 優化上游化至 vLLM 才能轉化為商業訂單

半導體 看多 中期

在巨型模型與 Agentic 任務中,晶片 HBM 容量大小直接決定了 KV Cache 命中率與 DRAM Offload 的依賴程度。$NVDA B300 與 $AMD MI355X 等高 HBM 規格晶片在高並發情境優勢顯著。記憶體容量與頻寬已取代純算力 TFLOPS,成為決定 AI 晶片推論端實用價值的最關鍵規格

Agentic 推論生態系軟體優化:跨 vLLM、SGLang、TRT-LLM 與 KV Cache 管理器全面升級

  • AgentX 驅動了上游社群超過 50 個 PR,針對 KV Cache 存活週期、Incremental Tokenization 與 CPU Offload 進行深度優化
  • SGLang 透過 Runtime Scalar 解決可變長度編譯問題,TRT-LLM 透過邊界感知分詞將重複 Turn 分詞時間從 185ms 降至 11.3ms
AI基建 看多 長期

Agentic 基礎設施不僅包含晶片硬體,更涵蓋 vLLM、SGLang、TRT-LLM、Dynamo 與 Mooncake 等軟體堆疊。跨節點 KV Cache 傳輸、離線 Memory 卸載與邊界感知分詞等技術突破,大幅降低了長文本推論的延遲與記憶體開銷。軟體堆疊在 KV Cache 管理與調度上的持續優化,將使雲端 AI 基礎設施的推論營運成本大幅下降