KOL Digest
Semianalysis · 2026.08.10 週一 · Substack

Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX

看原始內容 4 個主題 · 6 個標的/題材

TileRT 突破 NVIDIA GPU 低延遲推論 bottleneck:B200 達到 500 tok/s/user 互動速度

  • AI 推論市場正面臨吞吐量(tok/s/GPU)與互動性(tok/s/user)的權衡。傳統 GPU 編譯模型因頻繁啟動 Kernel 與同步開銷,在 Batch Size 1 等超低延遲場景下無法發揮 HBM 頻寬極限。TileRT 將整個解碼圖靜態編譯為單一持久化 Engine Kernel,消除 Kernel 間切換與記憶體寫回開銷。在 $NVDA B200 推論測試中,TileRT 達成同成本下 2 倍於傳統引擎的互動速度。這證明通用 GPU 在軟體層級的創新下,依然具備跨入極致低延遲領域的強大潛力。
$NVDA 看多 中期

傳統 GPU 架構因 CUDA Kernel 啟動開銷與記憶體延遲,在超低延遲推論場景無法達到 HBM 理論頻寬。TileRT 透過將 Decode 計算靜態編譯為單一持久化 Kernel,在 $NVDA B200 節點達成高達 500 tok/s/user 的互動速度,比同等精度的傳統引擎快 3 倍。TileRT 解決了 NVIDIA GPU 缺乏超低延遲優勢的短板,使其硬體生態系在低延遲與高吞吐市場同時保持領先

AI算力 看多 中期

即時語音對話與 Agent 應用興起,推動市場對超高互動性(Sub-millisecond TPOT)的需求爆發。傳統擴展 NVLink 機櫃拓撲無法解決 Batch Size 1 的 Kernel 啟動延遲,而編譯器層級的持久化 Engine 成為破局關鍵。推論算力正加速從單純追求多使用者吞吐量,分化出極致低延遲的專用解碼層需求

vLLM 與 TileRT 的 Prefill-Decode 離散架構(PD Disaggregation)

  • LLM 推論分為計算密集型的 Prefill 階段與記憶體延遲敏感的 Decode 階段。TileRT 定位為單客火箭(single-passenger rocket ship),專精於單一請求的極速解碼;vLLM 則作為通用客運系統,負責 Prefill 預填、隊列調度與 OpenAI 相容 API。透過 vLLM 的 MultiConnector API 與 Mooncake/NIXL KV 快取傳輸引擎,系統能將極致低延遲請求動態路由至 TileRT 解碼池,一般請求則留在 vLLM 解碼池。這種 PD 解構模式已在小米 MiMo V2.5 Pro 與 Z.ai GLM-5.1 上量產導入。
AI基建 看多 中期

Prefill 與 Decode 在算力瓶頸上本質不同,採用離散架構(PD Disaggregation)已成大型 AI基建 的標準配置。TileRT 與 vLLM 結合使同一套 Prefill 伺服器能同時供應高吞吐與超低延遲兩種不同等級的服務。PD 離散架構讓 AI 雲端業者能以模組化軟體堆疊彈性配置算力資源,無須為特殊延遲需求重新設計整個推論叢集

TileRT 軟體革命對專用 AI ASIC (Groq, Cerebras, SambaNova) 的市場衝擊

  • Groq、Cerebras 與 SambaNova 等專用推論晶片利用片上 SRAM 與數據流(Dataflow)硬體架構消除 Kernel 開銷,在低延遲領域建立屏障。然而 TileRT 在軟體層面擬合了數據流調度邏輯,使 $NVDA GPU 叢集展現出極強的低延遲競爭力。更關鍵的是硬體通用性(Fungibility):GPU 叢集能隨時透過軟體配置在 Prefill、高吞吐 Decode 與 TileRT 低延遲 Decode 間轉換;專用 ASIC fleet 則受限於硬體固定比例,面臨極高的高峰流量預估錯誤風險與資本閒置代價。
$NVDA 看多 長期

Groq 與 Cerebras 原本憑藉片上 SRAM 壟斷超低延遲推論市場,但 TileRT 讓現有 $NVDA GPU 叢集只需更新軟體配置即可達成極致互動速度。通用 GPU 的軟體彈性避免了專用 ASIC 硬體比例固定導致的資本閒置風險。TileRT 顯著降低了客戶採購專用推論 ASIC 的必要性,鞏固了 NVIDIA 通用 GPU 叢集的總體有效市場(TAM)

半導體 中期

雖然 Cerebras 等晶片在片上 SRAM 記憶體頻寬上限上仍高於 HBM,但軟體優化讓通用 GPU 能以足夠優秀的效能滿足多數低延遲需求。購買專用 半導體 ASIC 需承擔極高實體部署與業務轉型風險。專用 AI 半導體晶片面臨通用 GPU 生態系強大的軟體追趕壓力,硬體純粹性在彈性資本面前逐漸失去絕對優勢

TileRT 的開發瓶頸與 AgentX 多輪推論測試規劃

  • TileRT 目前最大瓶頸在於 AOT 靜態編譯高度依賴手工調校,支援的模型目錄非常有限(僅 GLM-5/5.1 與 DeepSeek-V3.2)。未來研發重點包括透過 TileOPs DSL 進行自動化 CodeGen,以及將測試推進至 AgentX(模擬真實 Claude Code 與 Codex 的多輪長文本 Agent 測試,平均上下文長度達 140k)。此外,團隊也正評估 Batch Size 2、4、8 下 TileRT 的 Pareto 效能邊界。
AI算力 短期

TileRT 雖然帶來極致速度,但其 AOT 靜態編譯機制需要對每種模型結構進行深度的 Tile 級與 Warp 級優化,維護與擴充成本極高。開發團隊正導入 TileOPs 自動化算子編譯以降低工程門檻。靜態持久化 Engine 的編譯複雜度是 TileRT 規模化的最大挑戰,自動化算子編譯將決定其能否廣泛適應快速疊代的 LLM 模型