TileRT 突破 NVIDIA GPU 低延遲推論 bottleneck:B200 達到 500 tok/s/user 互動速度
- —AI 推論市場正面臨吞吐量(tok/s/GPU)與互動性(tok/s/user)的權衡。傳統 GPU 編譯模型因頻繁啟動 Kernel 與同步開銷,在 Batch Size 1 等超低延遲場景下無法發揮 HBM 頻寬極限。TileRT 將整個解碼圖靜態編譯為單一持久化 Engine Kernel,消除 Kernel 間切換與記憶體寫回開銷。在 $NVDA B200 推論測試中,TileRT 達成同成本下 2 倍於傳統引擎的互動速度。這證明通用 GPU 在軟體層級的創新下,依然具備跨入極致低延遲領域的強大潛力。
傳統 GPU 架構因 CUDA Kernel 啟動開銷與記憶體延遲,在超低延遲推論場景無法達到 HBM 理論頻寬。TileRT 透過將 Decode 計算靜態編譯為單一持久化 Kernel,在 $NVDA B200 節點達成高達 500 tok/s/user 的互動速度,比同等精度的傳統引擎快 3 倍。TileRT 解決了 NVIDIA GPU 缺乏超低延遲優勢的短板,使其硬體生態系在低延遲與高吞吐市場同時保持領先
即時語音對話與 Agent 應用興起,推動市場對超高互動性(Sub-millisecond TPOT)的需求爆發。傳統擴展 NVLink 機櫃拓撲無法解決 Batch Size 1 的 Kernel 啟動延遲,而編譯器層級的持久化 Engine 成為破局關鍵。推論算力正加速從單純追求多使用者吞吐量,分化出極致低延遲的專用解碼層需求