GPT-5.5 進入前沿:Spud 預訓練首次公開
- —GPT-5.5 是 OpenAI 首個基於新預訓練「Spud」的公開版本,訓練量達 100k GB200 NVL72 叢集,但實際 pre-training 仍在 Hopper,叢集用於 post-training(RL)
- —API 定價 $5/M input、$30/M output,比 GPT-5.4 貴 2x,與 Opus 4.7 相當;另提供 2.5x 標準費率的 priority tier #價位
- —另有 GPT-5.3-Codex-Spark(跑在 Cerebras、GPT-5.3 的蒸餾版)及 GPT-5.5 Pro(ChatGPT 與 API,主打科研長推理),為不同產品線 #比較
Opus 4.7:小幅升級、Fast Mode 缺席、tokenizer 漲價
- —Opus 4.7 是 Opus 4.6 的 drop-in replacement,benchmark 分數提升,但工程師描述是「勉強接受」而非熱情擁抱
- —最大痛點:Fast Mode 尚未上線;新 tokenizer 更細粒度計費,廠商坦承 token 用量最多增加 35%,等同漲價 35% #風險
- —4.7 預設減少 tool call、增加 reasoning,SemiAnalysis 工程師傾向升高 reasoning effort 到 xhigh/max 才能取回足夠 context,導致節省 token 的宣稱存疑
- —Anthropic 於 4/23 發布 postmortem,揭露 3 月至 4 月間三個影響幾乎所有 Claude Code 用戶的 bug,時間橫跨數週才被發現 #風險
DeepSeek V4:1M context、開源、但仍落後閉源前沿
- —DeepSeek V4 包含 V4-Pro(1.6T total / 49B active)與 V4-Flash(284B total / 13B active),核心突破是 128k → 1M context 視窗
- —技術創新:Compressed Sparse Attention(CSA)、Heavily Compressed Attention(HCA)、mHC,實現 1M token 設定下推論 FLOPs 降 73%、KV cache 降 90% #催化劑
- —開源含模型權重、技術報告、DeepEP / DeepGEMM / FlashMLA 等工具庫更新;DeepGEMM 新 Mega-Kernel 聲稱支援 Huawei Ascend NPU(但公開程式碼僅含 SM90/SM100)
- —SemiAnalysis InferenceX 團隊當日零時差支援 H200(FP8):~150 tok/sec throughput per GPU,遠低於 V3 的 1.3k-2.3k tok/sec,仍有大量優化空間 #風險
- —SemiAnalysis 結論:DeepSeek V4 是出色工程成就,將成最低成本的閉源替代品,但能力仍非最前沿,不會蠶食 SemiAnalysis 自身工作流程
GPT-5.5 vs Opus 4.7:SemiAnalysis 工程師實測印象
- —GPT-5.5 在 Codex 環境中優勢明顯:拉入更多 granular context 再修改、PR review / bug hunting / 文件更強
- —Opus 4.7(Claude Code)仍勝在:理解使用者真實意圖、開放式綠地開發、前端 UI 複製等開放性任務
- —SemiAnalysis 已形成雙模型工作流:Claude 起頭規劃與 POC → Codex 解決 bug 與複雜推理任務 #比較
- —Codex CLI 功能仍落後 Claude Code:缺 1M context fast mode、remote control sandbox 跨裝置、圖片上傳等功能,阻礙全面切換 #風險
Benchmark 的結構性缺陷與 cost per task 才是真指標
- —SWE-bench 系列:任務自動從 GitHub PR 抓取、無人工驗證,存在 eval 偏向特定實作、答案污染等問題;SWE-bench Verified 縮減至 500 題,仍有 >50% 爭議 eval
- —OpenAI 在 GPT-5.5 發布中刻意略去 SWE-bench Pro 結果,翻到文末才發現被 Opus 4.7 壓制(Mythos 更以 77.8% 大幅領先)
- —HLE(Humanity's Last Exam):30% 化學/生物題答案與同行評審文獻衝突,但各大 lab 仍以 9 位數預算 hillclimb 此類 benchmark
- —真正的北極星指標是 cost per task(而非 cost per token):Codex input/output ratio 80:1 vs Claude Code 100:1,Codex 消耗更少 input token,整體更便宜 #比較
- —SemiAnalysis 正收集數百萬美元規模的 agentic AI traces,分析不同 harness(Claude Code vs Codex vs Cursor)的 cost per task 差異 #催化劑