DeepSeek V4 整體表現:與 Claude Opus 同級,成本大幅更低
- —DeepSeek V4 Pro(8.27)與 Claude Opus 4.6(8.17)位於同一分析梯次,Flash(8.01)亦與 Opus 4.6 相當但速度快 36%
- —DeepSeek V4 是第一個在複雜工具輔助分析任務上匹配 Claude Opus 4.7 的非 Anthropic 模型
- —DeepSeek 的相對弱項是輸出格式(儀表板圖表、metric cards),而非分析品質本身
模型 Coding 能力:Claude Opus 4.6 (Thinking) 領先
- —Claude Opus 4.6 (Thinking) coding 平均分 8.88,為本次 benchmark 最高;DeepSeek Pro (Thinking) 以 8.48(4 項完成)緊隨其後
- —GPT-5.4 系統設計輸出強勁,但限流實作與 Opus 4.7 的生產等級實作(含 48 項測試)相比明顯較淺
模型財務研究能力:NVDA 賽局理論任務深度比較
- —DeepSeek V4 Pro 在 NVDA 賽局理論任務(game theory)產出 28,302 字、11 玩家、18 引用、強制移動經濟學,獲本次 benchmark 唯一滿分
- —Opus 4.7 在財報電話文字整合(管理層引言、Q&A 主題分析)與引用嚴謹度上仍優於 DeepSeek
成本與速度:DeepSeek Flash 的性價比優勢
- —DeepSeek V4 Flash 平均每任務 165 秒,比所有 Claude Opus 版本快;Pro 約 256 秒,與 Opus 4.7 相當
- —Flash 每 100 萬 output tokens $0.28,每任務約 $0.007;Pro 每 100 萬 $3.48,約 $0.10/task;均支援 cache-hit 折扣(輸入降至標準價 10-20%)
- —對生產部署而言,Flash 提供 165 秒平均速度與 $0.007/task 的強速度-品質折衷;Flash Thinking 在已完成任務品質進一步提升但覆蓋率略降 #催化劑
前沿 AI 模型三方競賽:Anthropic vs DeepSeek vs OpenAI
- —GPT-5.4 是最快的全套模型(105 秒平均),在事件除錯與系統設計上仍強,但整體得分 7.88,已不領先 coding 榜
- —GPT-5.5/Codex 5.5 API 尚未正式發布,完整 benchmark 結果待公開 API 後補充 #催化劑
- —三方各自領域:Anthropic 主導寫作/財報/引用嚴謹度;DeepSeek 主導分析廣度/資料合成/成本;OpenAI 主導速度/系統設計