KOL Digest
FundaAI · 2026.04.24 週五 · Substack

Deep|DeepSeek V4 vs Claude vs GPT-5.4: A 38-Task Benchmark Across Coding, Reasoning, and Financial Research

看原始內容 5 個主題 · 6 個標的/題材

DeepSeek V4 整體表現:與 Claude Opus 同級,成本大幅更低

  • DeepSeek V4 Pro(8.27)與 Claude Opus 4.6(8.17)位於同一分析梯次,Flash(8.01)亦與 Opus 4.6 相當但速度快 36%
  • DeepSeek V4 是第一個在複雜工具輔助分析任務上匹配 Claude Opus 4.7 的非 Anthropic 模型
  • DeepSeek 的相對弱項是輸出格式(儀表板圖表、metric cards),而非分析品質本身
AI應用 看多 中期

DeepSeek V4 Pro 在財務研究多步任務上與 Opus 4.7 打成 7-7 平手,前沿模型差距持續收窄 Flash 每任務成本僅 $0.007,是 Claude Opus 的約 50 倍性價比,為 AI 輔助研究工作流開闢低成本替代方案 #風險

模型 Coding 能力:Claude Opus 4.6 (Thinking) 領先

  • Claude Opus 4.6 (Thinking) coding 平均分 8.88,為本次 benchmark 最高;DeepSeek Pro (Thinking) 以 8.48(4 項完成)緊隨其後
  • GPT-5.4 系統設計輸出強勁,但限流實作與 Opus 4.7 的生產等級實作(含 48 項測試)相比明顯較淺
AI算力 短期

Thinking 模式是 DeepSeek coding 最大的品質槓桿,但 hard coding 任務超時導致覆蓋率下降(Pro Thinking 僅 29/38)#風險

模型財務研究能力:NVDA 賽局理論任務深度比較

  • DeepSeek V4 Pro 在 NVDA 賽局理論任務(game theory)產出 28,302 字、11 玩家、18 引用、強制移動經濟學,獲本次 benchmark 唯一滿分
  • Opus 4.7 在財報電話文字整合(管理層引言、Q&A 主題分析)與引用嚴謹度上仍優於 DeepSeek

NVDA 被用作賽局理論任務的核心分析標的,DeepSeek Pro 完整展開 11 位市場參與者的策略互動與強制移動邏輯

NVDA 賽局理論任務展示 AI 基建競爭格局的複雜性,DeepSeek 與 Claude 在此類深度分析任務上各有所長

成本與速度:DeepSeek Flash 的性價比優勢

  • DeepSeek V4 Flash 平均每任務 165 秒,比所有 Claude Opus 版本快;Pro 約 256 秒,與 Opus 4.7 相當
  • Flash 每 100 萬 output tokens $0.28,每任務約 $0.007;Pro 每 100 萬 $3.48,約 $0.10/task;均支援 cache-hit 折扣(輸入降至標準價 10-20%)
  • 對生產部署而言,Flash 提供 165 秒平均速度與 $0.007/task 的強速度-品質折衷;Flash Thinking 在已完成任務品質進一步提升但覆蓋率略降 #催化劑
AI應用 看多 短期

DeepSeek Flash 以約 Claude Opus 1/50 的成本達到接近的分析品質,對使用 Claude 做深度研究的團隊具實質評估價值 #比較

前沿 AI 模型三方競賽:Anthropic vs DeepSeek vs OpenAI

  • GPT-5.4 是最快的全套模型(105 秒平均),在事件除錯與系統設計上仍強,但整體得分 7.88,已不領先 coding 榜
  • GPT-5.5/Codex 5.5 API 尚未正式發布,完整 benchmark 結果待公開 API 後補充 #催化劑
  • 三方各自領域:Anthropic 主導寫作/財報/引用嚴謹度;DeepSeek 主導分析廣度/資料合成/成本;OpenAI 主導速度/系統設計
AI算力 看多 中期

前沿模型競爭格局已從 Anthropic 獨大轉為三方競賽,DeepSeek 的加入顯著壓縮了高品質 AI 的使用成本