2026年7月20日 GA 上線 · 峰谷計費 · 1M 上下文 · SWE-bench 80.6% · API 遷移 7月24日截止
摘要:等了整整三個月,DeepSeek V4 正式版(GA)終於在 2026年7月20日 上線。相較 4 月預覽版,正式版在 Agent、數學推理與程式碼生成上做了專項強化,並首次導入峰谷計費。本文依官方重點完整整理:時間線、CSA/HCA 架構、Benchmark 跑分、對標 GPT-5.6 / Claude Fable 5、峰谷定價表、7月24日 API 遷移,以及開發者省錢與選型建議。
| 時間 | 事件 |
|---|---|
| 2026年4月24日 | V4 預覽版上線 + 開源(MIT),含 V4-Pro(1.6T)與 V4-Flash(284B) |
| 2026年5月 | V4-Flash 與 V4-Pro 生產調優版本上線,API 正式可用 |
| 2026年6月 | V4-Pro 價格永久降價 75%(輸出價 $0.87/M tokens) |
| 2026年6月29日 | 向全體 API 用戶發信,宣布 GA 將於 7 月中旬上線,首次披露峰谷計費 |
| 2026年7月19日 | 多位開發者獲 GA 灰度內測資格,媒體報導「正式版最快明日發布」 |
| 2026年7月20日 | GA 正式版上線(本文發布日) |
| 2026年7月24日 | 舊介面名 deepseek-chat 與 deepseek-reasoner 永久下線 |
一句話總結:V4 預覽版已經很強,正式版在此基礎上強化了 Agent 能力、數學推理與程式碼生成,同時配套完整的商業化計費體系。
舊 API 名稱即將失效:deepseek-chat 7月24日下線,生產環境存在中斷風險
峰谷計費增加複雜度:高峰時段費率翻倍,批次任務若未排程將明顯拉高帳單
閉源旗艦成本高:GPT-5.6 / Claude Fable 5 輸出價可達 $15–50/M,高頻呼叫難以負擔
長上下文 KV 成本:1M token 在多數模型上仍難經濟落地,需架構級優化
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 兆(1.6T) | 2840 億(284B) |
| 每 Token 啟用參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家)+ FP8 | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
DeepSeek V4 捨棄 V2/V3 時代的 MLA,改採兩種全新注意力機制的混合架構:
綜合效果:1M 上下文下推理 FLOPs 僅為 V3.2 的 27%;KV Cache 記憶體僅為 V3.2 的 10%(Flash 低至 7%)。
引入 4 通道殘差流,透過滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣,確保 61 層深網路中訊號穩定傳播。
訓練採用 Muon 優化器(非 AdamW),透過牛頓-舒爾茨正交化處理梯度,收斂更快、訓練更穩定。
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(thinking 標籤) | 中等複雜任務、程式碼除錯 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 複雜數學、長鏈路 Agent |
官方建議取樣參數:temperature=1.0, top_p=1.0(全模式通用)。
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 開源最高 | 96.0% | 未單獨公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 測的是真實 GitHub 儲存庫 Bug 修復,80.6% 為當前開源模型最高分,與 Gemini 3.1 Pro 並列。
Fable 5 成本是 V4-Pro 的 116 倍,得分僅約高 12 分(31%)。
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 | ✅ MIT | ❌ 閉源 | ❌ 閉源 |
| 可自託管 | ✅ | ❌ | ❌ |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強 |
| API 輸出價(離峰) | $0.87/M | ~$15/M | $50/M |
| 峰值輸出價 | $1.74/M | — | — |
| Agent 能力 | 強,支援多 Agent 編排 | 強 | 最強 |
| 資料隱私 | ✅ 可私有部署 | ❌ | ❌ |
GA 版本最受關注的變化:DeepSeek 首次引入峰谷差異化定價,類似電網分時電價。
| 模型 | 計費項 | 離峰(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 輸出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 輸出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
高峰時段(北京時間):工作日 09:00–12:00 和 14:00–18:00。
非即時任務排到非高峰(18:00 後或 9:00 前)
建構 Prompt Cache,重複 System Prompt 走快取命中
簡單路由用 V4-Flash,複雜推理再轉 V4-Pro
關注 DeepSeek 計費變更前 24 小時郵件通知
用 cron/佇列把批次處理固定在 Off-Peak 視窗
即使高峰,V4-Pro 輸出($1.74/M)仍比 Claude Opus 4.8($15/M)便宜 8.6 倍。
⚠️ 重要:舊模型名 deepseek-chat 和 deepseek-reasoner 將於 2026年7月24日 15:59 UTC(北京時間 7月24日 23:59) 永久停止存取。
| 舊模型名 | 新模型名 | 備註 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,適合輕量任務 |
deepseek-reasoner | deepseek-v4-flash(思考模式) | 或升級到 deepseek-v4-pro |
# ❌ 舊寫法(7月24日後失效)
client.chat.completions.create(model="deepseek-chat", messages=[...])
# ✅ 新寫法
client.chat.completions.create(
model="deepseek-v4-pro", # 或 deepseek-v4-flash
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)V4 同時支援 OpenAI ChatCompletions 與 Anthropic Messages 格式,base_url 不變,僅需更新 model 參數。
DeepSeek V4 GA 是 2026 年開源大模型領域最重要的里程碑之一。它的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6(暫時還不能),而在於以閉源旗艦 1/10 乃至 1/100 的成本,提供開源模型中無可爭議的最強效能。
適合:不想資料出境的企業、預算有限的獨立開發者、需要 1M token 長上下文的 Agent 工程師、追求極致性價比的 AI 產品團隊。
峰谷計費增加了成本複雜度,但本質上仍極具競爭力——這是 DeepSeek 從「價格屠夫」到「有規則的商業平台」的成熟化訊號。
資料來源:DeepSeek 官方文件、arXiv:2606.19348、HuggingFace、Artificial Analysis
GA 版專項提升 Agent/數學/程式碼,並引入峰谷計費;架構仍為 4 月 MoE 設計,生產穩定性與商業化體系已就緒。
北京時間工作日 09:00–12:00 與 14:00–18:00,費率翻倍。
2026年7月24日 23:59(北京時間),請遷移至 deepseek-v4-flash 或 deepseek-v4-pro。
Flash 適合輕量路由與高頻呼叫;Pro 適合複雜推理與長鏈路 Agent。
是。高峰 V4-Pro 輸出 $1.74/M,約為 Claude Opus 4.8($15/M)的 1/8.6。
DeepSeek V4 GA 把開源模型的性價比推上新高度,但要在生產環境跑通API 遷移、峰谷排程與多模型 Agent 編排,你仍需要穩定的開發環境。若主力機是 Windows/Linux,要在真實 macOS 圖形工作階段裡驗收 OpenClaw 多模型路由、對照 SWE-bench 做團隊選型,或趕在 7月24日前批次改設定並圖形化測通,自購 Mac 成本高、純 SSH 又點不了系統彈窗。租用 VNCMac 遠端 Mac 可按小時開通 VNC 桌面,在隔離節點上對接 V4 API、跑 Agent 長上下文任務並做遷移驗收,專案結束即停租。查看 Mac Mini M4 套餐 即可開始。