2026年7月20日 GA 公開 · ピーク/オフピーク料金 · 100万トークン · SWE-bench 80.6% · 7月24日まで API 移行
要点:3か月間のプレビュー提供を経て、DeepSeek V4 ファミリーは2026年7月20日に一般提供(GA)を正式開始しました。正式版では、エージェントタスク、数学、コーディングの各領域で実用的な性能向上に加え、DeepSeek 史上初の時間帯別ピーク料金が導入されています。本稿では、リリースタイムライン、CSA/HCA アーキテクチャ、ベンチマーク表、GPT-5.6 および Claude Fable 5 との比較、ピーク/オフピーク料金、7月24日の API 移行期限までを整理します。
| 日付 | マイルストーン |
|---|---|
| 2026年4月24日 | V4 プレビュー + MIT オープンウェイト(V4-Pro 1.6T、V4-Flash 284B) |
| 2026年5月 | 本番向け Flash & Pro のチューニング完了、API 一般提供開始 |
| 2026年6月 | V4-Pro 出力料金を恒久的に 75% 削減($0.87/M トークン) |
| 2026年6月29日 | 全 API ユーザーへメール:7月中旬 GA + 初のピーク/オフピーク料金の開示 |
| 2026年7月19日 | 一部開発者向けグレーリリース、報道各社が「翌日フルリリース」と報道 |
| 2026年7月20日 | GA 正式公開 |
| 2026年7月24日 | deepseek-chat および deepseek-reasoner の恒久停止 |
レガシーエンドポイントの期限切れ:deepseek-chat は 7月24日に停止 — 旧モデル名のままの本番コードは動作しなくなります
ピーク料金の複雑さ:業務時間帯は料金が2倍 — 計画外のバッチジョブはコストが急増します
クローズドソースのコスト上限:GPT-5.6 Sol や Claude Fable 5 は出力 $15–50/M — 大規模運用では正当化が困難です
100万トークンコンテキストの経済性:多くのモデルは KV キャッシュコストの壁により、100万トークン窓を実用的な価格で提供できません
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆 | 2840 億 |
| トークンあたりのアクティブ数 | 490 億(3%) | 130 億(4.6%) |
| レイヤー数 | 61 | 43 |
| コンテキスト窓 | 1,000,000 トークン | 1,000,000 トークン |
| 最大出力 | 384K | 384K |
| 精度 | FP4(MoE エキスパート)+ FP8 | 同一 |
| 学習データ | 33T+ トークン | 32T+ トークン |
| ライセンス | MIT | MIT |
V4 は V2/V3 の MLA を、2系統のハイブリッドに置き換えました。
100万トークン時:27% の V3.2 推論 FLOPs。KV キャッシュは V3.2 メモリの 10%(Flash は 7%)に削減されます。
Manifold-Constrained Hyper-Connections(mHC) は、双確率行列で制御される 4 チャネル残差ストリームを用い、61 レイヤーを通じて勾配を安定化します。Muon オプティマイザ(AdamW ではなく)は Newton-Schulz 直交化により、より高速かつ安定した学習を実現します。
| モード | 説明 | 用途 |
|---|---|---|
| Non-think | 高速、チェーン・オブ・ソートなし | ルーティング、分類、単純 Q&A |
| Think High | 明示的な推論ブロック | デバッグ、中程度の複雑さ |
| Think Max | 最大努力(384K+ コンテキスト) | 複雑な数学、多段 Agent |
推奨サンプリング:全モードで temperature=1.0, top_p=1.0 です。
| ベンチマーク | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% オープンウェイト最高 | 96.0% | N/A | 約 69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench(Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
実際の GitHub バグ修正(SWE-bench Verified)では、V4-Pro の 80.6% はオープンウェイト最高スコアで、Gemini 3.1 Pro と同率です。Claude Fable 5 は Verified 96%、より難易度の高い SWE-bench Pro 80.3% と、総合では依然リードしています。
性能差 24% に対し 116 倍安い — 本番ボリュームでは無視しにくい数字です。
| V4-Pro | GPT-5.6 Sol | Claude Fable 5 | |
|---|---|---|---|
| オープンウェイト / セルフホスト | 可(MIT) | 不可 | 不可 |
| 100万コンテキスト | 可 | 未確認 | 可 |
| 総合コーディング最強 | 第2 tier | 第2 tier | SWE-bench Pro 首位 |
| アルゴリズム / 数学最強 | LiveCodeBench 首位 | 強力 | — |
| 出力コスト(オフピーク) | $0.87/M | 約 $15/M | 約 $50/M |
| 出力コスト(ピーク) | $1.74/M | — | — |
| データ主権 | セルフホスト可能 | 不可 | 不可 |
V4-Pro を選ぶ場合: セルフホスト、大量 API 呼び出し、コーディング Agent、予算内での文書分析が必要なとき。Fable 5 を選ぶ場合: マルチファイルリポジトリ作業の絶対性能が最優先で、予算が二次的なとき。GPT-5.6 を選ぶ場合: ターミナル / シェル Agent ワークフロー(Terminal-Bench 2.1 首位)や Microsoft 365 / Azure 深い統合が必要なとき。
| モデル | 項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | $0.0035/1M | 2 倍 |
| 入力(キャッシュミス) | $0.435/1M | $0.87/1M | |
| 出力 | $0.87/1M | $1.74/1M | |
| V4-Flash | 入力(キャッシュヒット) | $0.0028/1M | 2 倍 |
| 入力(キャッシュミス) | $0.14/1M | $0.28/1M | |
| 出力 | $0.28/1M | $0.56/1M |
ピーク時間帯(北京時間): 平日 09:00–12:00 および 14:00–18:00 です。
バッチジョブをオフピーク(北京時間 18:00 以降または 09:00 以前)にスケジュールする
キャッシュヒットを最大化 — 静的システムプロンプトをメッセージスタックの先頭に配置する
単純クエリは V4-Flash にルーティングし、複雑な推論のみ Pro にエスカレーションする
アカウントメールで 24 時間前の料金変更通知を監視する
cron / キューで非リアルタイム作業をオフピーク枠に固定する
ピーク時でも V4-Pro 出力 $1.74/M は、Claude Opus 4.8($15/M)より 約 8.6 倍安い ままです。
期限:2026年7月24日 15:59 UTC。 レガシー名 deepseek-chat および deepseek-reasoner は恒久停止されます。
| 旧名称 | 新しい相当モデル | 備考 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非 thinking) | 多くのチャット用途でドロップイン置換可 |
deepseek-reasoner | deepseek-v4-flash(thinking)または deepseek-v4-pro | Pro でより強力な推論 |
# 旧(7月24日で停止)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])
# 新
response = client.chat.completions.create(
model="deepseek-v4-pro", # または deepseek-v4-flash
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)V4 は OpenAI 互換 API と Anthropic Messages API の両方をサポートします — 同じ base_url のまま model のみ更新すれば移行できます。
短答:はい — 特にコスト、オープン性、データ管理を重視する場合です。SWE-bench Verified で最強のオープンウェイトコーディングモデル(80.6%)、経済的に実用可能な 100万トークンコンテキスト、ピーク時でも全クローズド競合を下回る料金、速度と深度を調整できる多モード推論が揃っています。
ピーク料金は 24/7 パイプラインに運用の複雑さを加えますが、オフピーク料金は依然として非常に安く、対策も明確です。
エージェント、数学、コードの性能が向上し、ピーク/オフピーク料金が導入されました。4月からの MoE アーキテクチャは同一で、本番グレードの安定性と商用料金が確定しています。
北京時間の平日 09:00–12:00 および 14:00–18:00 です。料金は2倍になります。
はい — 2026年7月24日に恒久停止されます。deepseek-v4-flash または deepseek-v4-pro へ移行してください。
Flash はルーティングや大量の軽量タスク向け、Pro は複雑な推論、コーディング Agent、長コンテキスト作業向けです。
はい。ピーク時の V4-Pro 出力は $1.74/M で、Claude Opus 4.8 の $15/M より約 8.6 倍安くなります。
DeepSeek V4 GA はオープンウェイトの価値基準を引き上げましたが、本番投入には API 移行、ピーク時間帯のスケジューリング、実開発環境での Agent オーケストレーションが依然必要です。Windows や Linux が日常使いで、OpenClaw マルチモデルルーティングの検証、SWE-bench との比較、7月24日までの設定変更のバッチテストにネイティブ macOS GUI セッションが必要な場合、Mac の購入は高コストで、SSH だけではシステム権限ダイアログを扱えません。VNCMac リモート Mac を時間課金で借りれば、隔離ノード上で VNC 接続し、V4 API の配線、長コンテキスト Agent タスク、移行検証を行い、スプリント終了後すぐ課金を止められます。Mac レンタルプランから始めてください。