オープンソース LLM 2026年7月20日 約 22 分 DeepSeek V4 ピーク料金

DeepSeek V4 正式公開
料金・ベンチマーク・GPT-5.6 との比較

2026年7月20日 GA 公開 · ピーク/オフピーク料金 · 100万トークン · SWE-bench 80.6% · 7月24日まで API 移行

DeepSeek V4 一般提供(GA)公開。オープンウェイト AI モデル

要点:3か月間のプレビュー提供を経て、DeepSeek V4 ファミリーは2026年7月20日に一般提供(GA)を正式開始しました。正式版では、エージェントタスク、数学、コーディングの各領域で実用的な性能向上に加え、DeepSeek 史上初の時間帯別ピーク料金が導入されています。本稿では、リリースタイムライン、CSA/HCA アーキテクチャ、ベンチマーク表、GPT-5.6 および Claude Fable 5 との比較、ピーク/オフピーク料金、7月24日の API 移行期限までを整理します。

01

GA 公開でプレビュー版から何が変わったか

日付マイルストーン
2026年4月24日V4 プレビュー + MIT オープンウェイト(V4-Pro 1.6T、V4-Flash 284B)
2026年5月本番向け Flash & Pro のチューニング完了、API 一般提供開始
2026年6月V4-Pro 出力料金を恒久的に 75% 削減($0.87/M トークン)
2026年6月29日全 API ユーザーへメール:7月中旬 GA + 初のピーク/オフピーク料金の開示
2026年7月19日一部開発者向けグレーリリース、報道各社が「翌日フルリリース」と報道
2026年7月20日GA 正式公開
2026年7月24日deepseek-chat および deepseek-reasoner の恒久停止

移行前に押さえるべき課題

  1. 01

    レガシーエンドポイントの期限切れdeepseek-chat は 7月24日に停止 — 旧モデル名のままの本番コードは動作しなくなります

  2. 02

    ピーク料金の複雑さ:業務時間帯は料金が2倍 — 計画外のバッチジョブはコストが急増します

  3. 03

    クローズドソースのコスト上限:GPT-5.6 Sol や Claude Fable 5 は出力 $15–50/M — 大規模運用では正当化が困難です

  4. 04

    100万トークンコンテキストの経済性:多くのモデルは KV キャッシュコストの壁により、100万トークン窓を実用的な価格で提供できません

02

アーキテクチャ:100万トークンを実用化する仕組み

仕様V4-ProV4-Flash
総パラメータ数1.6 兆2840 億
トークンあたりのアクティブ数490 億(3%)130 億(4.6%)
レイヤー数6143
コンテキスト窓1,000,000 トークン1,000,000 トークン
最大出力384K384K
精度FP4(MoE エキスパート)+ FP8同一
学習データ33T+ トークン32T+ トークン
ライセンスMITMIT

Compressed Sparse Attention(CSA)+ Heavily Compressed Attention(HCA)

V4 は V2/V3 の MLA を、2系統のハイブリッドに置き換えました。

  • CSA:ソフトマックスゲート付きプーリングで KV を 4 倍圧縮。FP4「ライトニングインデクサー」が top-k ブロックを選択(Pro: 1024、Flash: 512)。直近コンテキスト用に 128 トークンのスライディングウィンドウ
  • HCA:128 倍圧縮後に密なグローバルアテンションを適用し、CSA が見落としうる長距離パターンを捕捉

100万トークン時:27% の V3.2 推論 FLOPs。KV キャッシュは V3.2 メモリの 10%(Flash は 7%)に削減されます。

mHC と Muon

Manifold-Constrained Hyper-Connections(mHC) は、双確率行列で制御される 4 チャネル残差ストリームを用い、61 レイヤーを通じて勾配を安定化します。Muon オプティマイザ(AdamW ではなく)は Newton-Schulz 直交化により、より高速かつ安定した学習を実現します。

3つの推論モード

モード説明用途
Non-think高速、チェーン・オブ・ソートなしルーティング、分類、単純 Q&A
Think High明示的な推論ブロックデバッグ、中程度の複雑さ
Think Max最大努力(384K+ コンテキスト)複雑な数学、多段 Agent

推奨サンプリング:全モードで temperature=1.0, top_p=1.0 です。

03

ベンチマーク数値:勝てる領域と負ける領域

ベンチマークV4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% オープンウェイト最高96.0%N/A約 69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench(Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

実際の GitHub バグ修正(SWE-bench Verified)では、V4-Pro の 80.6% はオープンウェイト最高スコアで、Gemini 3.1 Pro と同率です。Claude Fable 5 は Verified 96%、より難易度の高い SWE-bench Pro 80.3% と、総合では依然リードしています。

コスト対性能の現実(Artificial Analysis)

  • Claude Fable 5:50 ポイント、タスクあたり $3.48
  • DeepSeek V4-Pro:38 ポイント、タスクあたり $0.03

性能差 24% に対し 116 倍安い — 本番ボリュームでは無視しにくい数字です。

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5

V4-ProGPT-5.6 SolClaude Fable 5
オープンウェイト / セルフホスト可(MIT)不可不可
100万コンテキスト未確認
総合コーディング最強第2 tier第2 tierSWE-bench Pro 首位
アルゴリズム / 数学最強LiveCodeBench 首位強力
出力コスト(オフピーク)$0.87/M約 $15/M約 $50/M
出力コスト(ピーク)$1.74/M
データ主権セルフホスト可能不可不可

V4-Pro を選ぶ場合: セルフホスト、大量 API 呼び出し、コーディング Agent、予算内での文書分析が必要なとき。Fable 5 を選ぶ場合: マルチファイルリポジトリ作業の絶対性能が最優先で、予算が二次的なとき。GPT-5.6 を選ぶ場合: ターミナル / シェル Agent ワークフロー(Terminal-Bench 2.1 首位)や Microsoft 365 / Azure 深い統合が必要なとき。

05

ピーク/オフピーク料金の解説

モデル項目オフピークピーク
V4-Pro入力(キャッシュヒット)$0.0035/1M2 倍
入力(キャッシュミス)$0.435/1M$0.87/1M
出力$0.87/1M$1.74/1M
V4-Flash入力(キャッシュヒット)$0.0028/1M2 倍
入力(キャッシュミス)$0.14/1M$0.28/1M
出力$0.28/1M$0.56/1M

ピーク時間帯(北京時間): 平日 09:00–12:00 および 14:00–18:00 です。

請求を抑える 5 ステップ

  1. 01

    バッチジョブをオフピーク(北京時間 18:00 以降または 09:00 以前)にスケジュールする

  2. 02

    キャッシュヒットを最大化 — 静的システムプロンプトをメッセージスタックの先頭に配置する

  3. 03

    単純クエリは V4-Flash にルーティングし、複雑な推論のみ Pro にエスカレーションする

  4. 04

    アカウントメールで 24 時間前の料金変更通知を監視する

  5. 05

    cron / キューで非リアルタイム作業をオフピーク枠に固定する

ピーク時でも V4-Pro 出力 $1.74/M は、Claude Opus 4.8($15/M)より 約 8.6 倍安い ままです。

06

移行ガイド:期限は 7月24日

期限:2026年7月24日 15:59 UTC。 レガシー名 deepseek-chat および deepseek-reasoner は恒久停止されます。

旧名称新しい相当モデル備考
deepseek-chatdeepseek-v4-flash(非 thinking)多くのチャット用途でドロップイン置換可
deepseek-reasonerdeepseek-v4-flash(thinking)または deepseek-v4-proPro でより強力な推論
Python · OpenAI SDK
# 旧(7月24日で停止)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])

# 新
response = client.chat.completions.create(
    model="deepseek-v4-pro",  # または deepseek-v4-flash
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 は OpenAI 互換 API と Anthropic Messages API の両方をサポートします — 同じ base_url のまま model のみ更新すれば移行できます。

07

結論:2026年に DeepSeek V4 は選ぶ価値があるか

短答:はい — 特にコスト、オープン性、データ管理を重視する場合です。SWE-bench Verified で最強のオープンウェイトコーディングモデル(80.6%)、経済的に実用可能な 100万トークンコンテキスト、ピーク時でも全クローズド競合を下回る料金、速度と深度を調整できる多モード推論が揃っています。

ピーク料金は 24/7 パイプラインに運用の複雑さを加えますが、オフピーク料金は依然として非常に安く、対策も明確です。

引用すべき主要数値

  • SWE-bench Verified:80.6%(オープンウェイト最高)
  • 100万コンテキスト KV メモリ:V3.2 の 10%
  • V4-Pro オフピーク出力:$0.87/M、ピーク $1.74/M
  • API 移行期限:2026年7月24日 15:59 UTC
08

FAQ

エージェント、数学、コードの性能が向上し、ピーク/オフピーク料金が導入されました。4月からの MoE アーキテクチャは同一で、本番グレードの安定性と商用料金が確定しています。

北京時間の平日 09:00–12:00 および 14:00–18:00 です。料金は2倍になります。

はい — 2026年7月24日に恒久停止されます。deepseek-v4-flash または deepseek-v4-pro へ移行してください。

Flash はルーティングや大量の軽量タスク向け、Pro は複雑な推論、コーディング Agent、長コンテキスト作業向けです。

はい。ピーク時の V4-Pro 出力は $1.74/M で、Claude Opus 4.8 の $15/M より約 8.6 倍安くなります。

おわりに

DeepSeek V4 GA はオープンウェイトの価値基準を引き上げましたが、本番投入には API 移行、ピーク時間帯のスケジューリング、実開発環境での Agent オーケストレーションが依然必要です。Windows や Linux が日常使いで、OpenClaw マルチモデルルーティングの検証、SWE-bench との比較、7月24日までの設定変更のバッチテストにネイティブ macOS GUI セッションが必要な場合、Mac の購入は高コストで、SSH だけではシステム権限ダイアログを扱えません。VNCMac リモート Mac を時間課金で借りれば、隔離ノード上で VNC 接続し、V4 API の配線、長コンテキスト Agent タスク、移行検証を行い、スプリント終了後すぐ課金を止められます。Mac レンタルプランから始めてください。