GA live seit 20. Juli 2026 · Peak-Valley-Preise · 1M Kontext · 80,6 % SWE-bench · API-Migration bis 24. Juli
Kurzfassung: Nach drei Monaten Preview-Zugang ist die DeepSeek-V4-Familie am 20. Juli 2026 offiziell GA. Das Full Release bringt spürbare Upgrades bei agentischen Tasks, Mathe und Coding — plus etwas, das die Community von DeepSeek noch nicht kannte: zeitbasierte Peak-Preise. Dieser Leitfaden deckt die Timeline, CSA/HCA-Architektur, Benchmark-Tabellen, ehrliche Vergleiche mit GPT-5.6 und Claude Fable 5, Peak-Valley-Pricing und die API-Migrationsfrist bis 24. Juli ab.
| Datum | Meilenstein |
|---|---|
| 24. April 2026 | V4-Preview + MIT Open Weights (V4-Pro 1,6T, V4-Flash 284B) |
| Mai 2026 | Produktionsgetunte Flash & Pro; API allgemein verfügbar |
| Juni 2026 | V4-Pro-Output dauerhaft um 75 % auf $0,87/M Tokens gesenkt |
| 29. Juni 2026 | E-Mail an alle API-Nutzer: GA Mitte Juli + erste Peak-Valley-Preisinfo |
| 19. Juli 2026 | Gray-Release für ausgewählte Entwickler; Presse: „Full Release morgen“ |
| 20. Juli 2026 | GA-Release geht live |
| 24. Juli 2026 | deepseek-chat und deepseek-reasoner endgültig abgeschaltet |
Legacy-Endpunkte laufen aus: deepseek-chat endet am 24. Juli — Produktionscode mit alten Namen bricht ab
Peak-Pricing-Komplexität: Geschäftszeiten verdoppeln die Tarife; ungeplante Batch-Jobs werden schnell teuer
Closed-Source-Kostendeckel: GPT-5.6 Sol und Claude Fable 5 liegen bei $15–50/M Output — schwer skalierbar
1M-Kontext-Ökonomie: Die meisten Modelle können Millionen-Token-Fenster ohne prohibitive KV-Cache-Kosten nicht bedienen
| Spec | V4-Pro | V4-Flash |
|---|---|---|
| Parameter gesamt | 1,6 Billionen | 284 Milliarden |
| Aktiv pro Token | 49B (3 %) | 13B (4,6 %) |
| Layer | 61 | 43 |
| Kontextfenster | 1.000.000 Tokens | 1.000.000 Tokens |
| Max. Output | 384K | 384K |
| Präzision | FP4 (MoE-Experten) + FP8 | Gleich |
| Trainingsdaten | 33T+ Tokens | 32T+ Tokens |
| Lizenz | MIT | MIT |
V4 ersetzt MLA aus V2/V3 durch einen Zwei-Spur-Hybrid:
Bei 1M Tokens: 27 % der V3.2-Inferenz-FLOPs; KV-Cache sinkt auf 10 % des V3.2-Speichers (Flash: 7 %).
Manifold-Constrained Hyper-Connections (mHC) nutzen einen 4-Kanal-Residual-Stream, gesteuert durch eine doppelt stochastische Matrix — stabile Gradienten über 61 Layer. Der Muon-Optimizer (nicht AdamW) wendet Newton-Schulz-Orthogonalisierung für schnelleres, stabileres Training an.
| Modus | Beschreibung | Einsatz |
|---|---|---|
| Non-think | Schnell, ohne Chain of Thought | Routing, Klassifikation, einfache Q&A |
| Think High | Explizite Reasoning-Blöcke | Debugging, mittlere Komplexität |
| Think Max | Maximaler Aufwand (384K+ Kontext) | Komplexe Mathe, Multi-Step-Agenten |
Empfohlenes Sampling: temperature=1.0, top_p=1.0 in allen Modi.
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % Open-Weight-Rekord | 96,0 % | N/A | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Bei echten GitHub-Bugfixes (SWE-bench Verified) ist V4-Pros 80,6 % der beste Open-Weight-Score — gleichauf mit Gemini 3.1 Pro. Claude Fable 5 führt insgesamt mit 96 % Verified und 80,3 % auf dem härteren SWE-bench Pro.
Das sind 116× günstiger bei einer Performance-Lücke von 24 % — in Produktion schwer zu ignorieren.
| V4-Pro | GPT-5.6 Sol | Claude Fable 5 | |
|---|---|---|---|
| Open Weights / Self-Hosting | Ja (MIT) | Nein | Nein |
| 1M Kontext | Ja | Nicht bestätigt | Ja |
| Bestes Coding gesamt | Zweite Liga | Zweite Liga | Führt SWE-bench Pro |
| Beste Algorithmen/Mathe | Führt LiveCodeBench | Stark | — |
| Output-Kosten (Off-Peak) | $0,87/M | ~$15/M | ~$50/M |
| Output-Kosten (Peak) | $1,74/M | — | — |
| Datensouveränität | Self-Host möglich | Nein | Nein |
V4-Pro wählen, wenn: Self-Hosting, hohes API-Volumen, Coding-Agenten oder Dokumentenanalyse im Budget im Fokus stehen. Fable 5 wählen, wenn: absolut beste Multi-File-Repo-Arbeit und Budget zweitrangig ist. GPT-5.6 wählen, wenn: Terminal-/Shell-Agent-Workflows (führt Terminal-Bench 2.1) oder tiefe Microsoft-365-/Azure-Integration zählen.
| Modell | Posten | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache Hit) | $0,0035/1M | 2× |
| Input (Cache Miss) | $0,435/1M | $0,87/1M | |
| Output | $0,87/1M | $1,74/1M | |
| V4-Flash | Input (Cache Hit) | $0,0028/1M | 2× |
| Input (Cache Miss) | $0,14/1M | $0,28/1M | |
| Output | $0,28/1M | $0,56/1M |
Peak-Zeiten (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00.
Batch-Jobs Off-Peak planen (nach 18:00 oder vor 09:00 Peking-Zeit)
Cache Hits maximieren — statische System-Prompts zuerst im Message-Stack
Einfache Queries an V4-Flash routen; nur komplexes Reasoning an Pro eskalieren
Account-E-Mail auf 24-Stunden-Preisänderungsmitteilungen überwachen
Cron/Queues nutzen, um nicht-echtzeitliche Arbeit in Off-Peak-Fenster zu legen
Selbst in der Peak-Zeit ist V4-Pro-Output bei $1,74/M 8,6× günstiger als Claude Opus 4.8 ($15/M).
Deadline: 24. Juli 2026, 15:59 UTC. Legacy-Namen deepseek-chat und deepseek-reasoner werden dauerhaft deaktiviert.
| Alter Name | Neues Äquivalent | Hinweise |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-Thinking) | Drop-in für die meisten Chats |
deepseek-reasoner | deepseek-v4-flash (Thinking) oder deepseek-v4-pro | Stärkeres Reasoning auf Pro |
# Alt (endet 24. Juli)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])
# Neu
response = client.chat.completions.create(
model="deepseek-v4-pro", # oder deepseek-v4-flash
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)V4 unterstützt OpenAI-kompatible und Anthropic-Messages-APIs — gleiche base_url, nur model anpassen.
Kurz: Ja — besonders wenn Kosten, Offenheit oder Datenkontrolle zählen. Sie bekommen das stärkste Open-Weight-Coding-Modell auf SWE-bench Verified (80,6 %), 1M Kontext mit tragbaren Kosten, Preise die selbst in der Peak-Zeit jeden Closed-Source-Konkurrenten schlagen, und Multi-Mode-Reasoning für Speed vs. Tiefe.
Peak-Pricing macht 24/7-Pipelines etwas komplexer, aber Off-Peak-Tarife bleiben aggressiv günstig — die Gegenmaßnahmen sind straightforward.
Performance bei Agenten, Mathe und Code verbessert; Peak-/Off-Peak-Preise eingeführt. Gleiche MoE-Architektur wie im April, jetzt produktionsreif.
Peking-Zeit werktags 09:00–12:00 und 14:00–18:00. Tarife verdoppeln sich.
Ja — dauerhaft abgeschaltet am 24. Juli 2026. Migrieren Sie auf deepseek-v4-flash oder deepseek-v4-pro.
DeepSeek V4 GA setzt einen neuen Maßstab für Open-Weight-Value — aber Production bedeutet API-Migration, Peak-Hour-Scheduling und Agent-Orchestrierung in einer echten Dev-Umgebung. Wer unter Windows oder Linux arbeitet und eine native macOS-GUI-Session braucht, um OpenClaw-Multi-Model-Routing zu validieren, gegen SWE-bench zu benchmarken oder Config-Änderungen vor dem 24. Juli zu testen: Mac kaufen ist teuer, SSH allein reicht für Systemberechtigungsdialoge nicht. VNCMac Remote Mac liefert stundenweisen VNC-Zugang auf einem isolierten Knoten — V4-APIs anbinden, Long-Context-Agent-Tasks fahren, Migrationen verifizieren, dann stoppen. Siehe Mac-Mietpläne.