Open-Source-LLM 20. Juli 2026 ca. 22 Min. DeepSeek V4 Peak-Preise

DeepSeek V4 Full Release
Preise, Benchmarks & Vergleich mit GPT-5.6

GA live seit 20. Juli 2026 · Peak-Valley-Preise · 1M Kontext · 80,6 % SWE-bench · API-Migration bis 24. Juli

DeepSeek V4 General Availability Open-Weight KI-Modell

Kurzfassung: Nach drei Monaten Preview-Zugang ist die DeepSeek-V4-Familie am 20. Juli 2026 offiziell GA. Das Full Release bringt spürbare Upgrades bei agentischen Tasks, Mathe und Coding — plus etwas, das die Community von DeepSeek noch nicht kannte: zeitbasierte Peak-Preise. Dieser Leitfaden deckt die Timeline, CSA/HCA-Architektur, Benchmark-Tabellen, ehrliche Vergleiche mit GPT-5.6 und Claude Fable 5, Peak-Valley-Pricing und die API-Migrationsfrist bis 24. Juli ab.

01

Neu in der GA-Version gegenüber der Preview

DatumMeilenstein
24. April 2026V4-Preview + MIT Open Weights (V4-Pro 1,6T, V4-Flash 284B)
Mai 2026Produktionsgetunte Flash & Pro; API allgemein verfügbar
Juni 2026V4-Pro-Output dauerhaft um 75 % auf $0,87/M Tokens gesenkt
29. Juni 2026E-Mail an alle API-Nutzer: GA Mitte Juli + erste Peak-Valley-Preisinfo
19. Juli 2026Gray-Release für ausgewählte Entwickler; Presse: „Full Release morgen“
20. Juli 2026GA-Release geht live
24. Juli 2026deepseek-chat und deepseek-reasoner endgültig abgeschaltet

Schmerzpunkte vor dem Wechsel

  1. 01

    Legacy-Endpunkte laufen aus: deepseek-chat endet am 24. Juli — Produktionscode mit alten Namen bricht ab

  2. 02

    Peak-Pricing-Komplexität: Geschäftszeiten verdoppeln die Tarife; ungeplante Batch-Jobs werden schnell teuer

  3. 03

    Closed-Source-Kostendeckel: GPT-5.6 Sol und Claude Fable 5 liegen bei $15–50/M Output — schwer skalierbar

  4. 04

    1M-Kontext-Ökonomie: Die meisten Modelle können Millionen-Token-Fenster ohne prohibitive KV-Cache-Kosten nicht bedienen

02

Architektur: Wie DeepSeek 1M Tokens praktikabel macht

SpecV4-ProV4-Flash
Parameter gesamt1,6 Billionen284 Milliarden
Aktiv pro Token49B (3 %)13B (4,6 %)
Layer6143
Kontextfenster1.000.000 Tokens1.000.000 Tokens
Max. Output384K384K
PräzisionFP4 (MoE-Experten) + FP8Gleich
Trainingsdaten33T+ Tokens32T+ Tokens
LizenzMITMIT

Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA)

V4 ersetzt MLA aus V2/V3 durch einen Zwei-Spur-Hybrid:

  • CSA: 4× KV-Kompression via Softmax-gated Pooling; FP4-„Lightning Indexer“ wählt Top-k-Blöcke (Pro: 1024, Flash: 512); 128-Token-Sliding-Window für aktuellen Kontext
  • HCA: 128× Kompression, dann dichte globale Attention für Long-Range-Muster, die CSA verpassen könnte

Bei 1M Tokens: 27 % der V3.2-Inferenz-FLOPs; KV-Cache sinkt auf 10 % des V3.2-Speichers (Flash: 7 %).

mHC und Muon

Manifold-Constrained Hyper-Connections (mHC) nutzen einen 4-Kanal-Residual-Stream, gesteuert durch eine doppelt stochastische Matrix — stabile Gradienten über 61 Layer. Der Muon-Optimizer (nicht AdamW) wendet Newton-Schulz-Orthogonalisierung für schnelleres, stabileres Training an.

Drei Reasoning-Modi

ModusBeschreibungEinsatz
Non-thinkSchnell, ohne Chain of ThoughtRouting, Klassifikation, einfache Q&A
Think HighExplizite Reasoning-BlöckeDebugging, mittlere Komplexität
Think MaxMaximaler Aufwand (384K+ Kontext)Komplexe Mathe, Multi-Step-Agenten

Empfohlenes Sampling: temperature=1.0, top_p=1.0 in allen Modi.

03

Benchmark-Zahlen: Wo V4 gewinnt — und wo nicht

BenchmarkV4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % Open-Weight-Rekord96,0 %N/A~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Bei echten GitHub-Bugfixes (SWE-bench Verified) ist V4-Pros 80,6 % der beste Open-Weight-Score — gleichauf mit Gemini 3.1 Pro. Claude Fable 5 führt insgesamt mit 96 % Verified und 80,3 % auf dem härteren SWE-bench Pro.

Kosten-Leistung (Artificial Analysis)

  • Claude Fable 5: 50 Punkte, $3,48 pro Task
  • DeepSeek V4-Pro: 38 Punkte, $0,03 pro Task

Das sind 116× günstiger bei einer Performance-Lücke von 24 % — in Produktion schwer zu ignorieren.

04

DeepSeek V4 vs. GPT-5.6 vs. Claude Fable 5

V4-ProGPT-5.6 SolClaude Fable 5
Open Weights / Self-HostingJa (MIT)NeinNein
1M KontextJaNicht bestätigtJa
Bestes Coding gesamtZweite LigaZweite LigaFührt SWE-bench Pro
Beste Algorithmen/MatheFührt LiveCodeBenchStark
Output-Kosten (Off-Peak)$0,87/M~$15/M~$50/M
Output-Kosten (Peak)$1,74/M
DatensouveränitätSelf-Host möglichNeinNein

V4-Pro wählen, wenn: Self-Hosting, hohes API-Volumen, Coding-Agenten oder Dokumentenanalyse im Budget im Fokus stehen. Fable 5 wählen, wenn: absolut beste Multi-File-Repo-Arbeit und Budget zweitrangig ist. GPT-5.6 wählen, wenn: Terminal-/Shell-Agent-Workflows (führt Terminal-Bench 2.1) oder tiefe Microsoft-365-/Azure-Integration zählen.

05

Peak-Valley-Preise erklärt

ModellPostenOff-PeakPeak
V4-ProInput (Cache Hit)$0,0035/1M
Input (Cache Miss)$0,435/1M$0,87/1M
Output$0,87/1M$1,74/1M
V4-FlashInput (Cache Hit)$0,0028/1M
Input (Cache Miss)$0,14/1M$0,28/1M
Output$0,28/1M$0,56/1M

Peak-Zeiten (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00.

Fünf Schritte zur niedrigeren Rechnung

  1. 01

    Batch-Jobs Off-Peak planen (nach 18:00 oder vor 09:00 Peking-Zeit)

  2. 02

    Cache Hits maximieren — statische System-Prompts zuerst im Message-Stack

  3. 03

    Einfache Queries an V4-Flash routen; nur komplexes Reasoning an Pro eskalieren

  4. 04

    Account-E-Mail auf 24-Stunden-Preisänderungsmitteilungen überwachen

  5. 05

    Cron/Queues nutzen, um nicht-echtzeitliche Arbeit in Off-Peak-Fenster zu legen

Selbst in der Peak-Zeit ist V4-Pro-Output bei $1,74/M 8,6× günstiger als Claude Opus 4.8 ($15/M).

06

Migrationsleitfaden: Frist 24. Juli

Deadline: 24. Juli 2026, 15:59 UTC. Legacy-Namen deepseek-chat und deepseek-reasoner werden dauerhaft deaktiviert.

Alter NameNeues ÄquivalentHinweise
deepseek-chatdeepseek-v4-flash (Non-Thinking)Drop-in für die meisten Chats
deepseek-reasonerdeepseek-v4-flash (Thinking) oder deepseek-v4-proStärkeres Reasoning auf Pro
Python · OpenAI SDK
# Alt (endet 24. Juli)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])

# Neu
response = client.chat.completions.create(
    model="deepseek-v4-pro",  # oder deepseek-v4-flash
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 unterstützt OpenAI-kompatible und Anthropic-Messages-APIs — gleiche base_url, nur model anpassen.

07

Fazit: Lohnt sich DeepSeek V4 2026?

Kurz: Ja — besonders wenn Kosten, Offenheit oder Datenkontrolle zählen. Sie bekommen das stärkste Open-Weight-Coding-Modell auf SWE-bench Verified (80,6 %), 1M Kontext mit tragbaren Kosten, Preise die selbst in der Peak-Zeit jeden Closed-Source-Konkurrenten schlagen, und Multi-Mode-Reasoning für Speed vs. Tiefe.

Peak-Pricing macht 24/7-Pipelines etwas komplexer, aber Off-Peak-Tarife bleiben aggressiv günstig — die Gegenmaßnahmen sind straightforward.

Kernzahlen zum Zitieren

  • SWE-bench Verified: 80,6 % (Open-Weight-Rekord)
  • 1M-Kontext-KV-Speicher: 10 % von V3.2
  • V4-Pro Off-Peak-Output: $0,87/M; Peak $1,74/M
  • API-Migrationsfrist: 24. Juli 2026, 15:59 UTC
08

FAQ

Performance bei Agenten, Mathe und Code verbessert; Peak-/Off-Peak-Preise eingeführt. Gleiche MoE-Architektur wie im April, jetzt produktionsreif.

Peking-Zeit werktags 09:00–12:00 und 14:00–18:00. Tarife verdoppeln sich.

Ja — dauerhaft abgeschaltet am 24. Juli 2026. Migrieren Sie auf deepseek-v4-flash oder deepseek-v4-pro.

Abschlussgedanke

DeepSeek V4 GA setzt einen neuen Maßstab für Open-Weight-Value — aber Production bedeutet API-Migration, Peak-Hour-Scheduling und Agent-Orchestrierung in einer echten Dev-Umgebung. Wer unter Windows oder Linux arbeitet und eine native macOS-GUI-Session braucht, um OpenClaw-Multi-Model-Routing zu validieren, gegen SWE-bench zu benchmarken oder Config-Änderungen vor dem 24. Juli zu testen: Mac kaufen ist teuer, SSH allein reicht für Systemberechtigungsdialoge nicht. VNCMac Remote Mac liefert stundenweisen VNC-Zugang auf einem isolierten Knoten — V4-APIs anbinden, Long-Context-Agent-Tasks fahren, Migrationen verifizieren, dann stoppen. Siehe Mac-Mietpläne.