31. Juli 2026 · V4-Flash-0731 offiziell · Nur Post-Training · Harness angekündigt · Pro ohne Datum
Kurzfassung: Am 31. Juli stufte DeepSeek deepseek-v4-flash zum offiziellen Public-API-Build (Tag 0731) hoch — mit der gleichen 284B-Architektur wie im April-Preview, Gewinne ausschließlich durch einen neuen Post-Training-Durchlauf. Agent-Scores rivalisieren mit Claude Opus 4.8 bei etwa 1/36 bis 1/179 des Preises (Herstellerlistenpreise). Flaggschiff V4-Pro und das hauseigene Agent-Framework Harness bleiben unveröffentlicht. Dieser Artikel behandelt Timeline, Preistabellen, Architektur, chinesische Open-Weight-Konkurrenz, Benchmark-Vorbehalte, die „Kill-Line“-Preisnarrative und eine Fünf-Schritte-Checkliste für Entwickler.
Legacy-API-Namen sind tot: deepseek-chat und deepseek-reasoner wurden am 24. Juli abgeschaltet — nicht migrierte Produktion bricht sofort ab
„Offiziell“ ≠ neue Architektur: 0731 ist ein neu trainiertes Flash, kein größeres Modell — falsche Erwartungen verzerren Routing-Entscheidungen
Agent-Scores sind Harness-abhängig: Terminal Bench 2.0-Werte nutzten DeepSeeks unveröffentlichten Minimal-Mode-Harness — nicht blind auf Claude Code oder Cursor portieren
Pro und Harness fehlen noch: Nur Flash ist offiziell, API-only; App und Web-Chat unberührt; GA-Gerüchte 10.–20. August unbestätigt
| Datum | Ereignis |
|---|---|
| 24. Apr. 2026 | V4-Preview + MIT Open Weights: V4-Pro (1,6T/49B aktiv), V4-Flash (284B/13B aktiv), 1M Kontext |
| 24. Jul. 2026 | Legacy-Aliase abgeschaltet; gesamter Traffic auf V4-Familiennamen |
| 27. Jul. 2026 | Moonshot AI liefert Kimi K3 Open Weights (2,8T gesamt) — direkter Wettbewerbsdruck |
| 31. Jul. 2026 | V4-Flash-0731 offizielle API-Beta; Weights auf Hugging Face; Changelog nennt Harness „coming soon“; nur API |
| Stand 5. Aug. 2026 | Offizielles V4-Pro weiterhin „so schnell wie möglich“; Medienfenster 10.–20. August nicht von DeepSeek bestätigt |
| Modell | Status | Gesamt / aktiv | Kontext | Input $/M (miss / hit) | Output $/M | Lizenz |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Offiziell | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Nur Preview | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Open Weights 27. Jul. | 2,8T / ~104B gesch. | ~1,05M | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 | Open Jun 2026 | ~744B / ~40B | 1M | Hier nicht verifiziert | MIT | |
| Qwen3.8-Max | API-GA 2. Aug. | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Weights ausstehend |
DeepSeek kündigte einen künftigen 2×-Peak-Hour-Zuschlag an (Peking 9–12, 14–18 Uhr), ohne Wirksamkeitsdatum. Zahlen Stand 5. August 2026.
V4-Flash-0731 ist identisch in Größe und Struktur zum April-Preview. DeepSeek führt Agent-Benchmark-Sprünge ausschließlich auf neu durchlaufenes Post-Training zurück — ein 284B/13B-Modell schlägt jetzt das 1,6T/49B-Preview der Familie bei mehreren agentischen Tasks, was zeigt: Die Konkurrenz Ende 2026 hängt ebenso von Trainingsdaten und Methoden ab wie von roher Parameterzahl.
Der Technical Report beschreibt CSA + HCA Hybrid-Attention („DSA“), manifold-constrained hyper-connections (mHC) und den Muon-Optimizer. Herstellerangaben bei 1M Tokens: V4-Pro braucht 27 % der V3.2-FLOPs pro Token und 10 % des KV-Cache — unabhängige Reproduktion ausstehend.
Am 31. Juli wurde DeepSeek Harness erstmals offiziell erwähnt — Datei-I/O, Tool-Calls, Engineering-Workflows — DeepSeeks Antwort auf Claude Code. Jeder veröffentlichte Agent-Score (Terminal Bench 2.0, Toolathlon usw.) nutzte Harness Minimal Mode (noch nicht öffentlich). Das Changelog warnt: Scores sind „extrem sensitiv gegenüber Harness-Wahl“.
| Modell | Lab | Gesamtparameter | AA Intelligence Index | Kosten/Task (AA) |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu | ~744B | ~1 Pkt. über Flash | Nicht verifiziert |
| GPT-5.6 Sol | OpenAI | Nicht offengelegt | 9+ Pkt. darüber | $1,86 |
| Claude Fable 5 | Anthropic | Nicht offengelegt | 9+ Pkt. darüber | $3,15 |
Im unabhängigen Index von Artificial Analysis ist Flash nicht das klügste Modell — aber die Kosten pro Task liegen bei ~1/29 von Kimi K3 und ~1/105 von Claude Fable 5. DeepSeek optimiert für „gut genug bei unschlagbarem Preis“, was auch sieben Wochen OpenRouter-Spitzenplatz des Previews erklärt.
| Szenario | Tendenz | Warum |
|---|---|---|
| High-Volume-Agents / API-Batches | V4-Flash-0731 | Niedrigste Kosten; 0731-Agent-Scores schlagen Pro-Preview |
| Max. unabhängiger Index | Kimi K3 oder geschlossenes Flaggschiff | Höherer AA-Score, deutlich höhere Stückkosten |
| Self-Host + 1M Kontext | V4-Flash MIT Weights | Open License auf Hugging Face |
| Warten auf Harness | Auf offizielles Pro warten | Framework unveröffentlicht; Dritt-Agenten weiter nötig |
Harness-Lock-in: Terminal Bench 2.0 bei 82,7 (vs. Pro-Preview 67,9) nutzte unveröffentlichten Harness-Minimal-Mode — als Hersteller + Framework behandeln, nicht als portable Wahrheit
Nutzungsberichte: Entwickler im Ausland berichten niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts
Pro/Harness-Daten: GA-Gerüchte 10.–20. August stammen aus anonymen Medienquellen — keine DeepSeek-Bestätigung
Finanzierungsgerüchte: Berichte über ~7,4 Mrd. $ Runde / ~48,7 Mrd. $ Bewertung ohne regulatorische Filings — nur Hintergrund
Chinesische Foren nannten Gründer Liang Wenfeng „Liang Leeres Versprechen“, als Pro Mitte Juli ausblieb; nach 0731 kehrte „Liang der Weise“ zurück — ein schnelles Stimmungsbarometer.
Entwickler sprechen auch von 斩杀线 (zhǎn shā xiàn) — „Kill Line“: ausreichende Fähigkeit plus Tiefstpreis setzt eine Schwelle, die Wettbewerber auf beiden Achsen schlagen müssen. OpenAIs gemeldete 80%-Luna-Preissenkung passt in dieses Bild. Am 31. Juli bewegten sich Nvidia, Broadcom und AMD kaum — Märkte behandeln „DeepSeek-Effizienz“ inzwischen als Routine-Engineering, nicht wie den R1-Chip-Verkauf 2025.
Produktion auf deepseek-v4-flash ausrichten; Legacy-Aliase abschaffen
Hersteller-Agent-Scores vom AA-unabhängigen Index beim Routing trennen
Bulk-Jobs außerhalb angekündigter 2×-Peak-Fenster planen (Datum TBD)
Agents in OpenClaw / Claude Code validieren — nicht nur auf TB2.0 vertrauen
Changelog auf Harness und Pro beobachten — API und Weights können erneut divergieren
Ja — V4-Pro und V4-Flash, einschließlich 0731, sind MIT Open Weights auf Hugging Face.
Listenpreise rund 36×–179× günstiger bei Input und ~89× bei Output vs. Opus 4.8 pro Million Tokens (Herstellerpreise, nicht geprüft).
Kein bestätigtes Datum — Changelog sagt „so schnell wie möglich“. August-Gerüchte unbestätigt.
SWE-bench Verified ist stärkeres Signal. Agent-Scores brauchen Dritt-Harness-Reproduktion.
DeepSeeks hauseigenes Agent-Framework (Dateien, Tools, Engineering-Tasks) — am 31. Juli benannt, noch nicht öffentlich.
V4-Flash-0731 beweist, dass Post-Training und Preisgestaltung mehr zählen können als ein weiterer Parameter-Sprung — doch die Validierung von OpenClaw-Multi-Model-Routing, der Vergleich Harness vs. Claude Code oder die Batch-Migration von APIs profitiert von einer echten macOS-GUI-Session. Wer Windows oder Linux nutzt und keinen Mac kaufen will, um Agent-Berechtigungsdialoge zu klicken, kommt mit SSH allein nicht weit. Mieten Sie einen VNCMac Remote Mac stundenweise, verdrahten Sie DeepSeek V4 per VNC, fahren Sie Agent-Workloads isoliert und stoppen Sie nach dem Projekt. Siehe Mac-Mietpläne sowie unsere Artikel zu V4 GA und Kimi K3 Open Weights.
Quellen: DeepSeek API-Docs/Changelog, Technical Report, Artificial Analysis (via Finanzmedien), 21st Century Business Herald. Preise und Release-Status vor Veröffentlichung prüfen — Stand 5. August 2026.