Open-Weight-LLM 5. August 2026 ~20 Min. Lesezeit DeepSeek V4 Harness

Ist DeepSeeks neues Modell wirklich 100× günstiger als Claude?
V4-Flash-Benchmarks im Detail

31. Juli 2026 · V4-Flash-0731 offiziell · Nur Post-Training · Harness angekündigt · Pro ohne Datum

DeepSeek V4 Flash 0731 offizielles Open-Weight-Modell Benchmarks Konzept

Kurzfassung: Am 31. Juli stufte DeepSeek deepseek-v4-flash zum offiziellen Public-API-Build (Tag 0731) hoch — mit der gleichen 284B-Architektur wie im April-Preview, Gewinne ausschließlich durch einen neuen Post-Training-Durchlauf. Agent-Scores rivalisieren mit Claude Opus 4.8 bei etwa 1/36 bis 1/179 des Preises (Herstellerlistenpreise). Flaggschiff V4-Pro und das hauseigene Agent-Framework Harness bleiben unveröffentlicht. Dieser Artikel behandelt Timeline, Preistabellen, Architektur, chinesische Open-Weight-Konkurrenz, Benchmark-Vorbehalte, die „Kill-Line“-Preisnarrative und eine Fünf-Schritte-Checkliste für Entwickler.

01

Vier Stolpersteine vor dem Wechsel

  1. 01

    Legacy-API-Namen sind tot: deepseek-chat und deepseek-reasoner wurden am 24. Juli abgeschaltet — nicht migrierte Produktion bricht sofort ab

  2. 02

    „Offiziell“ ≠ neue Architektur: 0731 ist ein neu trainiertes Flash, kein größeres Modell — falsche Erwartungen verzerren Routing-Entscheidungen

  3. 03

    Agent-Scores sind Harness-abhängig: Terminal Bench 2.0-Werte nutzten DeepSeeks unveröffentlichten Minimal-Mode-Harness — nicht blind auf Claude Code oder Cursor portieren

  4. 04

    Pro und Harness fehlen noch: Nur Flash ist offiziell, API-only; App und Web-Chat unberührt; GA-Gerüchte 10.–20. August unbestätigt

02

Timeline: April-Preview bis Juli „offiziell“

DatumEreignis
24. Apr. 2026V4-Preview + MIT Open Weights: V4-Pro (1,6T/49B aktiv), V4-Flash (284B/13B aktiv), 1M Kontext
24. Jul. 2026Legacy-Aliase abgeschaltet; gesamter Traffic auf V4-Familiennamen
27. Jul. 2026Moonshot AI liefert Kimi K3 Open Weights (2,8T gesamt) — direkter Wettbewerbsdruck
31. Jul. 2026V4-Flash-0731 offizielle API-Beta; Weights auf Hugging Face; Changelog nennt Harness „coming soon“; nur API
Stand 5. Aug. 2026Offizielles V4-Pro weiterhin „so schnell wie möglich“; Medienfenster 10.–20. August nicht von DeepSeek bestätigt
03

Kernzahlen (herstellerseitige Preise)

ModellStatusGesamt / aktivKontextInput $/M (miss / hit)Output $/MLizenz
V4-Flash-0731Offiziell284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProNur Preview1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open Weights 27. Jul.2,8T / ~104B gesch.~1,05M$3,00 / $0,30$15,00Modified MIT
GLM-5.2Open Jun 2026~744B / ~40B1MHier nicht verifiziertMIT
Qwen3.8-MaxAPI-GA 2. Aug.2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Weights ausstehend

DeepSeek kündigte einen künftigen 2×-Peak-Hour-Zuschlag an (Peking 9–12, 14–18 Uhr), ohne Wirksamkeitsdatum. Zahlen Stand 5. August 2026.

04

Wie die Performance ohne Skalierung stieg

Gleiche Architektur, neues Post-Training

V4-Flash-0731 ist identisch in Größe und Struktur zum April-Preview. DeepSeek führt Agent-Benchmark-Sprünge ausschließlich auf neu durchlaufenes Post-Training zurück — ein 284B/13B-Modell schlägt jetzt das 1,6T/49B-Preview der Familie bei mehreren agentischen Tasks, was zeigt: Die Konkurrenz Ende 2026 hängt ebenso von Trainingsdaten und Methoden ab wie von roher Parameterzahl.

Hybrid-Attention, mHC, Muon

Der Technical Report beschreibt CSA + HCA Hybrid-Attention („DSA“), manifold-constrained hyper-connections (mHC) und den Muon-Optimizer. Herstellerangaben bei 1M Tokens: V4-Pro braucht 27 % der V3.2-FLOPs pro Token und 10 % des KV-Cache — unabhängige Reproduktion ausstehend.

Harness: erstes hauseigenes Agent-Framework

Am 31. Juli wurde DeepSeek Harness erstmals offiziell erwähnt — Datei-I/O, Tool-Calls, Engineering-Workflows — DeepSeeks Antwort auf Claude Code. Jeder veröffentlichte Agent-Score (Terminal Bench 2.0, Toolathlon usw.) nutzte Harness Minimal Mode (noch nicht öffentlich). Das Changelog warnt: Scores sind „extrem sensitiv gegenüber Harness-Wahl“.

05

Direktvergleich: Chinas Open-Weight-Gedränge

ModellLabGesamtparameterAA Intelligence IndexKosten/Task (AA)
V4-Flash-0731DeepSeek284B50$0,03
Kimi K3Moonshot2,8T57$0,86
GLM-5.2Zhipu~744B~1 Pkt. über FlashNicht verifiziert
GPT-5.6 SolOpenAINicht offengelegt9+ Pkt. darüber$1,86
Claude Fable 5AnthropicNicht offengelegt9+ Pkt. darüber$3,15

Im unabhängigen Index von Artificial Analysis ist Flash nicht das klügste Modell — aber die Kosten pro Task liegen bei ~1/29 von Kimi K3 und ~1/105 von Claude Fable 5. DeepSeek optimiert für „gut genug bei unschlagbarem Preis“, was auch sieben Wochen OpenRouter-Spitzenplatz des Previews erklärt.

Entscheidungsmatrix

SzenarioTendenzWarum
High-Volume-Agents / API-BatchesV4-Flash-0731Niedrigste Kosten; 0731-Agent-Scores schlagen Pro-Preview
Max. unabhängiger IndexKimi K3 oder geschlossenes FlaggschiffHöherer AA-Score, deutlich höhere Stückkosten
Self-Host + 1M KontextV4-Flash MIT WeightsOpen License auf Hugging Face
Warten auf HarnessAuf offizielles Pro wartenFramework unveröffentlicht; Dritt-Agenten weiter nötig
06

Vorbehalte: Schlagzeilen nicht blind glauben

  1. 01

    Harness-Lock-in: Terminal Bench 2.0 bei 82,7 (vs. Pro-Preview 67,9) nutzte unveröffentlichten Harness-Minimal-Mode — als Hersteller + Framework behandeln, nicht als portable Wahrheit

  2. 02

    Nutzungsberichte: Entwickler im Ausland berichten niedrige Input-Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts

  3. 03

    Pro/Harness-Daten: GA-Gerüchte 10.–20. August stammen aus anonymen Medienquellen — keine DeepSeek-Bestätigung

  4. 04

    Finanzierungsgerüchte: Berichte über ~7,4 Mrd. $ Runde / ~48,7 Mrd. $ Bewertung ohne regulatorische Filings — nur Hintergrund

07

„Kill-Line“-Preise und das Schulterzucken der Chip-Aktien

Chinesische Foren nannten Gründer Liang Wenfeng „Liang Leeres Versprechen“, als Pro Mitte Juli ausblieb; nach 0731 kehrte „Liang der Weise“ zurück — ein schnelles Stimmungsbarometer.

Entwickler sprechen auch von 斩杀线 (zhǎn shā xiàn) — „Kill Line“: ausreichende Fähigkeit plus Tiefstpreis setzt eine Schwelle, die Wettbewerber auf beiden Achsen schlagen müssen. OpenAIs gemeldete 80%-Luna-Preissenkung passt in dieses Bild. Am 31. Juli bewegten sich Nvidia, Broadcom und AMD kaum — Märkte behandeln „DeepSeek-Effizienz“ inzwischen als Routine-Engineering, nicht wie den R1-Chip-Verkauf 2025.

Fünf-Schritte-Checkliste für Entwickler

  1. 01

    Produktion auf deepseek-v4-flash ausrichten; Legacy-Aliase abschaffen

  2. 02

    Hersteller-Agent-Scores vom AA-unabhängigen Index beim Routing trennen

  3. 03

    Bulk-Jobs außerhalb angekündigter 2×-Peak-Fenster planen (Datum TBD)

  4. 04

    Agents in OpenClaw / Claude Code validieren — nicht nur auf TB2.0 vertrauen

  5. 05

    Changelog auf Harness und Pro beobachten — API und Weights können erneut divergieren

Zitierfähige Zahlen

  • Flash 0731: 284B / 13B aktiv; Input ab $0,0028/M Cache-Hit
  • vs. Opus 4.8: ~1/36 Cache-Miss-Input, ~1/179 Cache-Hit, ~1/89 Output (Herstellerliste, 21st Century Business Herald)
  • Terminal Bench 2.0: 82,7 (Harness Minimal Mode, herstellerseitig)
08

FAQ

Ja — V4-Pro und V4-Flash, einschließlich 0731, sind MIT Open Weights auf Hugging Face.

Listenpreise rund 36×–179× günstiger bei Input und ~89× bei Output vs. Opus 4.8 pro Million Tokens (Herstellerpreise, nicht geprüft).

Kein bestätigtes Datum — Changelog sagt „so schnell wie möglich“. August-Gerüchte unbestätigt.

SWE-bench Verified ist stärkeres Signal. Agent-Scores brauchen Dritt-Harness-Reproduktion.

DeepSeeks hauseigenes Agent-Framework (Dateien, Tools, Engineering-Tasks) — am 31. Juli benannt, noch nicht öffentlich.

Abschluss

V4-Flash-0731 beweist, dass Post-Training und Preisgestaltung mehr zählen können als ein weiterer Parameter-Sprung — doch die Validierung von OpenClaw-Multi-Model-Routing, der Vergleich Harness vs. Claude Code oder die Batch-Migration von APIs profitiert von einer echten macOS-GUI-Session. Wer Windows oder Linux nutzt und keinen Mac kaufen will, um Agent-Berechtigungsdialoge zu klicken, kommt mit SSH allein nicht weit. Mieten Sie einen VNCMac Remote Mac stundenweise, verdrahten Sie DeepSeek V4 per VNC, fahren Sie Agent-Workloads isoliert und stoppen Sie nach dem Projekt. Siehe Mac-Mietpläne sowie unsere Artikel zu V4 GA und Kimi K3 Open Weights.

Quellen: DeepSeek API-Docs/Changelog, Technical Report, Artificial Analysis (via Finanzmedien), 21st Century Business Herald. Preise und Release-Status vor Veröffentlichung prüfen — Stand 5. August 2026.