KI-Preise 17. August 2026 ca. 18 Min. DeepSeek Qwen3.8

Warum DeepSeek die API um bis zu 1.100 % verteuert
direkt nach Chinas Open-Weight-Offensive

12.–17. August 2026 · Peak-Aufschlag über 1.100 % · 2,4 Bio. offene Gewichte · gleiches Basis-Post-Training

Rechenzentrumsregale mit blauen Statusleuchten als Sinnbild für Inferenzkapazität und API-Preisdruck

Einstieg: In fünf Tagen haben drei führende chinesische Labore Züge gemacht, die sich widersprechen und zugleich ergänzen. DeepSeek hat bestimmte API-Stufen um bis zu 1.100 % angehoben. Alibaba hat in derselben Woche ein 2,4-Billionen-Parameter-Flaggschiff geöffnet, das zuvor nie als Gewicht vorlag. Zhipu hat GLM-5.3 ausgeliefert und Coding-Benchmarks mit demselben Basismodell um rund das Sechsfache verbessert – ohne erneutes Vortraining. Zusammen verschiebt sich der Wettbewerb von reinem Preis auf Preishoheit. Lesen Sie das gegen unsere V4-Flash-Bewertung, die Qwen3.8-Max-Notiz und die GPT-5.6-Preissenkung.

01

Vier Schmerzpunkte vor den Tabellen

  1. 01

    Die Schlagzeile ist nicht die Rechnung. 1.100 % gelten nur für Peak-Cache-Hit-Input. Output – die Zeile der meisten Rechnungen – stieg um 350 %.

  2. 02

    Offiziell ist nicht mehr automatisch am günstigsten. Zur Peak-Zeit liegt die eigene API über mehreren Resellern (GMI Cloud, Novita und andere listen V4 Pro unter dem neuen Peak).

  3. 03

    Offene Gewichte sind nicht Apache 2.0. Qwen3.8-Max hält mit einer eigenen Lizenz Hebel über große MaaS- und Assistenten-Geschäfte.

  4. 04

    „Chinesisches Modell = billigstes Modell“ bricht. Off-Peak-DeepSeek unterbietet noch Opus 5, Qwen international und Luna gewinnen aber mindestens eine Achse.

02

Zeitlinie: was wann passiert ist

DatumEreignis
16. Juli 2026Moonshot öffnet Kimi K3 (2,8 Bio. Parameter), bereits unter US-Sicherheitsbeobachtung
2.–3. August 2026Alibaba kündigt Qwen3.8-Max an und schaltet die gehostete API frei
10. August 2026Meta veröffentlicht Muse Glimmer (30 Mrd., Apache 2.0) und kündigt offene Gewichte für Muse Spark 1.2 an
12. August 2026Alibaba legt Qwen3.8-2.4T-A95B auf Hugging Face/ModelScope; xAI liefert Grok 4.6
13. August 2026DeepSeek-V4-Pro geht GA und kündigt die Erhöhung zum 17. August an; Google senkt Gemini 3.7 Flash
14. August 2026Zhipu liefert GLM-5.3, Basis wie GLM-5.2: 743 Mrd.
17. August 2026, 00:00 PekingNeue DeepSeek-Preise gelten

Weiter zurück: Am 30. Juli senkte OpenAI die günstigste Stufe GPT-5.6 Luna um 80 %, am 6.–7. August wurde Luna Standard für Gratisnutzer mit unbegrenztem Text. Während chinesische Labore Preise anhoben und Flaggschiff-Gewichte öffneten, senkten US-Labore und machten die Verbraucherschicht frei. Das ist dieselbe Preisauseinandersetzung von zwei Seiten.

03

Die Zahlen: was sich wirklich geändert hat

DeepSeek-Erhöhung, Zeile für Zeile (ab 17. August, 00:00 Peking; Peak 9–12 und 14–18 Uhr Peking)

Position (je 1 Mio. Tokens)AltNeu Off-PeakNeu PeakPeak-Anstieg
V4-Flash Cache-Hit (Input)¥0,02¥0,05¥0,10~400 %
V4-Flash Cache-Miss (Input)¥1,0¥1,5¥3,0200 %
V4-Flash Output¥2,0¥4,5¥9,0350 %
V4-Pro Cache-Hit (Input)¥0,025¥0,15¥0,30~1.100 %
V4-Pro Cache-Miss (Input)¥3,0¥4,5¥9,0200 %
V4-Pro Output¥6,0¥13,5¥27,0350 %

Die oft zitierten 1.100 % gelten nur für Peak-Cache-Hit-Input – die Stufe, die fast bei null startete. Output, der reale Rechnungen trägt, stieg um 350 %. Drittanbieter-Modellierungen sehen bei rund 84 Mio. Tokens/Monat, überwiegend Off-Peak, zur Hälfte Hits, etwa 1,8x statt der Schreckenszahl.

Qwen3.8-2.4T-A95B: Kernspezifikation

MerkmalDetail
Parameter2,4 Bio. gesamt, 95 Mrd. aktiv (MoE, 512 Experten, 10 geroutet + 1 geteilt)
Kontext262.144 Tokens nativ, erweiterbar auf ~1,01 Mio.; gehostetes Max standardmäßig 1 Mio.
KadenzVorschau 2. Aug. → API 3. Aug. → Gewichte 12. Aug.
Internationale API2 Dollar Input / 6 Dollar Output je Million
LizenzNicht Apache 2.0 – eigene Qwen3.8-Max License
BedeutungErstes Max-Flaggschiff von Alibaba als Gewicht; 3.5/3.6/3.7 Max blieben API-only

GLM-5.3 gegen 5.2: gleiche Basis, nur Post-Training

BenchmarkGLM-5.2GLM-5.3Änderung
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Das sind Zhipu-Eigenwerte, ohne unabhängigen Drittlauf. Auf Terminal-Bench 3.0 liegt GLM-5.3 hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %) – Spitze der offenen Gewichte, kein Frontier-Sieg.

04

Drei Strategien, drei Logiken

DeepSeek: von der Flattarife zur Tageszeit – ein Kapazitätsproblem

Der einfachste Fehlschluss lautet „Chinas billigstes Modell gibt der Marge nach“. Die Struktur liest sich eher als erste sichtbare Compute-Rechnung. Der alte, immer günstige Satz war Kundenakquise, solange GPU-Kapazität mitwuchs. Als die Nutzung exponentiell stieg und die Kapazität nicht, musste etwas explizit werden. „Flexiblere Lastplanung anregen“ heißt: Peak-Compute ist knapp, verschieben Sie selbst.

Zur Peak-Zeit liegt die offizielle API über mehreren Resellern. Die Annahme „offiziell ist immer der günstigste DeepSeek-Weg“ ist zum ersten Mal gebrochen.

Alibaba: Gewichte kaufen Wohlwollen, die Lizenz schützt die Decke

Die Öffnung ist kein schlichtes Geschenk. Alibaba hat den 2,4-Bio.-Checkpoint frei gelegt und zugleich eine eigene Lizenz angehängt: Model-as-a-Service oder AI-Work-Assistant mit über 50 Millionen Dollar in 12 Monaten braucht eine gesonderte Handelslizenz; Produkte mit über 100 Mio. MAU oder 20 Mio. Dollar Monatsumsatz müssen den Modellnamen sichtbar zeigen.

Gewichte gegen Entwickler-Mindshare (besonders international), Verhandlungshebel gegen die wenigen, die ein konkurrierendes Inferenzgeschäft bauen können. Das ist ein anderes Wette als Metas uneingeschränktes Apache-2.0-Glimmer. Gerüchte über Download-Sperren für USA, EU, UK und Südkorea sind falsch; der Text enthält keine Territorialklausel.

GLM-5.3: keine neue Basis, nur ein größeres Post-Training

Interessant ist die Methode: dieselbe 743-Mrd.-Basis wie 5.2, kein erneutes Vortraining, rund 6x auf Terminal-Bench 3.0 (4,6 % → 28,3 %) allein durch skalierte RL-Umgebungen. Wenn Vortraining-Skalierung nachlässt, wird Post-Training-RL ein eigener Hebel mit deutlich niedrigerer Kostenschwelle als ein neues Foundation-Modell.

05

Quercheck: Ist DeepSeek noch das günstigste Frontier-Modell?

ModellInput (je 1 Mio.)Output (je 1 Mio.)Offene Gewichte?
DeepSeek V4-Pro (Peak)¥9,0 (~1,26 $)¥27,0 (~3,78 $)Nein
DeepSeek V4-Pro (Off-Peak)¥4,5 (~0,63 $)¥13,5 (~1,89 $)Nein
Qwen3.8-Max (international)2,00 $6,00 $Ja (eigene Lizenz)
OpenAI GPT-5.6 Luna0,20 $1,20 $Nein
Claude Opus 5 (implizit, Alibaba-Verhältnis)~5,00 $~25,00 $Nein

Umrechnung ca. ¥7,15 je Dollar. Kurz: nein. Off-Peak-V4-Pro bleibt klar unter Opus 5, ist aber nicht mehr das billigste Angebot. Qwen international und Luna unterbieten den Off-Peak-Satz. Die Gleichung „chinesisch = billigst“ galt 2025 und Anfang 2026; sie ist keine sichere Annahme mehr.

06

Strittig oder unbestätigt

  • Die 1.100-%-Schlagzeile ist technisch korrekt, ohne Kontext irreführend. Sie gilt nur für Peak-Cache-Hit-Input. Output stieg um 350 %. Medien zitieren unterschiedliche Zeilen als ganze Geschichte.
  • Behauptungen, Qwen3.8-Max laufe auf Alibabas Zhenwu-M890-Chips, stammen aus chinesischen Finanzmedien und sind nicht durch Alibaba-Technikdokumente oder Drittbenchmarks bestätigt. Unverifiziert.
  • GLM-5.3 habe eine schwere Cursor-Lücke gefunden: VentureBeat und Zhipu, ohne öffentliche technische Details. Anbieterseitig, nicht auditiert.
  • Das chinesische Handelsministerium plane Gegensanktionen bei KI/Halbleitern: spekulativ, keine amtliche Bestätigung.
07

Warum das zählt: zwei Preiskriege parallel

Im größeren Rahmen zeigt sich ein Muster. Etwa einen Monat lang liefern Chinas Spitzenlabore in einem Tempo, das inländische Finanzmedien „drei Modellupdates pro Woche“ (一周三更) nennen – DeepSeek, Alibaba, Zhipu, dazu Kimi K3 (16. Juli, 2,8 Bio.) und MiniMax H3. Die chinesische Berichterstattung rahmt das als Zwang zur globalen Neubepreisung, schärfer als die meisten englischsprachigen Produktnotizen.

US-Labore spielen am Verbraucherende das Gegenteil: OpenAI senkte die günstigste Stufe am 30. Juli um 80 % und machte sie eine Woche später frei und unbegrenzt; Google lieferte am 13. August ein Coding-Modell zum halben Preis des drei Wochen alten Vorgängers. China öffnet Flaggschiffe und staffelt oben, die USA rennen unten zu frei und billig. Beides sind echte Strategien, nur unterschiedliche Trichterlagen.

Es gibt eine geopolitische Schicht. Kimi K3 zog bereits US-Sicherheitsblick auf sich; Alibabas Fenster für ein 2,4-Bio.-Flaggschiff wird von manchen Analysten als Festigung internationaler Parität vor möglicher Regulierungsenge gelesen. Das ist Interpretation, kein bestätigter Fakt – aber Kontext, den reine englische Produktnews oft auslassen.

Sechs Schritte für API-Einkäufer

  1. 01

    Schlagzeile der konkreten Zeile zuordnen: Cache-Hit-Input, Miss-Input oder Output.

  2. 02

    Batchbare Agent-Jobs, Evals und Regressionen aus Pekings 9–12 und 14–18 Uhr schieben.

  3. 03

    Systemprompts einfrieren und lange Präfixe wiederverwenden, damit Miss plus Output nicht doppelt schlagen.

  4. 04

    Qwen3.8-Max-Lizenz lesen: persönlich und intern meist frei; MaaS/Assistent über 50 Mio. Dollar in 12 Monaten braucht einen Deal.

  5. 05

    Coding-Agenten nicht nach Basisgröße wählen – GLM-5.3 zeigt einen Fast-6x-Sprung auf derselben Basis.

  6. 06

    Denselben OpenClaw-Workflow auf einem eigenen Remote-Mac gegen DeepSeek Off-Peak, Qwen international und GLM eine Woche fahren, dann den Default sperren.

Zitierbare Zahlen

  • V4-Pro Peak-Hit-Input: ¥0,025 → ¥0,30, etwa 1.100 %; Output: ¥6,0 → ¥27,0, 350 %
  • Peak: Peking 9–12 und 14–18 Uhr; Off-Peak ist die Hälfte
  • Schwere Last (~84 Mio. Tokens/Monat, meist Off-Peak, Hälfte Hits): Rechnung etwa 1,8x
  • Qwen3.8-Max: 2,4 Bio. / 95 Mrd. aktiv; internationale API 2 / 6 Dollar
  • Lizenz: MaaS/Assistent über 50 Mio. Dollar in 12 Monaten; 100 Mio. MAU oder 20 Mio. Dollar/Monat Umsatz müssen den Namen zeigen
  • GLM-5.3 Terminal-Bench 3.0: 4,6 % → 28,3 % auf derselben 743-Mrd.-Basis; hinter Sol 34,6 % und Fable 5 33,7 %
08

Häufige Fragen

Off-Peak bleibt unter Claude Opus 5, ist aber nicht mehr das billigste Angebot insgesamt. GPT-5.6 Luna (0,20/1,20 Dollar je Million Tokens) und Qwen3.8-Max international (2/6 Dollar) unterbieten DeepSeeks neue Off-Peak-Sätze in mindestens einer Dimension. DeepSeek bleibt für ein Frontier-Modell vergleichsweise günstig, nur nicht mehr das eindeutig Billigste.

Für die meisten Fälle ja: persönliche Projekte und interne Nutzung bleiben unberührt. Die Ausnahme gilt für Model-as-a-Service oder AI-Work-Assistant-Geschäfte mit über 50 Millionen Dollar Umsatz in 12 Monaten; dann braucht es eine gesonderte Alibaba-Lizenz.

Nein. Der veröffentlichte Lizenztext enthält keine geografische Klausel. Die Schranken hängen am Umsatz, nicht am Standort.

Auf Basismodell-Ebene nichts: beide nutzen 743 Milliarden Parameter. Der Sprung (rund 6x auf Terminal-Bench 3.0) kommt allein aus skalierter Verstärkung im Post-Training, ohne erneutes Vortraining.

Noch nicht. Glimmer ist ein 30-Milliarden-Destillat. Zuckerberg hat offene Gewichte für Muse Spark 1.2 angekündigt; das ist Absicht, kein vollzogener Release.

Schluss

Sobald Tageszeitpreise gelten, zeigen Notebook und lang gehaltene Büro-Macs zwei Lücken: Peak-Last lässt sich schlecht verschieben, drei Rechnungen sitzen nicht nebeneinander in derselben grafischen Agent-Sitzung. Wer nur die 1.100-%-Schlagzeile jagt oder offene Gewichte als freie Handelslizenz liest, macht versteckte Kosten zur nächsten Rechnung. Routing, Cache-Präfixe und Off-Peak-Jobs gehören auf einen Remote-Mac, den Sie nach dem Versuch abschalten. Mieten Sie einen VNCMac-Remote-Mac, fahren Sie OpenClaw gegen Off-Peak und Peak, dann sperren Sie den Default. Start über die Mac-Tarife; wie Compute-Rechnungen in Preise wandern, steht in der zweiten DeepSeek-Finanzierungsrunde.

Quellen: DeepSeek-Preisankündigung, abgeglichen mit Wall Street CN, IT Home, AIGC.cn und V2EX; Alibaba-Qwen-Repos (Hugging Face/ModelScope) und SCMP zur Lizenz; Zhipu (Z.ai) GLM-5.3-Technikseite sowie VentureBeat und StableLearn; Meta AI Research und VentureBeat zu Muse Glimmer; Yicai und Sohu Finance zum Takt der chinesischen Open-Weight-Welle. Preise, Lizenzen und Benchmarks sind öffentlich verfügbare Stände. Vor einer Weiterveröffentlichung die aktuellen Amtsblätter prüfen; Chip-Dienste, die Cursor-Lücke und Exportgerüchte bleiben unbestätigt.