Open Weights 22. Juli 2026 ~22 Min. Kimi K3 27. Juli

Kimi K3 Open Weights:
Termin, Benchmarks & Betriebsrealität

Noch fünf Tage bis zum Weight-Drop · Modified MIT · 2,8T MoE · 1M Kontext · 1,4 TB @ 4-bit · API 3/15 $

Kimi K3 vs Claude Fable 5 Open Weights Release Benchmark Vergleich Konzept

Kurzantwort: Moonshot AI veröffentlicht die vollständigen Gewichte von Kimi K3 — einem 2,8-Billionen-Parameter-MoE-Modell mit 1.048.576 Token Kontext — am 27. Juli 2026 unter Modified MIT auf Hugging Face, zusammen mit einem technischen Report. API und Kimi-Produkte laufen seit dem 16. Juli. Dieser Leitfaden ordnet die Timeline 16.–27. Juli, Specs, Benchmarks gegen Claude Fable 5 und GPT-5.6 Sol, echte API-Kosten mit Caching, Self-Hosting-Hardware, Branchenbedeutung und eine Release-Checkliste — ohne den Eindruck zu erwecken, das Modell laufe auf einem Laptop.

01

TL;DR: Was sich am 27. Juli ändert

  • 16. Juli: API, Kimi App, Kimi Work, Kimi Code live; Artificial Analysis veröffentlicht unabhängigen Score 57,1.
  • 17. Juli: WAIC in Shanghai; Staatsmedien rahmen K3 als nationalen Meilenstein.
  • 27. Juli: Vollständige Open Weights + technischer Report (Architektur, Training, Evals).

Fazit: K3 ist kein „Fable-5-Killer“. Platz 3 im AA Intelligence Index (57,1 vs. 59,9 / 58,9), liefert aber Frontier-nah bei etwa einem Drittel der Kosten — plus 1M-Kontext und herunterladbare Gewichte, was Closed Models nicht bieten.

Stolpersteine vor dem Commit

  1. 01

    Zwei Launch-Daten: API live ≠ Gewichte downloadbar.

  2. 02

    „Lokal laufen“-Clickbait: ~1,4 TB bei 4-bit, 64+ Beschleuniger — kein Ollama auf dem Notebook.

  3. 03

    Closed-Model-Premium: Fable-5-Taskkosten ~65,8 % höher (AA: K3 bei 0,94 $).

  4. 04

    Long-Context-KV-Kosten: Viele Modelle werben mit langen Fenstern, können sie produktiv nicht finanzieren.

  5. 05

    Regulatorischer Kill-Switch: Closed Weights können entzogen werden; veröffentlichte Open Weights nicht „zurückgerufen“.

02

Release-Datum: API vs. Open Weights

DatumEreignis
2026-07-16API + Kimi-Stack live; Artificial-Analysis-Benchmark
2026-07-17WAIC; nationale Meilenstein-Berichterstattung
2026-07-27Hugging-Face-Download + technischer Report

Suchintent zu kimi k3 release date, kimi k3 download und kimi k3 hugging face peakt um den 27. Juli. dateModified aktualisieren und „geplant“ durch „verfügbar“ ersetzen — innerhalb weniger Stunden nach dem Drop.

03

Was ist Kimi K3? Kerndaten

SpecWert
Parameter2,8 Billionen (größter Open-Weight-Release bisher)
ArchitekturSparse MoE: Stable LatentMoE, 16 von 896 Experten aktiv/Token
AttentionKimi Delta Attention (KDA) + AttnRes + Gated MLA
Kontext1.048.576 Token
ModalitätenNative Vision (Text + Bild; Video im Produkt); Text out
GewichtsformatMXFP4-Gewichte + MXFP8-Aktivierungen (native Low-Precision-Training)
Skalierung vs. K2~2,5× Effizienz bei gleicher Compute
Long-Context-DecodeBis 6,3× schneller bei 1M Token (KDA)
04

Benchmarks vs. Claude Fable 5 und GPT-5.6 Sol

ModellAA Intelligence Index
Claude Fable 559,9
GPT-5.6 Sol58,9
Kimi K357,1 (#3 von 189)

Wo Kimi K3 gewinnt

  • Frontend Code Arena #1 (Blind-Dev-Präferenz über Fable und Sol)
  • Automation Bench, SpreadsheetBench 2 #1
  • BrowseComp 91,2 #1 (1M ohne Kompression ~90,4+)
  • SWE Marathon 42,0 — lange Coding-Sessions (GPT-5.5 / GLM-5.2 kollabieren in Teens)
  • Terminal Bench 2.1 88,3 — nahe Parität mit Sol 88,8
  • Program Bench 77,8 — knapp vor Sol 77,6
  • FrontierSWE 81,2 — deutlich über Sol 71,3 (unter Fable 86,6)

Wo es noch hinterherhinkt

  • GDPval v2 Elo 1668–1687 vs. Fable 1760 / Sol 1748
  • DeepSWE 67,5 vs. Sol 73,0
  • Halluzinationsrate vs. K2.6 gestiegen (Moonshot bestätigt); Reddit-Berichte vs. Top-Closed
  • Polish und Session-Varianz hinter Fable 5 / Sol

Moonshot räumte ungewöhnlich offen ein, Fable 5 und Sol gesamt zu verlieren — Harness-Sensitivität und übereifrige Reaktion auf mehrdeutige Intents als Gründe. Eval-Datum 16. Juli 2026, unterschiedliche Harnesses — bis zu unabhängigen Re-Runs als Richtwert behandeln.

05

API-Preise: echte Kosten mit Caching

PostenPreis pro 1M Token
Input (Cache Miss)3,00 $
Input (Cache Hit, automatisch)0,30 $
Output15,00 $
  • Höchste Preisklasse unter chinesischen Anbietern, aber unter Claude Opus 4.8 pro Task.
  • AA misst 0,94 $ pro Task: 9,4 % unter GPT-5.6 Sol, 65,8 % unter Claude Fable 5.
  • Coding-Workloads berichten 90 %+ Cache-Hit-Raten — effektive Input-Kosten weit unter Listenpreis.
06

Open Source? Open Weights vs. Open Source

In Titeln und Snippets Open Weights verwenden — nicht allein „Open Source“. K3 veröffentlicht Gewichte + technischen Report unter Modified MIT; Trainingscode und Daten bleiben geschlossen. Diese Unterscheidung ist auf r/LocalLLaMA und HN zentral und selbst hochrelevantes FAQ-Material.

Am 27. Juli erwartet: Upload in Moonshots HF-Org, LICENSE-Text, vLLM KDA/Prefix-Cache-Support, später Ollama/GGUF-Builds nach K2-Muster.

07

Lokal betreiben? Hardware-Anforderungen

Ehrliche Antwort: nicht auf Consumer-Hardware.

  • ~1,4 TB bei 4-bit; Moonshot empfiehlt Supernode mit 64+ Beschleunigern mit Expert- und Tensor-Parallelismus.
  • Referenz: K2.7 Code (1T) brauchte ~577 GB VRAM bei INT4; K3 ist 2,8× dieser Skala.
  • Self-Host nur bei Data Residency, Fine-Tuning oder API-Ausgaben, die eigene Hardware rechtfertigen — sonst API (3/15 $) oder Cloud-Inference.

Release-Day-Checkliste

  1. 01

    HF-Repo-Vollständigkeit (Shards, Index, Config)

  2. 02

    LICENSE wörtlich (Modified-MIT-Bedingungen)

  3. 03

    Quantisierte Artefakte (MXFP4 / GGUF)

  4. 04

    vLLM / SGLang Startbefehle und Mindest-HW-Hinweise

  5. 05

    Unabhängige Long-Context- und BrowseComp-Re-Runs

08

Warum der Drop am 27. Juli zählt

  1. 01

    Frontier-Lücke fast geschlossen: AA-Spread nur wenige Punkte — Closed-Only-Premium schwerer zu rechtfertigen.

  2. 02

    Geopolitik: WAIC-Timing; USA delistete Anthropic Fable/Mythos kurz (Wiederherstellung 1. Juli) — Regulatoren blockieren Closed-APIs, nicht veröffentlichte Gewichte.

  3. 03

    Chinesische Welle: GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 ist der Gipfel des Open-Weight-Push.

  4. 04

    Moonshot-Comeback: vom Post-DeepSeek-R1-Tief zu K2 → K2.5 → K3 Open-Weight-Kadenz.

Entscheidungsmatrix

SzenarioWegWarum
Jetzt testen / Coding-AgentenAPI oder Kimi CodeLive seit 16. Juli; Caching senkt Kosten
Post-27.7. Fine-Tune / ResidencySelf-Host (64+ GPUs)Volle Gewichte + Compliance nötig
KostensensitivDeepSeek V4 Pro API3,48 $/M Output
Long-Horizon-ReasoningClaude Fable 5GDPval / Gesamtindex-Führung
Auf Ollama/GGUF wartenK2-Follow-ons verfolgenConsumer-Quantisierungen hinken HF-Drop hinterher

Quellen: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16. Juli), VentureBeat, Northflank, r/LocalLLaMA, Hacker News.

09

FAQ

27. Juli 2026 auf Hugging Face mit technischem Report. API seit 16. Juli verfügbar.

Open Weights unter Modified MIT — nicht vollständig Open Source (kein kompletter Training-Stack/Daten).

3 $ / 0,30 $ gecacht / 15 $ pro 1M Token; ~0,94 $ pro Task in AA-Tests.

Nein — ~1,4 TB bei 4-bit, 64+ Beschleuniger empfohlen. API nutzen.

Gesamtindex: nein (57,1 vs. 59,9). Mehrere Coding/UI-Benchmarks: ja. Kosten pro Task: deutlich niedriger.

Modified MIT — exakte Bedingungen am 27. Juli in der Hugging-Face-LICENSE prüfen.

Abschluss

Open Weights am 27. Juli verkleinern ein 2,8T-Modell nicht auf Ihre Schreibtisch-GPU. Die meisten Teams nutzen K3 über API, Kimi Code oder OpenRouter; Self-Hosting bleibt Enterprise-Maßstab. Brauchen Sie zusätzlich eine echte macOS-GUI — Kimi-Code-Agenten, OpenClaw-Routing, Xcode-Signing-Dialoge, die SSH nicht klickt — ist Hardware teuer und Leerlauf depreciiert schnell. VNCMac Remote-Mac-Miete liefert on-demand VNC-Desktop für Long-Context-Coding und Agent-Flows; nach dem Sprint stoppen Sie die Abrechnung. Siehe Mac-Mietpläne oder unseren Kimi-K3-Test vom 17. Juli für Architektur-Details.