Noch fünf Tage bis zum Weight-Drop · Modified MIT · 2,8T MoE · 1M Kontext · 1,4 TB @ 4-bit · API 3/15 $
Kurzantwort: Moonshot AI veröffentlicht die vollständigen Gewichte von Kimi K3 — einem 2,8-Billionen-Parameter-MoE-Modell mit 1.048.576 Token Kontext — am 27. Juli 2026 unter Modified MIT auf Hugging Face, zusammen mit einem technischen Report. API und Kimi-Produkte laufen seit dem 16. Juli. Dieser Leitfaden ordnet die Timeline 16.–27. Juli, Specs, Benchmarks gegen Claude Fable 5 und GPT-5.6 Sol, echte API-Kosten mit Caching, Self-Hosting-Hardware, Branchenbedeutung und eine Release-Checkliste — ohne den Eindruck zu erwecken, das Modell laufe auf einem Laptop.
Fazit: K3 ist kein „Fable-5-Killer“. Platz 3 im AA Intelligence Index (57,1 vs. 59,9 / 58,9), liefert aber Frontier-nah bei etwa einem Drittel der Kosten — plus 1M-Kontext und herunterladbare Gewichte, was Closed Models nicht bieten.
Zwei Launch-Daten: API live ≠ Gewichte downloadbar.
„Lokal laufen“-Clickbait: ~1,4 TB bei 4-bit, 64+ Beschleuniger — kein Ollama auf dem Notebook.
Closed-Model-Premium: Fable-5-Taskkosten ~65,8 % höher (AA: K3 bei 0,94 $).
Long-Context-KV-Kosten: Viele Modelle werben mit langen Fenstern, können sie produktiv nicht finanzieren.
Regulatorischer Kill-Switch: Closed Weights können entzogen werden; veröffentlichte Open Weights nicht „zurückgerufen“.
| Datum | Ereignis |
|---|---|
| 2026-07-16 | API + Kimi-Stack live; Artificial-Analysis-Benchmark |
| 2026-07-17 | WAIC; nationale Meilenstein-Berichterstattung |
| 2026-07-27 | Hugging-Face-Download + technischer Report |
Suchintent zu kimi k3 release date, kimi k3 download und kimi k3 hugging face peakt um den 27. Juli. dateModified aktualisieren und „geplant“ durch „verfügbar“ ersetzen — innerhalb weniger Stunden nach dem Drop.
| Spec | Wert |
|---|---|
| Parameter | 2,8 Billionen (größter Open-Weight-Release bisher) |
| Architektur | Sparse MoE: Stable LatentMoE, 16 von 896 Experten aktiv/Token |
| Attention | Kimi Delta Attention (KDA) + AttnRes + Gated MLA |
| Kontext | 1.048.576 Token |
| Modalitäten | Native Vision (Text + Bild; Video im Produkt); Text out |
| Gewichtsformat | MXFP4-Gewichte + MXFP8-Aktivierungen (native Low-Precision-Training) |
| Skalierung vs. K2 | ~2,5× Effizienz bei gleicher Compute |
| Long-Context-Decode | Bis 6,3× schneller bei 1M Token (KDA) |
| Modell | AA Intelligence Index |
|---|---|
| Claude Fable 5 | 59,9 |
| GPT-5.6 Sol | 58,9 |
| Kimi K3 | 57,1 (#3 von 189) |
Moonshot räumte ungewöhnlich offen ein, Fable 5 und Sol gesamt zu verlieren — Harness-Sensitivität und übereifrige Reaktion auf mehrdeutige Intents als Gründe. Eval-Datum 16. Juli 2026, unterschiedliche Harnesses — bis zu unabhängigen Re-Runs als Richtwert behandeln.
| Posten | Preis pro 1M Token |
|---|---|
| Input (Cache Miss) | 3,00 $ |
| Input (Cache Hit, automatisch) | 0,30 $ |
| Output | 15,00 $ |
In Titeln und Snippets Open Weights verwenden — nicht allein „Open Source“. K3 veröffentlicht Gewichte + technischen Report unter Modified MIT; Trainingscode und Daten bleiben geschlossen. Diese Unterscheidung ist auf r/LocalLLaMA und HN zentral und selbst hochrelevantes FAQ-Material.
Am 27. Juli erwartet: Upload in Moonshots HF-Org, LICENSE-Text, vLLM KDA/Prefix-Cache-Support, später Ollama/GGUF-Builds nach K2-Muster.
Ehrliche Antwort: nicht auf Consumer-Hardware.
HF-Repo-Vollständigkeit (Shards, Index, Config)
LICENSE wörtlich (Modified-MIT-Bedingungen)
Quantisierte Artefakte (MXFP4 / GGUF)
vLLM / SGLang Startbefehle und Mindest-HW-Hinweise
Unabhängige Long-Context- und BrowseComp-Re-Runs
Frontier-Lücke fast geschlossen: AA-Spread nur wenige Punkte — Closed-Only-Premium schwerer zu rechtfertigen.
Geopolitik: WAIC-Timing; USA delistete Anthropic Fable/Mythos kurz (Wiederherstellung 1. Juli) — Regulatoren blockieren Closed-APIs, nicht veröffentlichte Gewichte.
Chinesische Welle: GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 ist der Gipfel des Open-Weight-Push.
Moonshot-Comeback: vom Post-DeepSeek-R1-Tief zu K2 → K2.5 → K3 Open-Weight-Kadenz.
| Szenario | Weg | Warum |
|---|---|---|
| Jetzt testen / Coding-Agenten | API oder Kimi Code | Live seit 16. Juli; Caching senkt Kosten |
| Post-27.7. Fine-Tune / Residency | Self-Host (64+ GPUs) | Volle Gewichte + Compliance nötig |
| Kostensensitiv | DeepSeek V4 Pro API | 3,48 $/M Output |
| Long-Horizon-Reasoning | Claude Fable 5 | GDPval / Gesamtindex-Führung |
| Auf Ollama/GGUF warten | K2-Follow-ons verfolgen | Consumer-Quantisierungen hinken HF-Drop hinterher |
Quellen: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16. Juli), VentureBeat, Northflank, r/LocalLLaMA, Hacker News.
27. Juli 2026 auf Hugging Face mit technischem Report. API seit 16. Juli verfügbar.
Open Weights unter Modified MIT — nicht vollständig Open Source (kein kompletter Training-Stack/Daten).
3 $ / 0,30 $ gecacht / 15 $ pro 1M Token; ~0,94 $ pro Task in AA-Tests.
Nein — ~1,4 TB bei 4-bit, 64+ Beschleuniger empfohlen. API nutzen.
Gesamtindex: nein (57,1 vs. 59,9). Mehrere Coding/UI-Benchmarks: ja. Kosten pro Task: deutlich niedriger.
Modified MIT — exakte Bedingungen am 27. Juli in der Hugging-Face-LICENSE prüfen.
Open Weights am 27. Juli verkleinern ein 2,8T-Modell nicht auf Ihre Schreibtisch-GPU. Die meisten Teams nutzen K3 über API, Kimi Code oder OpenRouter; Self-Hosting bleibt Enterprise-Maßstab. Brauchen Sie zusätzlich eine echte macOS-GUI — Kimi-Code-Agenten, OpenClaw-Routing, Xcode-Signing-Dialoge, die SSH nicht klickt — ist Hardware teuer und Leerlauf depreciiert schnell. VNCMac Remote-Mac-Miete liefert on-demand VNC-Desktop für Long-Context-Coding und Agent-Flows; nach dem Sprint stoppen Sie die Abrechnung. Siehe Mac-Mietpläne oder unseren Kimi-K3-Test vom 17. Juli für Architektur-Details.