Gewichte vom 27. Juli · 1,56 TB auf Hugging Face · MoonEP / FlashKDA / AgentEnv · Custom-Lizenz · API 0,30–15 $/M
Zusammenfassung: Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Gewichte und den Technikbericht für Kimi K3 — ein 2,8-Billionen-Parameter-Mixture-of-Experts-Modell mit 1-Million-Token-Kontextfenster und nativer Bildverarbeitung. Gleichzeitig open-sourcte Moonshot drei Infrastrukturtechnologien: MoonEP, FlashKDA und AgentEnv. Der 1,56-TB-Download erreichte innerhalb von dreißig Minuten Platz 1 auf Hugging Faces Trending-Liste. Moonshot nennt dies durchgängig „Open Weight“, nie „Open Source“ — und dieser Unterschied ist der erste Punkt, den Sie vor Specs und Benchmarks verstehen sollten.
Open Source vs. Open Weight: Schlagzeilen sagen „Open Source“; Moonshots Materialien sagen Open Weight — Trainingsdaten und vollständiger Trainingscode fehlen
Self-Hosting ist kein Consumer-Produkt: 1,56 TB über 896 Experten; Moonshot empfiehlt Supernodes mit 64+ Beschleunigern
Neue kommerzielle Schwellen: Custom-Lizenz mit 20-Mio.-$-MaaS-Umsatzschwelle und 100-Mio.-MAU-Attribution — anders als die K2-Modified-MIT-Ära
Fähigkeit ≠ Preis-Leistungs-Sieger: ~0,95 $/Task im Intelligence Index — günstiger als Claude Fable 5, teurer als GLM-5.2 (~0,47 $)
Geopolitik und Destillationsvorwürfe: US-Vorwürfe industrieller Destillation kurz vor Gewichtefreigabe — technischen Wert und Compliance-Risiko trennen
Nach OSI-Definition erfordert echtes Open Source öffentliche Trainingsdaten, Trainingscode und eine reproduzierbare Pipeline — nicht nur trainierte Gewichte. Kimi K3 liefert Gewichte, Technikbericht und mehrere trainingsnahe Infra-Tools, aber keine Trainingsdaten und keinen vollständigen Trainingscode.
Die Lizenz ist ein vollständig individuelles Dokument mit zwei kommerziellen Schwellen:
MaaS-Umsatzschwelle: MaaS-Umsatz über 20 Millionen Dollar in beliebigen 12 Monaten erfordert eine separate Vereinbarung mit Moonshot
Attributionsschwelle: Produkte mit über 100 Millionen MAU oder 20 Millionen Dollar Monatsumsatz müssen „Kimi K3“ prominent anzeigen
| Spezifikation | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen |
| Aktive Parameter | ~104 Milliarden |
| Architektur | Mixture-of-Experts (MoE) |
| Experten | 896 geroutet, 16 pro Token aktiv, plus Shared Experts |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Kontextfenster | 1.000.000 Token |
| Multimodalität | Native Vision (ViT-V2, 27 Layer) |
| Gewichtsformat | MXFP4-Gewichte, MXFP8-Aktivierungen |
| Downloadgröße | ~1,56 TB (Hugging Face) |
| Lizenz | Custom — Moonshot nennt es „Open Weight“, nicht „Open Source“ |
| API-Verfügbarkeit | 16. Juli 2026 |
| Vollständige Gewichte | 27. Juli 2026 |
KDA ersetzt ein skalares Vergessensgate durch kanalweises Gating — jede Feature-Dimension erhält eine eigene Abklingrate. Als chunkwise DPLR für lineare Rekursion implementiert; K3 wechselt KDA mit Gated-MLA-Global-Layern ab, um 1M Kontext bei kleinem KV-Cache zu unterstützen.
AttnRes ersetzt gleichförmige Residual-Akkumulation durch eingabeabhängige Aggregation über vorherige Layer — ~25 % Trainingseffizienz bei unter 2 % Mehrkosten. Pseudo-Query-Vektoren starten bei Null für stabiles Frühtraining.
Muon arbeitet pro Attention-Head; MoE routet 896 Experten mit 16 aktiven pro Token (~1,8 % Sparsity), mit Quantile Balancing plus MoonEP für Lastverteilung.
| Technologie | Funktion | Kennzahlen |
|---|---|---|
| MoonEP | MoE-Kommunikation im Extremmaßstab | Dupliziert überlastete Experten; beweist obere Schranke redundanter Experten pro Rank |
| FlashKDA | CUTLASS-KDA-Kernel (zuvor offen) | 1,72×–2,22× schnelleres Prefill auf H20 vs. flash-linear-attention-Baseline |
| AgentEnv | Firecracker-microVM-Sandbox mit KVCache.ai | Checkpoint ~133 ms, Resume ~49 ms, bis 6,5× Memory-Overcommit (Herstellerangabe) |
SWE-bench Verified (Vals AI, Juli 2026): Claude Opus 5 97 %, GPT-5.6 Sol 96,2 %, Claude Fable 5 95 %, Kimi K3 93,4 %.
Artificial Analysis Intelligence Index (max. Reasoning): Fable 5 60, GPT-5.6 Sol 59, K3 ~57 (#3 gesamt, #1 Open Weight), GLM-5.2 51. Kosten pro Task ~0,95 $ — etwa 60 % unter Fable 5 (~2,40 $), aber über GLM-5.2 (~0,47 $). Fähigkeitsobergrenze der Open-Weight-Liga, nicht der Preis-Leistungs-Favorit. K3 führt Arena.ais Frontend Code Arena an.
| Pfad | Ideal für | Hürde / Kosten |
|---|---|---|
Offizielle API (kimi-k3) | Einzelpersonen, schnelle Validierung | 0,30 $/M gecachter Input; 3 $/M Miss; 15 $/M Output |
| OpenRouter u. a. | Multi-Modell-Routing | ~7 Anbieter, meist offizielle Preise |
| Vollständiges Self-Hosting | Hyperscale-Caller, Labs | 1,56 TB + Supernode mit 64+ Beschleunigern |
https://api.moonshot.ai/v1 mit Modell-ID kimi-k3 über OpenAI-kompatibles SDK aufrufen; Long Context und Cache-Hits testen
Workload auf K3-Stärken (Frontend-Code, lange Docs) vs. Lücken mappen — SWE-bench und AA Index nutzen
Rechtsabteilung die Hugging-Face-LICENSE auf MaaS- und MAU-Schwellen prüfen lassen
Bei Self-Hosting: 1,56 TB Speicher und 64+ Beschleuniger budgetieren; MoonEP / FlashKDA-Integration evaluieren
Kimi Code / OpenClaw-Multi-Modell-Agenten in echter macOS-GUI-Session validieren (siehe VNCMac unten)
Der Release fiel während WAIC 2026 und Tage nach US-Vorwürfen industrieller Destillation gegen Anthropics Fable-Modell. Chinas Handelsministerium widersprach am 28. Juli. Drei Tage später präsentierte Alibaba Qwen3.8-Max-Preview (2,4T) — der Open-Weight-Wettlauf tritt in den „3T-Club“ ein.
Nein, nicht nach OSI-Standards. Open Weight: Gewichte, Report und etwas Infra sind öffentlich; Trainingsdaten und vollständiger Trainingscode nicht.
Ja in den meisten Fällen. MaaS über 20 Mio. $ Trailing Revenue oder 100 Mio. MAU / 20 Mio. $ Monatsumsatz löst Zusatzbedingungen aus.
64+ Beschleuniger auf einem Supernode. Für alle anderen: API oder OpenRouter.
Hinter Top-Closed-Modellen auf SWE-bench (93,4 % vs. 95–97 %), aber stärkstes Open-Weight-Modell am Markt.
~3× Parameter, AttnRes + Per-Head Muon, größerer Kontext und Multimodal-Stack; neues MaaS-Lizenz-Gate.
K3 machte aus der größten Open-Weight-Schlagzeile einen 1,56-TB-Download — aber Open Weight ist nicht Open Source, und die meisten Teams werden K3 weiter per API nutzen. Wenn Ihr Hauptrechner Windows oder Linux ist und Sie eine echte macOS-GUI für Kimi Code, OpenClaw-Routing oder iOS-Build-Baselines brauchen: Hardware kaufen ist teuer, SSH klickt keine Berechtigungsdialoge. Mieten Sie einen VNCMac Remote-Mac stundenweise, validieren Sie Agenten per VNC und stoppen Sie nach dem Projekt. Siehe Mac-Mietpläne oder unseren Kimi-K3-Deep-Dive vom 17. Juli.
Quellen: Moonshot-AI-Blog, Hugging Face, Vals AI, Artificial Analysis, VentureBeat, Simon Willison. Vor Produktionsentscheidungen offizielle Daten prüfen.