Open Weight 28. Juli 2026 ~24 Min. Kimi K3 Moonshot AI

Ist Kimi K3 Open Source?
Moonshots 2,8-Billionen-Parameter-Modell im Detail

Gewichte vom 27. Juli · 1,56 TB auf Hugging Face · MoonEP / FlashKDA / AgentEnv · Custom-Lizenz · API 0,30–15 $/M

Kimi K3 Open-Weight 2,8-Billionen-Parameter-MoE-Modell Konzept

Zusammenfassung: Am Abend des 27. Juli 2026 veröffentlichte Moonshot AI die vollständigen Gewichte und den Technikbericht für Kimi K3 — ein 2,8-Billionen-Parameter-Mixture-of-Experts-Modell mit 1-Million-Token-Kontextfenster und nativer Bildverarbeitung. Gleichzeitig open-sourcte Moonshot drei Infrastrukturtechnologien: MoonEP, FlashKDA und AgentEnv. Der 1,56-TB-Download erreichte innerhalb von dreißig Minuten Platz 1 auf Hugging Faces Trending-Liste. Moonshot nennt dies durchgängig „Open Weight“, nie „Open Source“ — und dieser Unterschied ist der erste Punkt, den Sie vor Specs und Benchmarks verstehen sollten.

01

Stolpersteine vor dem „Vollrelease“-Einsatz

  1. 01

    Open Source vs. Open Weight: Schlagzeilen sagen „Open Source“; Moonshots Materialien sagen Open Weight — Trainingsdaten und vollständiger Trainingscode fehlen

  2. 02

    Self-Hosting ist kein Consumer-Produkt: 1,56 TB über 896 Experten; Moonshot empfiehlt Supernodes mit 64+ Beschleunigern

  3. 03

    Neue kommerzielle Schwellen: Custom-Lizenz mit 20-Mio.-$-MaaS-Umsatzschwelle und 100-Mio.-MAU-Attribution — anders als die K2-Modified-MIT-Ära

  4. 04

    Fähigkeit ≠ Preis-Leistungs-Sieger: ~0,95 $/Task im Intelligence Index — günstiger als Claude Fable 5, teurer als GLM-5.2 (~0,47 $)

  5. 05

    Geopolitik und Destillationsvorwürfe: US-Vorwürfe industrieller Destillation kurz vor Gewichtefreigabe — technischen Wert und Compliance-Risiko trennen

02

Open Source oder nur Open Weight?

Nach OSI-Definition erfordert echtes Open Source öffentliche Trainingsdaten, Trainingscode und eine reproduzierbare Pipeline — nicht nur trainierte Gewichte. Kimi K3 liefert Gewichte, Technikbericht und mehrere trainingsnahe Infra-Tools, aber keine Trainingsdaten und keinen vollständigen Trainingscode.

Die Lizenz ist ein vollständig individuelles Dokument mit zwei kommerziellen Schwellen:

  1. 01

    MaaS-Umsatzschwelle: MaaS-Umsatz über 20 Millionen Dollar in beliebigen 12 Monaten erfordert eine separate Vereinbarung mit Moonshot

  2. 02

    Attributionsschwelle: Produkte mit über 100 Millionen MAU oder 20 Millionen Dollar Monatsumsatz müssen „Kimi K3“ prominent anzeigen

03

Kimi K3 auf einen Blick

SpezifikationWert
Gesamtparameter2,8 Billionen
Aktive Parameter~104 Milliarden
ArchitekturMixture-of-Experts (MoE)
Experten896 geroutet, 16 pro Token aktiv, plus Shared Experts
AttentionKimi Delta Attention (KDA) + Gated MLA
Kontextfenster1.000.000 Token
MultimodalitätNative Vision (ViT-V2, 27 Layer)
GewichtsformatMXFP4-Gewichte, MXFP8-Aktivierungen
Downloadgröße~1,56 TB (Hugging Face)
LizenzCustom — Moonshot nennt es „Open Weight“, nicht „Open Source“
API-Verfügbarkeit16. Juli 2026
Vollständige Gewichte27. Juli 2026
04

Architektur: KDA, Attention Residuals und Per-Head Muon

Kimi Delta Attention (KDA)

KDA ersetzt ein skalares Vergessensgate durch kanalweises Gating — jede Feature-Dimension erhält eine eigene Abklingrate. Als chunkwise DPLR für lineare Rekursion implementiert; K3 wechselt KDA mit Gated-MLA-Global-Layern ab, um 1M Kontext bei kleinem KV-Cache zu unterstützen.

Attention Residuals (AttnRes)

AttnRes ersetzt gleichförmige Residual-Akkumulation durch eingabeabhängige Aggregation über vorherige Layer — ~25 % Trainingseffizienz bei unter 2 % Mehrkosten. Pseudo-Query-Vektoren starten bei Null für stabiles Frühtraining.

Per-Head Muon und Stable LatentMoE

Muon arbeitet pro Attention-Head; MoE routet 896 Experten mit 16 aktiven pro Token (~1,8 % Sparsity), mit Quantile Balancing plus MoonEP für Lastverteilung.

05

Drei Infrastruktur-Releases

TechnologieFunktionKennzahlen
MoonEPMoE-Kommunikation im ExtremmaßstabDupliziert überlastete Experten; beweist obere Schranke redundanter Experten pro Rank
FlashKDACUTLASS-KDA-Kernel (zuvor offen)1,72×–2,22× schnelleres Prefill auf H20 vs. flash-linear-attention-Baseline
AgentEnvFirecracker-microVM-Sandbox mit KVCache.aiCheckpoint ~133 ms, Resume ~49 ms, bis 6,5× Memory-Overcommit (Herstellerangabe)
06

Benchmarks vs. GPT-5.6, Claude und GLM-5.2

SWE-bench Verified (Vals AI, Juli 2026): Claude Opus 5 97 %, GPT-5.6 Sol 96,2 %, Claude Fable 5 95 %, Kimi K3 93,4 %.

Artificial Analysis Intelligence Index (max. Reasoning): Fable 5 60, GPT-5.6 Sol 59, K3 ~57 (#3 gesamt, #1 Open Weight), GLM-5.2 51. Kosten pro Task ~0,95 $ — etwa 60 % unter Fable 5 (~2,40 $), aber über GLM-5.2 (~0,47 $). Fähigkeitsobergrenze der Open-Weight-Liga, nicht der Preis-Leistungs-Favorit. K3 führt Arena.ais Frontend Code Arena an.

API vs. Self-Hosting

PfadIdeal fürHürde / Kosten
Offizielle API (kimi-k3)Einzelpersonen, schnelle Validierung0,30 $/M gecachter Input; 3 $/M Miss; 15 $/M Output
OpenRouter u. a.Multi-Modell-Routing~7 Anbieter, meist offizielle Preise
Vollständiges Self-HostingHyperscale-Caller, Labs1,56 TB + Supernode mit 64+ Beschleunigern
07

Fünf-Schritte-Rollout-Checkliste

  1. 01

    https://api.moonshot.ai/v1 mit Modell-ID kimi-k3 über OpenAI-kompatibles SDK aufrufen; Long Context und Cache-Hits testen

  2. 02

    Workload auf K3-Stärken (Frontend-Code, lange Docs) vs. Lücken mappen — SWE-bench und AA Index nutzen

  3. 03

    Rechtsabteilung die Hugging-Face-LICENSE auf MaaS- und MAU-Schwellen prüfen lassen

  4. 04

    Bei Self-Hosting: 1,56 TB Speicher und 64+ Beschleuniger budgetieren; MoonEP / FlashKDA-Integration evaluieren

  5. 05

    Kimi Code / OpenClaw-Multi-Modell-Agenten in echter macOS-GUI-Session validieren (siehe VNCMac unten)

08

US-China-Kontext und WAIC 2026

Der Release fiel während WAIC 2026 und Tage nach US-Vorwürfen industrieller Destillation gegen Anthropics Fable-Modell. Chinas Handelsministerium widersprach am 28. Juli. Drei Tage später präsentierte Alibaba Qwen3.8-Max-Preview (2,4T) — der Open-Weight-Wettlauf tritt in den „3T-Club“ ein.

09

FAQ

Nein, nicht nach OSI-Standards. Open Weight: Gewichte, Report und etwas Infra sind öffentlich; Trainingsdaten und vollständiger Trainingscode nicht.

Ja in den meisten Fällen. MaaS über 20 Mio. $ Trailing Revenue oder 100 Mio. MAU / 20 Mio. $ Monatsumsatz löst Zusatzbedingungen aus.

64+ Beschleuniger auf einem Supernode. Für alle anderen: API oder OpenRouter.

Hinter Top-Closed-Modellen auf SWE-bench (93,4 % vs. 95–97 %), aber stärkstes Open-Weight-Modell am Markt.

~3× Parameter, AttnRes + Per-Head Muon, größerer Kontext und Multimodal-Stack; neues MaaS-Lizenz-Gate.

Abschluss

K3 machte aus der größten Open-Weight-Schlagzeile einen 1,56-TB-Download — aber Open Weight ist nicht Open Source, und die meisten Teams werden K3 weiter per API nutzen. Wenn Ihr Hauptrechner Windows oder Linux ist und Sie eine echte macOS-GUI für Kimi Code, OpenClaw-Routing oder iOS-Build-Baselines brauchen: Hardware kaufen ist teuer, SSH klickt keine Berechtigungsdialoge. Mieten Sie einen VNCMac Remote-Mac stundenweise, validieren Sie Agenten per VNC und stoppen Sie nach dem Projekt. Siehe Mac-Mietpläne oder unseren Kimi-K3-Deep-Dive vom 17. Juli.

Quellen: Moonshot-AI-Blog, Hugging Face, Vals AI, Artificial Analysis, VentureBeat, Simon Willison. Vor Produktionsentscheidungen offizielle Daten prüfen.