Poids du 27 juillet · 1,56 To sur Hugging Face · MoonEP / FlashKDA / AgentEnv · Licence personnalisée · API 0,30–15 $/M
Résumé : Le soir du 27 juillet 2026, Moonshot AI a publié les poids complets et le rapport technique de Kimi K3 — un modèle Mixture-of-Experts de 2,8 billions de paramètres avec une fenêtre de contexte d'un million de tokens et une compréhension visuelle native. Moonshot a également open-sourcé trois technologies d'infrastructure : MoonEP, FlashKDA et AgentEnv. Le téléchargement de 1,56 To a atteint la 1re place des tendances Hugging Face en trente minutes. Moonshot parle systématiquement d'« open weight », jamais d'« open source » — et cette distinction est le premier point à comprendre avant les specs et benchmarks.
Open source vs open weight: Les titres disent « open source » ; les documents Moonshot disent open weight — données d'entraînement et code complet non publics
L'auto-hébergement n'est pas grand public: 1,56 To sur 896 experts ; Moonshot recommande des supernœuds 64+ accélérateurs
Nouveaux seuils commerciaux: Licence personnalisée avec seuil MaaS 20 M$ et attribution 100 M MAU — contrairement à l'ère Modified MIT de K2
Capacité ≠ meilleur rapport qualité-prix: ~0,95 $/tâche sur l'Intelligence Index — moins cher que Claude Fable 5, plus cher que GLM-5.2 (~0,47 $)
Géopolitique et allégations de distillation: Accusations US de distillation industrielle quelques jours avant la publication — séparer mérite technique et risque compliance
Selon l'Open Source Initiative, le vrai open source exige des données d'entraînement publiques, du code d'entraînement et un pipeline reproductible — pas seulement des poids entraînés. Kimi K3 fournit poids, rapport technique et outils d'infra proches de l'entraînement, mais pas les données ni le code complet.
La licence est un document entièrement personnalisé avec deux seuils commerciaux :
Seuil revenus MaaS: Revenus Model-as-a-Service supérieurs à 20 millions de dollars sur 12 mois glissants nécessitent un accord séparé avec Moonshot
Seuil d'attribution: Produits dépassant 100 millions de MAU ou 20 millions de dollars de revenus mensuels doivent afficher « Kimi K3 » de façon visible
| Spécification | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions |
| Paramètres actifs | ~104 milliards |
| Architecture | Mixture-of-Experts (MoE) |
| Experts | 896 routés, 16 activés par token, plus experts partagés |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Fenêtre de contexte | 1 000 000 tokens |
| Multimodalité | Vision native (ViT-V2, 27 couches) |
| Format des poids | Poids MXFP4, activations MXFP8 |
| Taille du téléchargement | ~1,56 To (Hugging Face) |
| Licence | Personnalisée — Moonshot dit « open weight », pas « open source » |
| API disponible | 16 juillet 2026 |
| Poids complets publiés | 27 juillet 2026 |
KDA remplace une porte d'oubli scalaire par un gating canal par canal — chaque dimension de feature a son propre taux de décroissance. Implémenté en DPLR chunkwise pour une récurrence en temps linéaire ; K3 alterne KDA et couches globales Gated MLA pour supporter 1M de contexte avec un petit cache KV.
AttnRes remplace l'accumulation résiduelle uniforme par une agrégation dépendante de l'entrée sur les couches précédentes — ~25 % de gain d'efficacité d'entraînement pour moins de 2 % de coût ajouté. Les pseudo-vecteurs requête s'initialisent à zéro pour un début d'entraînement stable.
Muon opère par tête d'attention ; le MoE route 896 experts avec 16 actifs par token (~1,8 % de sparsité), avec Quantile Balancing et MoonEP pour l'équilibrage de charge.
| Technologie | Rôle | Chiffres clés |
|---|---|---|
| MoonEP | Communication MoE à très grande échelle | Duplique les experts surchargés ; prouve la borne supérieure d'experts redondants par rang |
| FlashKDA | Kernels CUTLASS KDA (déjà ouverts) | Prefill 1,72×–2,22× plus rapide sur H20 vs baseline flash-linear-attention |
| AgentEnv | Sandbox microVM Firecracker avec KVCache.ai | Checkpoint ~133 ms, reprise ~49 ms, jusqu'à 6,5× d'overcommit mémoire (chiffre éditeur) |
SWE-bench Verified (Vals AI, juillet 2026) : Claude Opus 5 97 %, GPT-5.6 Sol 96,2 %, Claude Fable 5 95 %, Kimi K3 93,4 %.
Artificial Analysis Intelligence Index (raisonnement max) : Fable 5 60, GPT-5.6 Sol 59, K3 ~57 (#3 global, #1 open weight), GLM-5.2 51. Coût par tâche ~0,95 $ — environ 60 % sous Fable 5 (~2,40 $) mais au-dessus de GLM-5.2 (~0,47 $). Plafond de capacité de la ligue open weight, pas le choix valeur. K3 est #1 sur la Frontend Code Arena d'Arena.ai.
| Voie | Idéal pour | Barrière / coût |
|---|---|---|
API officielle (kimi-k3) | Particuliers, validation rapide | 0,30 $/M entrée en cache ; 3 $/M miss ; 15 $/M sortie |
| OpenRouter etc. | Routage multi-modèles | ~7 fournisseurs, tarifs proches de l'officiel |
| Auto-hébergement complet | Appelants hyperscale, labs | 1,56 To + supernœud 64+ accélérateurs |
Appeler https://api.moonshot.ai/v1 avec l'ID modèle kimi-k3 via SDK compatible OpenAI ; tester long contexte et cache hits
Mapper votre charge aux forces K3 (code frontend, longs docs) vs lacunes via SWE-bench et AA Index
Faire relire la LICENSE Hugging Face par le juridique pour les seuils MaaS et MAU
Si auto-hébergement : budgéter 1,56 To et 64+ accélérateurs ; évaluer l'intégration MoonEP / FlashKDA
Valider Kimi Code / agents multi-modèles OpenClaw dans une vraie session GUI macOS (voir VNCMac ci-dessous)
La publication coïncide avec WAIC 2026 et quelques jours après les accusations US de distillation industrielle contre le modèle Fable d'Anthropic. Le ministère du Commerce chinois a répondu le 28 juillet. Trois jours plus tard, Alibaba a dévoilé Qwen3.8-Max-Preview (2,4T) — la course open weight entre dans le « club des 3T ».
Non selon les standards OSI. Open weight : poids, rapport et partie de l'infra publics ; données et code d'entraînement complets non.
Oui dans la plupart des cas. MaaS > 20 M$ sur 12 mois ou 100 M MAU / 20 M$ mensuels déclenchent des conditions supplémentaires.
64+ accélérateurs sur un supernœud. Sinon API ou OpenRouter.
Derrière les meilleurs modèles fermés sur SWE-bench (93,4 % vs 95–97 %), mais le plus fort open weight du marché.
~3× paramètres, AttnRes + Per-Head Muon, contexte et multimodal élargis ; nouveau seuil MaaS.
K3 a transformé le plus grand titre open weight en téléchargement de 1,56 To — mais open weight n'est pas open source, et la plupart des équipes consommeront encore K3 via API. Si votre machine principale est Windows ou Linux et que vous avez besoin d'une vraie GUI macOS pour Kimi Code, le routage OpenClaw ou des baselines de build iOS, acheter un Mac coûte cher et SSH ne clique pas les dialogues de permission. Louez un Mac distant VNCMac à l'heure, validez vos agents en VNC et arrêtez en fin de projet. Voir les forfaits location Mac ou notre test Kimi K3 du 17 juillet.
Sources : blog Moonshot AI, Hugging Face, Vals AI, Artificial Analysis, VentureBeat, Simon Willison. Vérifiez les données officielles avant toute décision de production.