Cinq jours avant le drop · Modified MIT · MoE 2,8T · contexte 1M · 1,4 To @ 4-bit · API 3/15 $
Réponse directe : Moonshot AI publiera les poids complets de Kimi K3 — modèle MoE de 2,8 billions de paramètres avec fenêtre de 1 048 576 tokens — le 27 juillet 2026 sous licence Modified MIT sur Hugging Face, avec un rapport technique. L'API et l'écosystème Kimi sont actifs depuis le 16 juillet. Ce guide couvre la chronologie 16–27 juillet, les specs, les benchmarks face à Claude Fable 5 et GPT-5.6 Sol, le coût API réel avec cache, la réalité matérielle du self-hosting, l'impact industriel et une checklist du jour J — sans prétendre que le modèle tourne sur un portable.
En une phrase : K3 n'est pas un « tueur de Fable 5 ». Il se classe 3e à l'AA Intelligence Index (57,1 vs 59,9 / 58,9), mais offre une capacité proche du frontier pour environ un tiers du coût, plus le contexte 1M et des poids téléchargeables — deux atouts impossibles chez les modèles fermés.
Deux dates de lancement : API live ≠ poids téléchargeables.
Clickbait « exécution locale » : ~1,4 To en 4-bit, 64+ accélélateurs — pas du Ollama sur laptop.
Prime des modèles fermés : coût par tâche Fable 5 ~65,8 % plus élevé (AA : K3 à 0,94 $).
Coût KV long contexte : beaucoup de modèles annoncent de longues fenêtres qu'ils ne peuvent pas payer en prod.
Interrupteur réglementaire : les poids fermés peuvent être retirés ; les poids ouverts publiés ne le peuvent pas.
| Date | Événement |
|---|---|
| 2026-07-16 | API + stack Kimi live ; benchmark Artificial Analysis |
| 2026-07-17 | WAIC ; cadrage jalon national |
| 2026-07-27 | Téléchargement Hugging Face + rapport technique |
L'intention de recherche sur kimi k3 release date, kimi k3 download et kimi k3 hugging face pic autour du 27 juillet. Mettez à jour dateModified et remplacez « prévu » par « disponible » dans les heures suivant le drop.
| Spec | Valeur |
|---|---|
| Paramètres | 2,8 billions (plus grande publication poids ouverts à ce jour) |
| Architecture | MoE sparse : Stable LatentMoE, 16 experts actifs sur 896 par token |
| Attention | Kimi Delta Attention (KDA) + AttnRes + Gated MLA |
| Contexte | 1 048 576 tokens |
| Modalités | Vision native (texte + image ; vidéo en produit) ; sortie texte |
| Format des poids | Poids MXFP4 + activations MXFP8 (entraînement basse précision natif) |
| Scaling vs K2 | ~2,5× d'efficacité à compute égal |
| Décodage long contexte | Jusqu'à 6,3× plus rapide à 1M tokens (KDA) |
| Modèle | AA Intelligence Index |
|---|---|
| Claude Fable 5 | 59,9 |
| GPT-5.6 Sol | 58,9 |
| Kimi K3 | 57,1 (#3 sur 189) |
Moonshot a rarement admis être derrière Fable 5 et Sol au global, citant la sensibilité aux harness et un comportement trop zélé sur intent ambigu. Évals du 16 juillet 2026, harness différents — traiter comme directionnel jusqu'aux re-runs indépendants.
| Poste | Prix par 1M tokens |
|---|---|
| Input (cache miss) | 3,00 $ |
| Input (cache hit, automatique) | 0,30 $ |
| Output | 15,00 $ |
Employez poids ouverts dans titres et snippets — pas « open source » seul. K3 publie poids + rapport technique sous Modified MIT ; code et données d'entraînement restent fermés. Cette distinction compte sur r/LocalLLaMA et HN, et constitue un FAQ à forte intention.
Le 27 juillet, attendez : upload org HF Moonshot, texte LICENSE, support vLLM KDA/prefix-cache, puis builds Ollama/GGUF suivant le modèle K2.
Réponse honnête : pas sur matériel grand public.
Complétude du repo HF (shards, index, config)
LICENSE verbatim (termes Modified MIT)
Artefacts quantisés (MXFP4 / GGUF)
Commandes de lancement vLLM / SGLang et notes HW minimales
Re-runs indépendants long contexte et BrowseComp
Écart frontier presque comblé : spread AA réduit à quelques points — prime closed-only plus difficile à justifier.
Géopolitique : timing WAIC ; les USA ont brièvement delisté Anthropic Fable/Mythos (restauré 1er juillet) — les régulateurs bloquent l'API fermée, pas les poids déjà publiés.
Vague chinoise : GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 est le sommet du push poids ouverts.
Retour de Moonshot : du creux post-DeepSeek R1 à la cadence K2 → K2.5 → K3 poids ouverts.
| Scénario | Voie | Pourquoi |
|---|---|---|
| Tester maintenant / agents code | API ou Kimi Code | Live depuis le 16 juillet ; cache réduit le coût |
| Post-27/7 fine-tune / residency | Self-host (64+ GPU) | Poids complets + conformité requis |
| Sensible au coût | API DeepSeek V4 Pro | 3,48 $/M output |
| Raisonnement long horizon | Claude Fable 5 | Lead GDPval / indice global |
| Attendre Ollama/GGUF | Suivre les follow-ons K2 | Quantizations consumer en retard sur le drop HF |
Sources : kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16 juillet), VentureBeat, Northflank, r/LocalLLaMA, Hacker News.
27 juillet 2026 sur Hugging Face avec rapport technique. API disponible depuis le 16 juillet.
Poids ouverts sous Modified MIT — pas open source intégral (stack et données non publiées).
3 $ / 0,30 $ cache / 15 $ par million de tokens ; ~0,94 $ par tâche en tests AA.
Non — ~1,4 To en 4-bit, 64+ accélérateurs recommandés. Utilisez l'API.
Indice global : non (57,1 vs 59,9). Plusieurs benchmarks code/UI : oui. Coût par tâche : bien inférieur.
Modified MIT — confirmer les termes dans LICENSE Hugging Face le 27 juillet.
Les poids ouverts du 27 juillet ne réduisent pas magiquement un modèle 2,8T sur votre GPU de bureau. La plupart consommeront K3 via API, Kimi Code ou OpenRouter ; le self-hosting reste un pari à l'échelle entreprise. Si votre workflow exige aussi une vraie GUI macOS — agents Kimi Code, routage OpenClaw, dialogues de signature Xcode qu'un SSH ne peut cliquer — acheter du matériel coûte cher et les nœuds idle se déprécient vite. La location Mac distant VNCMac offre un bureau VNC à la demande pour valider le code long contexte et les flux agent, puis arrêter la facturation en fin de sprint. Voir forfaits location Mac ou notre test Kimi K3 du 17 juillet pour l'architecture en détail.