Poids ouverts 22 juillet 2026 ~22 min Kimi K3 27 juillet

Kimi K3 poids ouverts :
date, benchmarks & réalité d'exécution

Cinq jours avant le drop · Modified MIT · MoE 2,8T · contexte 1M · 1,4 To @ 4-bit · API 3/15 $

Concept de comparaison benchmark Kimi K3 vs Claude Fable 5 publication poids ouverts

Réponse directe : Moonshot AI publiera les poids complets de Kimi K3 — modèle MoE de 2,8 billions de paramètres avec fenêtre de 1 048 576 tokens — le 27 juillet 2026 sous licence Modified MIT sur Hugging Face, avec un rapport technique. L'API et l'écosystème Kimi sont actifs depuis le 16 juillet. Ce guide couvre la chronologie 16–27 juillet, les specs, les benchmarks face à Claude Fable 5 et GPT-5.6 Sol, le coût API réel avec cache, la réalité matérielle du self-hosting, l'impact industriel et une checklist du jour J — sans prétendre que le modèle tourne sur un portable.

01

En bref : ce qui change le 27 juillet

  • 16 juillet : API, Kimi App, Kimi Work, Kimi Code en ligne ; Artificial Analysis publie le score indépendant 57,1.
  • 17 juillet : ouverture du WAIC à Shanghai ; médias d'État présentent K3 comme jalon national.
  • 27 juillet : poids ouverts complets + rapport technique (architecture, entraînement, évals).

En une phrase : K3 n'est pas un « tueur de Fable 5 ». Il se classe 3e à l'AA Intelligence Index (57,1 vs 59,9 / 58,9), mais offre une capacité proche du frontier pour environ un tiers du coût, plus le contexte 1M et des poids téléchargeables — deux atouts impossibles chez les modèles fermés.

Pièges avant de vous engager

  1. 01

    Deux dates de lancement : API live ≠ poids téléchargeables.

  2. 02

    Clickbait « exécution locale » : ~1,4 To en 4-bit, 64+ accélélateurs — pas du Ollama sur laptop.

  3. 03

    Prime des modèles fermés : coût par tâche Fable 5 ~65,8 % plus élevé (AA : K3 à 0,94 $).

  4. 04

    Coût KV long contexte : beaucoup de modèles annoncent de longues fenêtres qu'ils ne peuvent pas payer en prod.

  5. 05

    Interrupteur réglementaire : les poids fermés peuvent être retirés ; les poids ouverts publiés ne le peuvent pas.

02

Date de sortie : API vs poids ouverts

DateÉvénement
2026-07-16API + stack Kimi live ; benchmark Artificial Analysis
2026-07-17WAIC ; cadrage jalon national
2026-07-27Téléchargement Hugging Face + rapport technique

L'intention de recherche sur kimi k3 release date, kimi k3 download et kimi k3 hugging face pic autour du 27 juillet. Mettez à jour dateModified et remplacez « prévu » par « disponible » dans les heures suivant le drop.

03

Qu'est-ce que Kimi K3 ? Specs clés

SpecValeur
Paramètres2,8 billions (plus grande publication poids ouverts à ce jour)
ArchitectureMoE sparse : Stable LatentMoE, 16 experts actifs sur 896 par token
AttentionKimi Delta Attention (KDA) + AttnRes + Gated MLA
Contexte1 048 576 tokens
ModalitésVision native (texte + image ; vidéo en produit) ; sortie texte
Format des poidsPoids MXFP4 + activations MXFP8 (entraînement basse précision natif)
Scaling vs K2~2,5× d'efficacité à compute égal
Décodage long contexteJusqu'à 6,3× plus rapide à 1M tokens (KDA)
04

Benchmarks vs Claude Fable 5 et GPT-5.6 Sol

ModèleAA Intelligence Index
Claude Fable 559,9
GPT-5.6 Sol58,9
Kimi K357,1 (#3 sur 189)

Où Kimi K3 gagne

  • Frontend Code Arena #1 (préférence dev en aveugle sur Fable et Sol)
  • Automation Bench, SpreadsheetBench 2 #1
  • BrowseComp 91,2 #1 (stratégie 1M sans compression ~90,4+)
  • SWE Marathon 42,0 — sessions code longues (GPT-5.5 / GLM-5.2 s'effondrent en teens)
  • Terminal Bench 2.1 88,3 — quasi-parité avec Sol 88,8
  • Program Bench 77,8 — devant Sol 77,6 de justesse
  • FrontierSWE 81,2 — bien au-dessus de Sol 71,3 (sous Fable 86,6)

Où il reste en retrait

  • GDPval v2 Elo 1668–1687 vs Fable 1760 / Sol 1748
  • DeepSWE 67,5 vs Sol 73,0
  • Taux d'hallucination en hausse vs K2.6 (Moonshot l'a reconnu) ; signalements Reddit vs top closed
  • Finition et variance de session derrière Fable 5 / Sol

Moonshot a rarement admis être derrière Fable 5 et Sol au global, citant la sensibilité aux harness et un comportement trop zélé sur intent ambigu. Évals du 16 juillet 2026, harness différents — traiter comme directionnel jusqu'aux re-runs indépendants.

05

Tarifs API : coût réel avec cache

PostePrix par 1M tokens
Input (cache miss)3,00 $
Input (cache hit, automatique)0,30 $
Output15,00 $
  • Le plus cher parmi les vendeurs chinois, mais sous le coût par tâche de Claude Opus 4.8.
  • AA mesure 0,94 $ par tâche : 9,4 % sous GPT-5.6 Sol, 65,8 % sous Claude Fable 5.
  • Workloads code rapportent 90 %+ de cache hit — coût input effectif bien sous le tarif affiché.
06

Open source ? Poids ouverts vs open source

Employez poids ouverts dans titres et snippets — pas « open source » seul. K3 publie poids + rapport technique sous Modified MIT ; code et données d'entraînement restent fermés. Cette distinction compte sur r/LocalLLaMA et HN, et constitue un FAQ à forte intention.

Le 27 juillet, attendez : upload org HF Moonshot, texte LICENSE, support vLLM KDA/prefix-cache, puis builds Ollama/GGUF suivant le modèle K2.

07

Exécution locale ? Exigences matérielles

Réponse honnête : pas sur matériel grand public.

  • ~1,4 To en 4-bit ; Moonshot recommande un supernœud 64+ accélérateurs avec parallélisme expert et tensoriel.
  • Référence : K2.7 Code (1T) exigeait ~577 Go VRAM en INT4 ; K3 est 2,8× cette échelle.
  • Self-host seulement pour residency, fine-tuning ou dépenses API justifiant le fer — sinon API (3/15 $) ou inférence cloud.

Checklist du jour de publication

  1. 01

    Complétude du repo HF (shards, index, config)

  2. 02

    LICENSE verbatim (termes Modified MIT)

  3. 03

    Artefacts quantisés (MXFP4 / GGUF)

  4. 04

    Commandes de lancement vLLM / SGLang et notes HW minimales

  5. 05

    Re-runs indépendants long contexte et BrowseComp

08

Pourquoi le drop du 27 juillet compte

  1. 01

    Écart frontier presque comblé : spread AA réduit à quelques points — prime closed-only plus difficile à justifier.

  2. 02

    Géopolitique : timing WAIC ; les USA ont brièvement delisté Anthropic Fable/Mythos (restauré 1er juillet) — les régulateurs bloquent l'API fermée, pas les poids déjà publiés.

  3. 03

    Vague chinoise : GLM-5.2, DeepSeek V4 Pro (1,6T), MiniMax — K3 est le sommet du push poids ouverts.

  4. 04

    Retour de Moonshot : du creux post-DeepSeek R1 à la cadence K2 → K2.5 → K3 poids ouverts.

Matrice de décision

ScénarioVoiePourquoi
Tester maintenant / agents codeAPI ou Kimi CodeLive depuis le 16 juillet ; cache réduit le coût
Post-27/7 fine-tune / residencySelf-host (64+ GPU)Poids complets + conformité requis
Sensible au coûtAPI DeepSeek V4 Pro3,48 $/M output
Raisonnement long horizonClaude Fable 5Lead GDPval / indice global
Attendre Ollama/GGUFSuivre les follow-ons K2Quantizations consumer en retard sur le drop HF

Sources : kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16 juillet), VentureBeat, Northflank, r/LocalLLaMA, Hacker News.

09

FAQ

27 juillet 2026 sur Hugging Face avec rapport technique. API disponible depuis le 16 juillet.

Poids ouverts sous Modified MIT — pas open source intégral (stack et données non publiées).

3 $ / 0,30 $ cache / 15 $ par million de tokens ; ~0,94 $ par tâche en tests AA.

Non — ~1,4 To en 4-bit, 64+ accélérateurs recommandés. Utilisez l'API.

Indice global : non (57,1 vs 59,9). Plusieurs benchmarks code/UI : oui. Coût par tâche : bien inférieur.

Modified MIT — confirmer les termes dans LICENSE Hugging Face le 27 juillet.

Clôture

Les poids ouverts du 27 juillet ne réduisent pas magiquement un modèle 2,8T sur votre GPU de bureau. La plupart consommeront K3 via API, Kimi Code ou OpenRouter ; le self-hosting reste un pari à l'échelle entreprise. Si votre workflow exige aussi une vraie GUI macOS — agents Kimi Code, routage OpenClaw, dialogues de signature Xcode qu'un SSH ne peut cliquer — acheter du matériel coûte cher et les nœuds idle se déprécient vite. La location Mac distant VNCMac offre un bureau VNC à la demande pour valider le code long contexte et les flux agent, puis arrêter la facturation en fin de sprint. Voir forfaits location Mac ou notre test Kimi K3 du 17 juillet pour l'architecture en détail.