Bilan IA 25 juillet 2026 ~24 min Claude Opus 5 Kimi K3

Claude Opus 5 à moitié prix —
Kimi K3 dans la controverse sur la distillation

Opus 5 modèle par défaut Claude Max · Maison Blanche accuse K3 · preuves Greenblatt

Claude Opus 5 release et controverse distillation Kimi K3 bilan IA

Deux titres, un même enjeu — rapport qualité-prix et origine réelle de l'intelligence des modèles : le 24 juillet 2026, Anthropic lance Claude Opus 5 comme modèle par défaut de Claude Max ; le Kimi K3 de Moonshot AI, tout juste sorti, est accusé par la Maison Blanche de distillation industrielle, tandis que des chercheurs montrent que K3 se présente comme Claude et révèle des ID de déploiement internes. Ce guide couvre benchmarks, tarifs, sécurité et rétention de données d'Opus 5, specs de K3, chronologie de la controverse, analyse Greenblatt, accusations d'Anthropic en février, réactions communautaires, le thème du coût et une FAQ pour les développeurs.

01

Claude Opus 5 : pas le flagship, mais peut-être le Claude le plus utile

Le 24 juillet 2026 (heure du Pacifique), Anthropic a publié Claude Opus 5 (ID : claude-opus-5) comme modèle par défaut Claude Max et version la plus puissante pour Claude Pro. Positionnement : modèle du quotidien — intelligence proche de Fable 5 à moitié prix.

ÉlémentDétail
TarifsInput 5 $ / M tokens, output 25 $ / M tokens (identique à Opus 4.8)
Contexte1 M tokens (unique palier par défaut)
Output max128K tokens
RaisonnementThinking activé par défaut ; paramètre Effort contrôle la profondeur
PlateformesClaude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry
Mode Fast~2,5× plus rapide, prix ×2 (comme Opus 4.8)
Rétention donnéesPas de rétention forcée par défaut (Fable 5 / Mythos 5 : opt-in 30 jours)

Benchmarks clés (officiel Anthropic)

  • Frontier-Bench v0.1 (ingénierie logicielle) : bat tous les modèles, plus de 2× Opus 4.8, coût par tâche inférieur
  • CursorBench 3.2 : max effort à 0,5 % du pic Fable 5, coût divisé par deux ; meilleur rapport qualité-prix sur high/xhigh/max
  • ARC-AGI 3 : score le suivant
  • Zapier AutomationBench : ~1,5× le taux de réussite ; effort minimal bat tout le reste ; workflows account health 100 %
  • OSWorld 2.0 : leader à tout coût ; avec ~⅓ du budget Fable 5, dépasse le meilleur score Fable 5
  • Recherche / sciences du vivant : biologie structurale, chimie organique, bioinfo au-dessus d'Opus 4.8 ; spectre→structure +10,2 pts ; variants protéiques +7,7 pts

Retours clients : Cursor : « near Fable 5 intelligence at Opus speed and cost » ; Zapier : tête d'AutomationBench sans plus de tokens ; Box : +11 % analyse de données, +17 % due diligence, +8 % précision globale.

Alignement et sécurité

Opus 5 est présenté comme le modèle le mieux aligné à ce jour : moins de tromperie, plus difficile à détourner, comportements irréversibles mieux évités. Sur les capacités à double usage (cybersécurité, biosécurité), volontairement pas à la frontière — Mythos 5 (accès restreint) y domine. Classificateur cybersécurité ~85 % plus permissif que Fable 5 (failles source oui, scans binaires/exploits non). Requêtes biosécurité bloquées par Fable 5 : routées vers Opus 5, pas Opus 4.8.

DateÉvénement
2026-06-09Sortie Claude Fable 5 / Mythos 5
2026-07-01Fable 5 disponible publiquement
2026-07-24Claude Opus 5, modèle par défaut Claude Max
02

Matrice de décision : Opus 5 vs Fable 5

  1. 01

    Prix Fable 5 : ~10 $/50 $ par M input/output — workflows agent ×2

  2. 02

    Rétention 30 jours : Fable 5 / Mythos 5 exigent un opt-in — frein compliance

  3. 03

    Surcapacité : La plupart des tâches code/auto n'exigent pas Mythos

  4. 04

    Migration : Rester sur l'ancien Opus = manquer ~2× en software engineering

  5. 05

    Validation : Comparaisons Cursor / Claude Code demandent souvent GUI macOS et OAuth

DimensionClaude Opus 5Claude Fable 5
Prix relatif~50 % (5 $/25 $)~10 $/50 $
CursorBench 3.2 (max)0,5 % sous le picRéférence pic
Rétention par défautNon forcéeOpt-in 30 jours
Défaut Claude MaxOui (dès 24/07)Non
Frontière dual-useVolontairement pas au sommetMythos 5 (restreint)
03

Kimi K3 : premier modèle open-weight 2,8T et benchmarks

Moonshot AI a lancé Kimi K3 le 16 juillet 2026 : 2,8 billions de paramètres (premier open-weight de classe 3T) ; MoE sparse, 896 experts, 16 actifs par token (~50 Md actifs) ; Kimi Delta Attention (KDA) + Attention Residuals + Stable LatentMoE ; efficacité d'entraînement ~2,5× vs K2 ; contexte 1 M tokens et vision native. Poids complets promis pour le 27 juillet (non publiés à la rédaction).

BenchmarkScoreNote
GPQA-Diamond93,5 %Meilleur open-weight au lancement
Terminal-Bench 2.188,3 %0,5 pt sous GPT-5.6 Sol
BrowseComp91,2 %Record au lancement
Humanity's Last Exam (outils)56,0 %
MCP Atlas84,2 %
Program Bench77,8 %Meilleur global
SWE Marathon42,0 %Meilleur global
DeepSearchQA (F1)95,0 %

Moonshot se place juste derrière Claude Fable 5 et GPT-5.6 Sol, bien moins cher. Suite : compte à rebours poids ouverts.

04

Controverse distillation : Maison Blanche et Anthropic

Les 22–23 juillet 2026, le directeur OSTP Michael Kratsios a accusé sur X Moonshot de « distillation industrielle massive et clandestine » visant Fable d'Anthropic — plus usage présumé de puces Nvidia GB300 non exportées (Grace Blackwell 300, peut-être via la Thaïlande). Citation : « Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable. »

Le secrétaire au Trésor Scott Bessent évoque des « filigranes » de modèles US dans des modèles chinois — sans précision. Kratsios n'a publié aucune preuve ; Moonshot n'a pas répondu sur l'entraînement.

Pas la première fois : dès février 2026, Anthropic accusait Moonshot, DeepSeek et MiniMax d'« attaques de distillation industrielle » — plus de 3,4 M d'interactions API anormales chez Moonshot, « nettement hors usage normal », parfois remontées à la direction. Moonshot n'a jamais confirmé ni démenti.

DateÉvénement
2026-02Anthropic : premières accusations publiques
2026-07-01Fable 5 public
2026-07-16Release API/produit Kimi K3
2026-07-22/23Maison Blanche : distillation + puces
2026-07-23TechCrunch : experts doutent de la chronologie
~2026-07-24Ryan Greenblatt : « K3 se dit Claude »
2026-07-27 (prévu)Poids ouverts K3 — vérification externe
05

Objection des experts : la chronologie ne tient pas

TechCrunch (23 juillet) cite des chercheurs indépendants : Fable 5 n'était public que depuis le 1er juillet — K3 est sorti le 16, soit 14 jours. Une distillation profonde (surtout RL avec millions de scores enseignant) est peu crédible dans ce délai.

"

Braden Hancock (Laude Institute / Snorkel AI) : « I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks. »

"

Nathan Lambert (Allen Institute for AI) : à mesure que les modèles chinois approchent la frontière, le levier de la distillation diminue ; le RL coûteux fait la différence. Si la distillation suffisait, tout le monde aurait rattrapé.

Double standard : Elon Musk a admis que xAI a distillé OpenAI pour Grok — la frontière entre « pratique courante » et « vol industriel » reste politique.

06

Preuve la plus solide : K3 se présente comme Claude

Ryan Greenblatt (Redwood Research) a publié vers le 24 juillet une analyse (GitHub : rgreenblatt/which_claude_is_k3) :

  • K3 se dit Claude avec une fréquence anormale et cite des ID internes comme claude-opus-4-5-20250929, claude-sonnet-4-5-20250929
  • Le vrai Claude Sonnet 4.5 dit seulement « Je suis Claude Sonnet 4.5 » ; Opus 4.5 cite rarement ou mal ces ID
  • Greenblatt : l'élève connaît les métadonnées de déploiement mieux que le professeur — difficile à expliquer par imitation de style ; plutôt des données d'entraînement avec logs API
  • K3 verrouillé sur l'ère Claude 4.5 (fin 2025), pas Fable/Mythos ; K2 montre des signaux Sonnet 4 plus anciens — schéma de rattrapage générationnel

Précision : cela ne prouve pas directement la distillation — contamination ou jeux de données synthétiques aussi. Avec les données de février d'Anthropic, c'est l'indice technique le plus fort. Mots-clés différenciants : Why does Kimi K3 say it's Claude / Kimi K3 self-identifies as Claude.

07

Communauté et suspense du 27 juillet

Reddit r/LocalLLaMA : enthousiasme (« open vs closed en jours, pas mois ») ; moqueries sur 2,8T injouables en local ; pragmatiques : prix bas et moins de modération plutôt que « battre Fable 5 ».

Poids complets seulement le 27 juillet — d'où l'impossibilité de vérifier indépendamment architecture et benchmarks. La polémique touche export de puces et restrictions possibles sur les open weights chinois (cf. affaire Supermicro, mai 2026).

08

Le fil rouge : le rapport qualité-prix

Opus 5 répond « moitié prix, quasi flagship ». K3 avec « open weight + bas coût + moins de limites ». La controverse distillation pose la question : optimisation réelle ou intelligence empruntée ?

Conseil pratique : compliance et rétention → Opus 5 ; coût minimal et open weights → attendre le 27/07 et des tests indépendants.

  1. 01

    Compliance : Opus 5 + pas de rétention forcée + API Anthropic

  2. 02

    Coût minimal : poids K3 + réplication de benchmarks

  3. 03

    Validation agent : Cursor / Claude Code / Kimi Code sur tâches type CursorBench

  4. 04

    Session GUI : OAuth et gateway sur Mac distant VNC

  5. 05

    Mise à jour 27/07 : longue traîne « télécharger K3 » / « distillation prouvée ? »

FAQ

Questions fréquentes

Environ la moitié : 5 $/25 $ vs ~10 $/50 $ par million input/output. CursorBench max est à moins de 1 % du pic Fable 5.

Oui — depuis le 24 juillet 2026, modèle par défaut Claude Max et version Pro la plus puissante.

Non prouvé. Maison Blanche sans preuves publiques ; chronologie contestée ; statistique Greenblatt (« identité Claude + ID internes ») = indice technique le plus fort.

Officiellement le 27 juillet 2026. Non publiés à la rédaction.

Open weights (poids téléchargeables), pas fully open source. Licence probablement Modified MIT — vérifier LICENSE le 27/07.

Conclusion

Opus 5 rend l'agent flagship abordable au quotidien ; K3 pousse la frontière en open weight — mais accusations de distillation et statistiques Greenblatt rappellent : benchmarks, compliance, rétention et provenance comptent autant.

Pour tester Cursor, Claude Code ou Kimi Code avec Opus 5 et K3, Windows/Linux bloque souvent sur OAuth, permissions macOS et GUI gateway. VNCMac Mac distant + VNC : session graphique sur le même hôte que le gateway — validation multi-modèles, pas seulement les titres.