Volume réel de tokens · 46 % part chinoise · Usage vs qualité · Couche Apps · Perspectives août
Si vous choisissez encore un LLM d'après un benchmark de deux mois, vous êtes déjà en retard. En bref : OpenRouter ne note pas les labs — il route du trafic réel payant. Au 25 juillet 2026, le Mimo V2.5 de Xiaomi mène à ~1,4 T tokens/jour, les labs d'origine chinoise détiennent ~46 % du volume, et le rang d'usage n'est pas un signal de qualité — le marché se scinde en barbell entre volume open-weight bon marché et pricing power frontier fermé sur les tâches difficiles. Ce guide couvre : Top 12 modèles, part par fournisseur, le classement Apps (Hermes / Kilo Code / OpenClaw), perspectives août, conseils de routage par rôle, et une checklist Mac en cinq étapes. Voir aussi notre rétrospective juin et le guide API OpenRouter.
Au 25 juillet, les trois premiers modèles par volume quotidien de tokens sont Mimo V2.5 (1,4 T/jour), DeepSeek V4 Flash (943,9 B/jour) et Tencent Hy3 (590 B/jour). Sept des dix premiers modèles sont chinois ; NVIDIA Nemotron 3 Ultra, Claude et Gemini ancrent encore le côté US.
| Rang | Modèle | Lab | Tokens/jour | Total 30 j |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4 T | 31,2 T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9 B | 23,6 T |
| 3 | Hy3 | Tencent | 590 B | 23,4 T |
| 4 | Nemotron 3 Ultra 550B (gratuit) | NVIDIA | 428,6 B | 9 T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7 B | 11,6 T |
| 6 | GLM 5.2 | Z.ai | 316,7 B | 13,3 T |
| 7 | MiniMax M3 | MiniMax | 262,5 B | 15,1 T |
| 8 | Step 3.7 Flash | StepFun | 204,8 B | 5,9 T |
| 9 | Kimi K3 | Moonshot | 157,6 B | 1,6 T (nouveau) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3 B | 417,3 B |
| 11 | Gemini 3 Flash Preview | 106,3 B | 4 T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5 B | 3,6 T |
Au niveau fournisseur, les labs chinois représentent désormais ~46 % du volume de tokens identifié — contre moins de 2 % il y a un an. Les labs US (OpenAI, Anthropic, Google) sont passés de ~70 % mi-2025 à 30–36 %. C'est une question de prix : DeepSeek V4 Flash affiche environ 0,05–0,14 $/M en entrée contre GPT-5.5 près de 5 $/M — un écart d'environ 35×.
À citer : DeepSeek reste le fournisseur n°1 le plus stable (~16–18 %), mais la couronne « modèle du mois » continue de tourner — MiniMax M2.5 en février, MiMo-V2-Pro en avril, Mimo V2.5 en juillet.
Un modèle bon marché et rapide branché sur une app grand public à fort trafic peut dépasser un modèle plus capable réservé aux 10 % de travail les plus difficiles.
Confondre volume et capacité : Roleplay, chat et code léger dominent le trafic open-model — pas le raisonnement enterprise difficile.
Ignorer le mix de dépenses : Par catégorie, chat 35,7 %, workflows agentiques 30,4 %, code 26,5 % — mais en Classification, Claude Sonnet 4.6 et Opus 4.7 sont ex æquo à 13,5 % de dépenses chacun.
Volatilité quotidienne : Claude Opus 4.8 était top 10 le 24/07 ; Ling 3.0 Flash l'a sorti du top 12 le 25/07. Citez toujours une date de coupure.
Poids croissant de la sécurité : La divulgation d'évasion de sandbox d'OpenAI cette semaine poussera le « historique de sécurité fournisseur » dans les grilles enterprise.
Verrouillage mono-modèle : Claude Opus 5 (24 juillet) mène FrontierBench v0.1 à 43,3 % tout en gardant le pricing Opus à 5 $/25 $ — les labs frontier conservent le pricing power sur les tâches difficiles.
| Segment | Charges typiques | Classement volume | Dépenses tâches difficiles |
|---|---|---|---|
| Fort volume, tolérant | Chat, créatif, roleplay, code routinier | Modèles Flash chinois open | Faible part |
| Faible tolérance, haute valeur | Raisonnement complexe, planification agent, classification | Rarement top 10 | Claude / GPT frontier |
Les classements modèles montrent quel cerveau est populaire. Le classement Apps montre ce que ce cerveau fait :
| Rang | App | Type | Part (~) |
|---|---|---|---|
| 1 | Hermes Agent | Agent personnel / CLI | ~45 % |
| 2 | Kilo Code | Agent de code | ~13 % |
| 3 | OpenClaw | Agent généraliste | ~9 % |
| 4 | Claude Code | Agent de code | ~6 % |
| 5 | Descript | Contenu | ~4,5 % |
| 6–10 | pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline | Agent / companion / roleplay | ~1,7 %–3,3 % chacun |
Cline → Roo Code → Kilo Code sont trois forks de la même lignée ; le plus jeune, Kilo Code, a dépassé ses deux ancêtres. L'avantage du first-mover en outillage dev open-source ne dure clairement pas.
Le rapport State of AI d'OpenRouter × a16z a trouvé que le roleplay créatif représente plus de la moitié de l'usage des modèles open. Si votre vision de l'IA ne vient que des titres enterprise, vous ratez la moitié du marché.
La part open-weight chinoise grimpera probablement vers ou au-delà de 50 % sauf si un grand fournisseur US baisse ses prix.
Le n°1 mensuel continuera de tourner entre Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot.
Anthropic pourrait lancer un tier volume moins cher — Opus 5 est leur quatrième flagship en moins de deux mois.
Les poids 1,4 To de Kimi K3 devraient voir une quantification communautaire sous 2–4 semaines.
Sécurité et gouvernance deviennent des critères de sélection — la législation US « AI Kill Switch » et un cadre de revue pré-release de la Maison Blanche sont attendus avant août.
| Modèle | Entrée/M | Sortie/M | Positionnement |
|---|---|---|---|
| DeepSeek V4 Flash | ~0,05–0,14 $ | ~0,24–0,28 $ | Meilleur rapport qualité-prix ; code agentique |
| MiniMax M3 | 0,10 $ | 1,21 $ | Long contexte à petit budget |
| GLM 5.2 | 0,45 $ | 3,31 $ | Planification style Opus open-weight |
| Kimi K3 | ~3 $ | ~15 $ | 1,4 To de poids ouverts |
| Claude Opus 5 | 5 $ (fast 10 $) | 25 $ (fast 50 $) | Frontier fermé ; tâches difficiles |
| Rôle | Approche recommandée |
|---|---|
| Indé / petite équipe | Utilisez OpenRouter comme bac à sable ; commencez le code sur DeepSeek V4 Flash et GLM 5.2, réservez Opus 5 / GPT-5.6 pour les étapes qui échouent vraiment |
| Lead infra | Ne sélectionnez pas sur le rang d'usage seul ; tiercez les routes par risque de tâche et ajoutez la sécurité fournisseur aux grilles |
| Builder agent / devtool | Étudiez l'histoire du fork Kilo Code ; le volume companion/divertissement est réel même s'il est invisible dans la presse enterprise |
Sur Mac avec Claude Code, OpenClaw ou Kilo Code, implémentez le routage barbell dans l'ordre :
Tiercez les tâches : S-tier (5 % les plus durs) → modèles frontier fermés ; A-tier → DeepSeek / GLM ; B-tier → classe Flash.
Routeur unique : OpenRouter ou config models OpenClaw — pas de fournisseur codé en dur dans l'app.
Alertes de dépenses : Plafonds journaliers/hebdomadaires par modèle pour éviter les boucles Opus par erreur.
Sondes qualité : 10–20 prompts de régression fixes avant de basculer le trafic vers un nouveau modèle.
Acceptation VNC : OAuth, Gateway, browser MCP et dialogues de permission vérifiés en session Mac graphique co-localisée avec l'agent.
Une clé, 400+ modèles.
Lire →61 % part chinoise et perspectives Q3.
Lire →Double actualité fin juillet.
Lire →Non — il trie par volume de tokens payants. Sur les dépenses en tâches difficiles, Claude Sonnet 4.6 et Opus 4.7 restent ex æquo en tête.
Au 25 juillet, Xiaomi Mimo V2.5 à ~1,4 T tokens/jour, puis DeepSeek V4 Flash et Tencent Hy3.
Environ 46 % combinés, contre moins de 2 % il y a un an ; les labs US tournent autour de 30–36 %.
L'agent open auto-améliorant de Nous Research détient ~45 % des tokens d'apps — automatisation personnelle haute fréquence, pas un vote qualité.
La ligne à retenir de juillet : capacité et popularité divergent. Les modèles open-weight chinois ont acheté la moitié du marché avec le prix ; les labs US frontier fermé défendent l'autre moitié sur les tâches difficiles et la crédibilité sécurité.
Si votre poste quotidien est Windows ou Linux mais que vous avez besoin de macOS pour Claude Code, OpenClaw ou Kilo Code, acheter un Mac ajoute amortissement et contraintes de veille ; le SSH seul rate OAuth et les dialogues de permission. Louer un Mac distant VNCMac avec VNC vous permet de valider le routage barbell face au tableau OpenRouter sur la même machine que votre Gateway.
Données au 25 juillet 2026 — vérifiez les chiffres en direct sur openrouter.ai/rankings avant de citer.