Tarifs IA 17 août 2026 environ 18 min DeepSeek Qwen3.8

Pourquoi DeepSeek vient d'augmenter l'API jusqu'à 1 100 %
juste après l'offensive open-weight chinoise

12–17 août 2026 · hausse de pointe de plus de 1 100 % · 2,4 T de poids ouverts · même socle, post-entraînement

Baies de datacenter aux voyants bleus, image de la capacité d'inférence et de la pression tarifaire API

En tête : En cinq jours, trois laboratoires chinois de premier plan ont joué des coups qui se contredisent en surface et se répondent en profondeur. DeepSeek a relevé certaines tranches d'API jusqu'à 1 100 %. Alibaba, la même semaine, a ouvert un vaisseau de 2,4 billions de paramètres jamais publié en poids. Zhipu a livré GLM-5.3 et a multiplié par environ six les scores de code avec le même socle — sans nouvel pré-entraînement. Ensemble, ces trois gestes disent que les labos chinois passent de la guerre des prix à la guerre du pouvoir tarifaire. À lire avec notre bilan V4-Flash, la note Qwen3.8-Max et la baisse GPT-5.6.

01

Quatre points de douleur avant les tableaux

  1. 01

    Le titre n'est pas la facture. Les 1 100 % ne concernent que l'entrée cache-hit en pointe. La sortie — la ligne des vraies factures — a grimpé de 350 %.

  2. 02

    L'officiel n'est plus automatiquement le moins cher. En pointe, l'API officielle dépasse plusieurs revendeurs (GMI Cloud, Novita et d'autres restent sous le nouveau pic).

  3. 03

    Poids ouverts ≠ Apache 2.0. Qwen3.8-Max garde un levier sur les gros MaaS et assistants via une licence maison.

  4. 04

    « Modèle chinois = moins cher » se fissure. DeepSeek hors pointe reste sous Opus 5, mais Qwen international et Luna gagnent au moins un axe.

02

Chronologie : quoi, et quand

DateÉvénement
16 juillet 2026Moonshot ouvre Kimi K3 (2,8 T de paramètres), déjà sous regard de sécurité américain
2–3 août 2026Alibaba annonce puis lance Qwen3.8-Max en API hébergée
10 août 2026Meta publie Muse Glimmer (30 B, Apache 2.0) et teaser des poids Muse Spark 1.2
12 août 2026Alibaba dépose Qwen3.8-2.4T-A95B sur Hugging Face/ModelScope ; xAI livre Grok 4.6
13 août 2026DeepSeek-V4-Pro passe GA et annonce la hausse au 17 août ; Google baisse Gemini 3.7 Flash
14 août 2026Zhipu livre GLM-5.3, même socle 743 B que GLM-5.2
17 août 2026, 00:00 PékinLes nouveaux tarifs DeepSeek s'appliquent

Plus loin : le 30 juillet, OpenAI a coupé de 80 % le palier le moins cher (GPT-5.6 Luna), puis les 6–7 août en a fait le défaut gratuit avec texte illimité. Pendant que les labos chinois haussaient et ouvraient des poids amiraux, les labos américains baissaient et passaient au gratuit côté grand public. Ce n'est pas un hasard : ce sont les deux faces du même combat tarifaire.

03

Les chiffres : ce qui a vraiment changé

Hausse DeepSeek, ligne par ligne (au 17 août, 00:00 Pékin ; pointe 9 h–12 h et 14 h–18 h Pékin)

Poste (par million de tokens)AncienHors pointe (nouveau)Pointe (nouveau)Hausse pointe
V4-Flash cache hit (entrée)¥0,02¥0,05¥0,10~400 %
V4-Flash cache miss (entrée)¥1,0¥1,5¥3,0200 %
V4-Flash sortie¥2,0¥4,5¥9,0350 %
V4-Pro cache hit (entrée)¥0,025¥0,15¥0,30~1 100 %
V4-Pro cache miss (entrée)¥3,0¥4,5¥9,0200 %
V4-Pro sortie¥6,0¥13,5¥27,0350 %

Le « 1 100 % » cité partout ne vise que l'entrée cache-hit en pointe — le palier le plus proche de zéro. La sortie, qui pèse sur les vraies factures, a grimpé de 350 %. Des modèles tiers estiment qu'une charge lourde (environ 84 M de tokens/mois, surtout hors pointe, moitié de hits) voit plutôt 1,8x.

Qwen3.8-2.4T-A95B : spécifications clés

PointDétail
Paramètres2,4 T au total, 95 B actifs (MoE, 512 experts, 10 routés + 1 partagé)
Contexte262 144 tokens natifs, extensible à ~1,01 M ; Max hébergé à 1 M par défaut
CadenceAperçu 2 août → API 3 août → poids 12 août
API internationale2 $ entrée / 6 $ sortie par million
LicencePas Apache 2.0 — licence Qwen3.8-Max maison
EnjeuPremier Max amiral ouvert par Alibaba ; 3.5/3.6/3.7 Max restaient API seule

GLM-5.3 contre 5.2 : même socle, post-entraînement seul

Banc d'essaiGLM-5.2GLM-5.3Écart
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Chiffres Zhipu, sans rejeu tiers publié. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34,6 %) et Claude Fable 5 (33,7 %) : premier peloton open-weight, pas une victoire frontier.

04

Trois stratégies, trois logiques

DeepSeek : du forfait plat à l'heure — un problème de capacité

La lecture facile est « le modèle le moins cher de Chine cède à la marge ». La structure ressemble plutôt à une facture de calcul rendue visible pour la première fois. L'ancien tarif toujours bas servait d'acquisition tant que les GPU suivaient. Quand l'usage a explosé et pas la capacité, il a fallu le dire. « Encourager une planification plus souple » signifie : le calcul de pointe manque, décalez vous-mêmes.

En pointe, l'API officielle dépasse plusieurs revendeurs. L'idée que « l'officiel est toujours le DeepSeek le moins cher » est brisée pour la première fois.

Alibaba : les poids achètent l'écosystème, la licence garde le plafond

L'ouverture n'est pas un don simple. Alibaba a publié le checkpoint 2,4 T et y a collé une licence maison : tout MaaS ou assistant de travail IA à plus de 50 millions de dollars sur 12 mois doit négocier à part ; les produits à plus de 100 M de MAU ou 20 M de dollars de revenu mensuel doivent afficher le nom du modèle.

Donner les poids pour gagner les développeurs (surtout à l'étranger), garder le levier sur ceux qui peuvent monter un métier d'inférence concurrent. Ce n'est pas le même pari que Muse Glimmer en Apache 2.0 sans clause. La rumeur d'interdiction de téléchargement pour les États-Unis, l'UE, le Royaume-Uni et la Corée du Sud est fausse : le texte n'a aucune clause territoriale.

GLM-5.3 : pas de nouveau socle, un plus gros pari post-entraînement

Le fait intéressant n'est pas le score, c'est la méthode : même socle 743 B que 5.2, pas de nouvel pré-entraînement, environ 6x sur Terminal-Bench 3.0 (4,6 % → 28,3 %) rien qu'en élargissant les environnements RL. Quand le scaling du pré-entraînement s'essouffle, le RL post-entraînement devient un levier à plancher bien plus bas qu'un nouveau fondationnel.

05

Face à face : DeepSeek reste-t-il le frontier le moins cher ?

ModèleEntrée (par million)Sortie (par million)Poids ouverts ?
DeepSeek V4-Pro (pointe)¥9,0 (~1,26 $)¥27,0 (~3,78 $)Non
DeepSeek V4-Pro (hors pointe)¥4,5 (~0,63 $)¥13,5 (~1,89 $)Non
Qwen3.8-Max (international)2,00 $6,00 $Oui (licence maison)
OpenAI GPT-5.6 Luna0,20 $1,20 $Non
Claude Opus 5 (implicite, ratio Alibaba)~5,00 $~25,00 $Non

Change à ~¥7,15 le dollar. Réponse courte : non. Le hors-pointe V4-Pro reste bien sous Opus 5, mais ce n'est plus le moins cher de la table. Qwen international et Luna sous-cotent le hors-pointe. « Chinois = moins cher » tenait en 2025 et début 2026 ; ce n'est plus une hypothèse sûre.

06

Points contestés ou non vérifiés

  • Le titre « 1 100 % » est exact mais trompeur sans contexte. Il ne vise que l'entrée cache-hit en pointe. La sortie a grimpé de 350 %. Les médias citent des lignes différentes comme si c'était toute l'histoire.
  • Les puces Zhenwu M890 d'Alibaba pour une partie de l'inférence Qwen3.8-Max ne sont pas confirmées par un document technique Alibaba ni un banc tiers. À traiter comme non vérifié.
  • GLM-5.3 aurait trouvé une faille grave dans Cursor : VentureBeat et Zhipu, sans détail public. Source fournisseur, non auditée.
  • Le ministère chinois du Commerce préparerait des contrôles d'export de représailles sur l'IA et les semi-conducteurs : spéculatif, pas d'annonce officielle.
07

Pourquoi ça compte : deux guerres de prix en parallèle

Dans le cadre plus large, un motif apparaît. Depuis environ un mois, les labos de tête chinois livrent à un rythme que la presse financière intérieure appelle « trois mises à jour par semaine » (一周三更) — DeepSeek, Alibaba, Zhipu, plus Kimi K3 (16 juillet, 2,8 T) et MiniMax H3. La couverture chinoise parle d'une « re-tarification forcée de l'IA mondiale », plus assertive que la plupart des notes produit anglophones.

Les labos américains jouent l'inverse côté grand public : OpenAI a coupé 80 % le 30 juillet puis a rendu le modèle gratuit et illimité une semaine plus tard ; Google a livré le 13 août un modèle code à moitié prix de son prédécesseur de trois semaines. La Chine ouvre des amiraux et étage vers le haut ; les États-Unis courent vers le gratuit et le bon marché en bas. Les deux stratégies sont réelles ; elles optimisent des étages différents de l'entonnoir.

Il y a aussi une couche géopolitique. Kimi K3 a déjà attiré le regard de sécurité américain ; la fenêtre choisie par Alibaba pour un amiral 2,4 T est lue par certains analystes comme un ancrage de parité technique avant un possible resserrement. C'est une interprétation, pas un fait établi — mais un contexte que la presse tech anglaise, souvent limitée aux sorties isolées, laisse de côté.

Six étapes pour les acheteurs d'API

  1. 01

    Rattacher le titre à la ligne réelle : entrée cache-hit, miss ou sortie.

  2. 02

    Décaler les jobs agent batchables, les evals et les régressions hors 9 h–12 h et 14 h–18 h Pékin.

  3. 03

    Figer les prompts système et réutiliser les longs préfixes pour éviter le double miss + sortie.

  4. 04

    Lire la licence Qwen3.8-Max : perso et interne souvent libres ; MaaS/assistant à plus de 50 M$ sur 12 mois exige un accord.

  5. 05

    Ne pas choisir un agent de code à la taille du socle — GLM-5.3 montre un saut d'environ 6x sur la même base.

  6. 06

    Lancer le même flux OpenClaw sur un Mac distant dédié contre DeepSeek hors pointe, Qwen international et GLM, puis verrouiller le défaut après une vraie semaine de facture.

Chiffres citables

  • V4-Pro entrée hit pointe : ¥0,025 → ¥0,30, environ 1 100 % ; sortie : ¥6,0 → ¥27,0, 350 %
  • Pointe : Pékin 9 h–12 h et 14 h–18 h ; hors pointe = moitié
  • Charge lourde (~84 M tokens/mois, surtout hors pointe, moitié de hits) : facture vers 1,8x
  • Qwen3.8-Max : 2,4 T / 95 B actifs ; API internationale 2 / 6 $
  • Licence : MaaS/assistant au-delà de 50 M$ sur 12 mois ; 100 M MAU ou 20 M$/mois de revenu doivent afficher le nom
  • GLM-5.3 Terminal-Bench 3.0 : 4,6 % → 28,3 % sur le même socle 743 B ; derrière Sol 34,6 % et Fable 5 33,7 %
08

FAQ

Le tarif hors pointe reste sous Claude Opus 5, mais ce n'est plus l'option la moins chère dans l'ensemble. GPT-5.6 Luna (0,20/1,20 $ par million de tokens) et Qwen3.8-Max international (2/6 $) sous-cotent désormais DeepSeek hors pointe sur au moins une dimension. DeepSeek reste relativement bon marché pour un frontier, simplement plus le moins cher tout court.

Oui dans la plupart des cas : projets personnels et usage interne restent hors champ. L'exception vise un service Model-as-a-Service ou assistant de travail IA ayant gagné plus de 50 millions de dollars sur 12 mois ; il faut alors une licence commerciale Alibaba.

Non. Le texte publié ne contient aucune clause géographique. Les limites tiennent au chiffre d'affaires, pas au lieu.

Rien au niveau du socle : les deux utilisent 743 milliards de paramètres. Le saut (environ 6x sur Terminal-Bench 3.0) vient uniquement de l'apprentissage par renforcement mis à l'échelle en post-entraînement, sans nouvel pré-entraînement.

Pas encore. Glimmer est un distillat de 30 milliards. Zuckerberg a annoncé des poids ouverts pour Muse Spark 1.2 ; c'est une intention, pas une publication faite.

Clôture

Dès que le tarif horaire s'applique, un portable ou un Mac de bureau trop longtemps gardé montre deux trous : on ne décale pas la pointe proprement, et on n'aligne pas trois factures dans la même session graphique. Courir après le titre 1 100 % ou lire les poids ouverts comme une licence commerciale libre transforme le coût caché en facture du mois suivant. Séparez le routage DeepSeek / Qwen / GLM, les préfixes de cache et les jobs hors pointe sur un Mac distant que l'on peut éteindre. Louez un Mac distant VNCMac, lancez OpenClaw hors pointe et en pointe, puis verrouillez le défaut. Partez des offres Mac ; pour le passage de la facture de calcul au tarif, voir le deuxième tour DeepSeek.

Sources : annonce tarifaire officielle DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et V2EX ; dépôts Qwen Alibaba (Hugging Face / ModelScope) et SCMP sur la licence ; page technique GLM-5.3 de Zhipu (Z.ai), VentureBeat et StableLearn ; blog Meta AI Research et VentureBeat sur Muse Glimmer ; Yicai et Sohu Finance sur le rythme des sorties open-weight chinoises. Prix, licences et bancs reflètent l'information publique à la date de parution. Vérifier les textes officiels avant republication ; puces nationales, faille Cursor et rumeurs d'export restent non confirmées.