LLM open weight 5 août 2026 ~20 min de lecture DeepSeek V4 Harness

Le nouveau modèle DeepSeek est-il vraiment 100× moins cher que Claude ?
V4-Flash décrypté

31 juillet 2026 · V4-Flash-0731 officiel · Post-entraînement seul · Harness annoncé · Pro sans date

DeepSeek V4 Flash 0731 modèle open weight officiel benchmarks concept

Résumé : Le 31 juillet, DeepSeek a promu deepseek-v4-flash en build API public officiel (tag 0731) avec la même architecture 284B qu'en avril — les gains viennent uniquement d'un nouveau passage de post-entraînement. Les scores agent rivalisent avec Claude Opus 4.8 pour environ 1/36 à 1/179 du prix (tarifs liste éditeur). Le flagship V4-Pro et le framework agent maison Harness restent non publiés. Cet article couvre la chronologie, les grilles tarifaires, l'architecture, la concurrence open weight chinoise, les réserves sur les benchmarks, le récit des prix « kill line » et une checklist développeur en cinq étapes.

01

Quatre pièges avant de basculer

  1. 01

    Les anciens noms API sont morts : deepseek-chat et deepseek-reasoner retirés le 24 juillet — la prod non migrée casse immédiatement

  2. 02

    « Officiel » ≠ nouvelle architecture : 0731 est un Flash ré-entraîné, pas un modèle plus gros — de mauvaises attentes faussent le routage

  3. 03

    Les scores agent dépendent du Harness : Terminal Bench 2.0 a utilisé le mode minimal Harness non publié — ne pas les porter aveuglément sur Claude Code ou Cursor

  4. 04

    Pro et Harness manquent encore : seul Flash est officiel, API uniquement ; app et chat web intacts ; rumeurs GA 10–20 août non confirmées

02

Chronologie : preview d'avril à « officiel » de juillet

DateÉvénement
24 avr. 2026Preview V4 + poids MIT : V4-Pro (1,6T/49B actifs), V4-Flash (284B/13B actifs), contexte 1M
24 juil. 2026Alias legacy retirés ; tout le trafic route vers les noms V4
27 juil. 2026Moonshot AI livre Kimi K3 open weights (2,8T total) — pression concurrentielle directe
31 juil. 2026Bêta API officielle V4-Flash-0731 ; poids sur Hugging Face ; changelog nomme Harness « coming soon » ; API seulement
Au 5 août 2026V4-Pro officiel toujours « dès que possible » ; fenêtre média 10–20 août non confirmée par DeepSeek
03

Chiffres clés (tarifs éditeur)

ModèleStatutTotal / actifsContexteInput $/M (miss / hit)Output $/MLicence
V4-Flash-0731Officiel284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProPreview seulement1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open weights 27 juil.2,8T / ~104B est.~1,05M$3,00 / $0,30$15,00MIT modifiée
GLM-5.2Open juin 2026~744B / ~40B1MNon vérifié iciMIT
Qwen3.8-MaxAPI GA 2 août2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Poids en attente

DeepSeek a annoncé une future surcharge 2× aux heures de pointe (Pékin 9–12, 14–18 h) sans date d'effet. Chiffres au 5 août 2026.

04

Comment la perf a bougé sans scale-up

Même architecture, nouveau post-entraînement

V4-Flash-0731 est identique en taille et structure à la preview d'avril. DeepSeek attribue les sauts de benchmarks agent uniquement au post-entraînement relancé — un modèle 284B/13B bat désormais la preview 1,6T/49B de la famille sur plusieurs tâches agentiques, montrant que la compétition fin 2026 repose autant sur données et méthodes que sur le nombre brut de paramètres.

Attention hybride, mHC, Muon

Le rapport technique décrit l'attention hybride CSA + HCA (« DSA »), les hyper-connexions à contrainte de variété (mHC) et l'optimiseur Muon. L'éditeur affirme qu'à 1M tokens, V4-Pro n'a besoin que de 27 % des FLOPs/token de V3.2 et 10 % du cache KV — reproduction indépendante en attente.

Harness : premier framework agent maison

Le 31 juillet marque la première mention officielle de DeepSeek Harness — E/S fichiers, appels d'outils, workflows d'ingénierie — la réponse DeepSeek à Claude Code. Chaque score agent publié (Terminal Bench 2.0, Toolathlon, etc.) a utilisé le mode minimal Harness (pas encore public). Le changelog avertit que les scores sont « extrêmement sensibles au choix du harness ».

05

Face à face : la mêlée open weight chinoise

ModèleLaboParams totauxAA Intelligence IndexCoût/tâche (AA)
V4-Flash-0731DeepSeek284B50$0,03
Kimi K3Moonshot2,8T57$0,86
GLM-5.2Zhipu~744B~1 pt au-dessus de FlashNon vérifié
GPT-5.6 SolOpenAINon divulgué9+ pts au-dessus$1,86
Claude Fable 5AnthropicNon divulgué9+ pts au-dessus$3,15

Sur l'index indépendant d'Artificial Analysis, Flash n'est pas le plus intelligent — mais le coût par tâche est ~1/29 de Kimi K3 et ~1/105 de Claude Fable 5. DeepSeek optimise pour « assez intelligent à prix imbattable », ce qui explique aussi sept semaines en tête d'usage OpenRouter pour la preview.

Matrice de décision

ScénarioPlutôtPourquoi
Agents volume / lots APIV4-Flash-0731Coût le plus bas ; scores agent 0731 battent la preview Pro
Max index indépendantKimi K3 ou flagship ferméScore AA plus élevé, coût unitaire bien plus haut
Self-host + contexte 1MPoids MIT V4-FlashLicence ouverte sur Hugging Face
En attente de HarnessAttendre Pro officielFramework non publié ; agents tiers toujours requis
06

Réserves : ne pas avaler les titres

  1. 01

    Lock-in Harness : Terminal Bench 2.0 à 82,7 (vs preview Pro 67,9) a utilisé le mode minimal Harness non publié — traiter comme éditeur + framework, pas vérité portable

  2. 02

    Retours terrain : des devs à l'étranger signalent de faibles taux de cache-hit input et des timeouts du classifieur de sécurité

  3. 03

    Dates Pro/Harness : rumeurs GA 10–20 août issues de médias anonymes — pas de confirmation DeepSeek

  4. 04

    Rumeurs de financement : rapports ~7,4 Md$ / ~48,7 Md$ de valorisation sans dépôts réglementaires — contexte seulement

07

Prix « kill line » et hausse d'épaules des actions chip

Les forums chinois surnommaient le fondateur Liang Wenfeng « Liang Promesse Vide » quand Pro a dépassé mi-juillet ; après 0731, « Liang le Sage » est revenu — baromètre rapide du sentiment.

Les devs emploient aussi 斩杀线 (zhǎn shā xiàn) — « kill line » : capacité suffisante plus prix plancher fixe une barre que les concurrents doivent battre sur les deux axes. La baisse de 80 % rapportée sur Luna chez OpenAI s'inscrit dans ce cadre. Le 31 juillet, Nvidia, Broadcom et AMD ont à peine bougé — les marchés traitent désormais « l'efficacité DeepSeek » comme de l'ingénierie routinière, contrairement à la vente chip de R1 en 2025.

Checklist développeur en cinq étapes

  1. 01

    Pointer la prod vers deepseek-v4-flash ; retirer les alias legacy

  2. 02

    Séparer scores agent éditeur et index indépendant AA pour le routage

  3. 03

    Planifier les jobs bulk hors fenêtres peak 2× annoncées (date TBD)

  4. 04

    Valider les agents dans OpenClaw / Claude Code — ne pas s'appuyer sur TB2.0 seul

  5. 05

    Surveiller le changelog pour Harness et Pro — API et poids peuvent diverger à nouveau

Chiffres citables

  • Flash 0731 : 284B / 13B actifs ; input dès $0,0028/M cache-hit
  • vs Opus 4.8 : ~1/36 input cache-miss, ~1/179 cache-hit, ~1/89 output (liste éditeur, 21st Century Business Herald)
  • Terminal Bench 2.0 : 82,7 (mode minimal Harness, rapport éditeur)
08

FAQ

Oui — V4-Pro et V4-Flash, y compris 0731, sont des poids MIT ouverts sur Hugging Face.

Tarifs liste ~36×–179× moins chers en input et ~89× en output vs Opus 4.8 par million de tokens (tarifs éditeur, non audités).

Aucune date confirmée — changelog dit « dès que possible ». Rumeurs d'août non confirmées.

SWE-bench Verified est un signal plus fort. Les scores agent nécessitent une reproduction Harness tierce.

Framework agent maison DeepSeek (fichiers, outils, tâches d'ingénierie) — nommé le 31 juillet, pas encore public.

Mot de la fin

V4-Flash-0731 prouve que post-entraînement et prix peuvent compter plus qu'un nouveau bond de paramètres — mais valider le routage multi-modèle OpenClaw, comparer Harness vs Claude Code ou migrer des APIs en lot gagne à une vraie session GUI macOS. Si votre machine principale est Windows ou Linux, acheter un Mac juste pour cliquer les permissions agent est lourd ; SSH seul ne couvre pas les dialogues système. Louez un Mac distant VNCMac à l'heure, branchez DeepSeek V4 en VNC, exécutez des workloads agent isolés et arrêtez à la fin du projet. Voir les forfaits Mac ; aussi nos articles V4 GA et Kimi K3 open weights.

Sources : docs API/changelog DeepSeek, rapport technique, Artificial Analysis (via médias financiers), 21st Century Business Herald. Vérifier tarifs et statut avant publication — chiffres au 5 août 2026.