31 juillet 2026 · V4-Flash-0731 officiel · Post-entraînement seul · Harness annoncé · Pro sans date
Résumé : Le 31 juillet, DeepSeek a promu deepseek-v4-flash en build API public officiel (tag 0731) avec la même architecture 284B qu'en avril — les gains viennent uniquement d'un nouveau passage de post-entraînement. Les scores agent rivalisent avec Claude Opus 4.8 pour environ 1/36 à 1/179 du prix (tarifs liste éditeur). Le flagship V4-Pro et le framework agent maison Harness restent non publiés. Cet article couvre la chronologie, les grilles tarifaires, l'architecture, la concurrence open weight chinoise, les réserves sur les benchmarks, le récit des prix « kill line » et une checklist développeur en cinq étapes.
Les anciens noms API sont morts : deepseek-chat et deepseek-reasoner retirés le 24 juillet — la prod non migrée casse immédiatement
« Officiel » ≠ nouvelle architecture : 0731 est un Flash ré-entraîné, pas un modèle plus gros — de mauvaises attentes faussent le routage
Les scores agent dépendent du Harness : Terminal Bench 2.0 a utilisé le mode minimal Harness non publié — ne pas les porter aveuglément sur Claude Code ou Cursor
Pro et Harness manquent encore : seul Flash est officiel, API uniquement ; app et chat web intacts ; rumeurs GA 10–20 août non confirmées
| Date | Événement |
|---|---|
| 24 avr. 2026 | Preview V4 + poids MIT : V4-Pro (1,6T/49B actifs), V4-Flash (284B/13B actifs), contexte 1M |
| 24 juil. 2026 | Alias legacy retirés ; tout le trafic route vers les noms V4 |
| 27 juil. 2026 | Moonshot AI livre Kimi K3 open weights (2,8T total) — pression concurrentielle directe |
| 31 juil. 2026 | Bêta API officielle V4-Flash-0731 ; poids sur Hugging Face ; changelog nomme Harness « coming soon » ; API seulement |
| Au 5 août 2026 | V4-Pro officiel toujours « dès que possible » ; fenêtre média 10–20 août non confirmée par DeepSeek |
| Modèle | Statut | Total / actifs | Contexte | Input $/M (miss / hit) | Output $/M | Licence |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Officiel | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Preview seulement | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Open weights 27 juil. | 2,8T / ~104B est. | ~1,05M | $3,00 / $0,30 | $15,00 | MIT modifiée |
| GLM-5.2 | Open juin 2026 | ~744B / ~40B | 1M | Non vérifié ici | MIT | |
| Qwen3.8-Max | API GA 2 août | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Poids en attente |
DeepSeek a annoncé une future surcharge 2× aux heures de pointe (Pékin 9–12, 14–18 h) sans date d'effet. Chiffres au 5 août 2026.
V4-Flash-0731 est identique en taille et structure à la preview d'avril. DeepSeek attribue les sauts de benchmarks agent uniquement au post-entraînement relancé — un modèle 284B/13B bat désormais la preview 1,6T/49B de la famille sur plusieurs tâches agentiques, montrant que la compétition fin 2026 repose autant sur données et méthodes que sur le nombre brut de paramètres.
Le rapport technique décrit l'attention hybride CSA + HCA (« DSA »), les hyper-connexions à contrainte de variété (mHC) et l'optimiseur Muon. L'éditeur affirme qu'à 1M tokens, V4-Pro n'a besoin que de 27 % des FLOPs/token de V3.2 et 10 % du cache KV — reproduction indépendante en attente.
Le 31 juillet marque la première mention officielle de DeepSeek Harness — E/S fichiers, appels d'outils, workflows d'ingénierie — la réponse DeepSeek à Claude Code. Chaque score agent publié (Terminal Bench 2.0, Toolathlon, etc.) a utilisé le mode minimal Harness (pas encore public). Le changelog avertit que les scores sont « extrêmement sensibles au choix du harness ».
| Modèle | Labo | Params totaux | AA Intelligence Index | Coût/tâche (AA) |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot | 2,8T | 57 | $0,86 |
| GLM-5.2 | Zhipu | ~744B | ~1 pt au-dessus de Flash | Non vérifié |
| GPT-5.6 Sol | OpenAI | Non divulgué | 9+ pts au-dessus | $1,86 |
| Claude Fable 5 | Anthropic | Non divulgué | 9+ pts au-dessus | $3,15 |
Sur l'index indépendant d'Artificial Analysis, Flash n'est pas le plus intelligent — mais le coût par tâche est ~1/29 de Kimi K3 et ~1/105 de Claude Fable 5. DeepSeek optimise pour « assez intelligent à prix imbattable », ce qui explique aussi sept semaines en tête d'usage OpenRouter pour la preview.
| Scénario | Plutôt | Pourquoi |
|---|---|---|
| Agents volume / lots API | V4-Flash-0731 | Coût le plus bas ; scores agent 0731 battent la preview Pro |
| Max index indépendant | Kimi K3 ou flagship fermé | Score AA plus élevé, coût unitaire bien plus haut |
| Self-host + contexte 1M | Poids MIT V4-Flash | Licence ouverte sur Hugging Face |
| En attente de Harness | Attendre Pro officiel | Framework non publié ; agents tiers toujours requis |
Lock-in Harness : Terminal Bench 2.0 à 82,7 (vs preview Pro 67,9) a utilisé le mode minimal Harness non publié — traiter comme éditeur + framework, pas vérité portable
Retours terrain : des devs à l'étranger signalent de faibles taux de cache-hit input et des timeouts du classifieur de sécurité
Dates Pro/Harness : rumeurs GA 10–20 août issues de médias anonymes — pas de confirmation DeepSeek
Rumeurs de financement : rapports ~7,4 Md$ / ~48,7 Md$ de valorisation sans dépôts réglementaires — contexte seulement
Les forums chinois surnommaient le fondateur Liang Wenfeng « Liang Promesse Vide » quand Pro a dépassé mi-juillet ; après 0731, « Liang le Sage » est revenu — baromètre rapide du sentiment.
Les devs emploient aussi 斩杀线 (zhǎn shā xiàn) — « kill line » : capacité suffisante plus prix plancher fixe une barre que les concurrents doivent battre sur les deux axes. La baisse de 80 % rapportée sur Luna chez OpenAI s'inscrit dans ce cadre. Le 31 juillet, Nvidia, Broadcom et AMD ont à peine bougé — les marchés traitent désormais « l'efficacité DeepSeek » comme de l'ingénierie routinière, contrairement à la vente chip de R1 en 2025.
Pointer la prod vers deepseek-v4-flash ; retirer les alias legacy
Séparer scores agent éditeur et index indépendant AA pour le routage
Planifier les jobs bulk hors fenêtres peak 2× annoncées (date TBD)
Valider les agents dans OpenClaw / Claude Code — ne pas s'appuyer sur TB2.0 seul
Surveiller le changelog pour Harness et Pro — API et poids peuvent diverger à nouveau
Oui — V4-Pro et V4-Flash, y compris 0731, sont des poids MIT ouverts sur Hugging Face.
Tarifs liste ~36×–179× moins chers en input et ~89× en output vs Opus 4.8 par million de tokens (tarifs éditeur, non audités).
Aucune date confirmée — changelog dit « dès que possible ». Rumeurs d'août non confirmées.
SWE-bench Verified est un signal plus fort. Les scores agent nécessitent une reproduction Harness tierce.
Framework agent maison DeepSeek (fichiers, outils, tâches d'ingénierie) — nommé le 31 juillet, pas encore public.
V4-Flash-0731 prouve que post-entraînement et prix peuvent compter plus qu'un nouveau bond de paramètres — mais valider le routage multi-modèle OpenClaw, comparer Harness vs Claude Code ou migrer des APIs en lot gagne à une vraie session GUI macOS. Si votre machine principale est Windows ou Linux, acheter un Mac juste pour cliquer les permissions agent est lourd ; SSH seul ne couvre pas les dialogues système. Louez un Mac distant VNCMac à l'heure, branchez DeepSeek V4 en VNC, exécutez des workloads agent isolés et arrêtez à la fin du projet. Voir les forfaits Mac ; aussi nos articles V4 GA et Kimi K3 open weights.
Sources : docs API/changelog DeepSeek, rapport technique, Artificial Analysis (via médias financiers), 21st Century Business Herald. Vérifier tarifs et statut avant publication — chiffres au 5 août 2026.