GA en ligne le 20 juillet 2026 · Tarifs peak-valley · 1M contexte · 80,6 % SWE-bench · Migration API avant le 24 juillet
Synthèse : Après trois mois de preview, la famille DeepSeek V4 est officiellement en disponibilité générale (GA) depuis le 20 juillet 2026. La version complète apporte des gains nets sur les tâches agentiques, les maths et le code — plus une première chez DeepSeek : une tarification selon les heures de pointe. Ce guide couvre la chronologie, l'architecture CSA/HCA, les tableaux de benchmarks, des comparaisons honnêtes avec GPT-5.6 et Claude Fable 5, les tarifs peak-valley et la date limite de migration API du 24 juillet.
| Date | Jalon |
|---|---|
| 24 avril 2026 | Preview V4 + poids ouverts MIT (V4-Pro 1,6T, V4-Flash 284B) |
| Mai 2026 | Flash & Pro calibrés production ; API généralement disponible |
| Juin 2026 | Output V4-Pro réduit de 75 % à $0,87/M tokens de façon permanente |
| 29 juin 2026 | E-mail à tous les utilisateurs API : GA mi-juillet + première annonce tarifs peak-valley |
| 19 juillet 2026 | Accès gray-release pour développeurs sélectionnés ; presse : « full release demain » |
| 20 juillet 2026 | GA en ligne |
| 24 juillet 2026 | deepseek-chat et deepseek-reasoner retirés définitivement |
Endpoints legacy expirés : deepseek-chat s'arrête le 24 juillet — le code prod avec les anciens noms cassera
Complexité tarifs peak : les heures ouvrées doublent les tarifs ; les batchs non planifiés deviennent chers vite
Plafond de coût closed-source : GPT-5.6 Sol et Claude Fable 5 tournent à $15–50/M en output — difficile à justifier à l'échelle
Économie du contexte 1M : la plupart des modèles ne servent pas un million de tokens sans coûts KV cache prohibitifs
| Spec | V4-Pro | V4-Flash |
|---|---|---|
| Paramètres totaux | 1,6 billion | 284 milliards |
| Actifs par token | 49B (3 %) | 13B (4,6 %) |
| Couches | 61 | 43 |
| Fenêtre de contexte | 1 000 000 tokens | 1 000 000 tokens |
| Output max | 384K | 384K |
| Précision | FP4 (experts MoE) + FP8 | Identique |
| Données d'entraînement | 33T+ tokens | 32T+ tokens |
| Licence | MIT | MIT |
V4 remplace MLA de V2/V3 par un hybride à deux pistes :
À 1M tokens : 27 % des FLOPs d'inférence V3.2 ; le KV cache tombe à 10 % de la mémoire V3.2 (Flash : 7 %).
Manifold-Constrained Hyper-Connections (mHC) utilisent un flux résiduel 4 canaux gouverné par une matrice doublement stochastique — gradients stables sur 61 couches. L'optimiseur Muon (pas AdamW) applique l'orthogonalisation Newton-Schulz pour un entraînement plus rapide et stable.
| Mode | Description | Quand l'utiliser |
|---|---|---|
| Non-think | Rapide, sans chaîne de pensée | Routage, classification, Q&R simples |
| Think High | Blocs de raisonnement explicites | Debug, complexité moyenne |
| Think Max | Effort maximal (384K+ contexte) | Maths complexes, agents multi-étapes |
Sampling recommandé : temperature=1.0, top_p=1.0 sur tous les modes.
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % record open weight | 96,0 % | N/A | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Sur de vrais correctifs GitHub (SWE-bench Verified), les 80,6 % de V4-Pro sont le meilleur score open weight — à égalité avec Gemini 3.1 Pro. Claude Fable 5 mène globalement avec 96 % Verified et 80,3 % sur le SWE-bench Pro plus difficile.
Soit 116× moins cher pour un écart de performance de 24 % — difficile à ignorer en production.
| V4-Pro | GPT-5.6 Sol | Claude Fable 5 | |
|---|---|---|---|
| Poids ouverts / auto-hébergeable | Oui (MIT) | Non | Non |
| Contexte 1M | Oui | Non confirmé | Oui |
| Meilleur code global | Deuxième tier | Deuxième tier | Mène SWE-bench Pro |
| Meilleurs algos/maths | Mène LiveCodeBench | Fort | — |
| Coût output (off-peak) | $0,87/M | ~$15/M | ~$50/M |
| Coût output (peak) | $1,74/M | — | — |
| Souveraineté des données | Auto-hébergement possible | Non | Non |
Choisir V4-Pro quand : auto-hébergement, volume API élevé, agents de code ou analyse documentaire avec budget serré. Choisir Fable 5 quand : le meilleur travail multi-fichiers repo compte plus que le budget. Choisir GPT-5.6 quand : workflows agent terminal/shell (mène Terminal-Bench 2.1) ou intégration Microsoft 365 / Azure profonde.
| Modèle | Poste | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | $0,0035/1M | 2× |
| Input (cache miss) | $0,435/1M | $0,87/1M | |
| Output | $0,87/1M | $1,74/1M | |
| V4-Flash | Input (cache hit) | $0,0028/1M | 2× |
| Input (cache miss) | $0,14/1M | $0,28/1M | |
| Output | $0,28/1M | $0,56/1M |
Heures de pointe (heure de Pékin) : Jours ouvrés 09:00–12:00 et 14:00–18:00.
Planifier les batchs off-peak (après 18:00 ou avant 09:00 heure de Pékin)
Maximiser les cache hits — prompts système statiques en tête de pile
Router les requêtes simples vers V4-Flash ; n'escalader vers Pro que le raisonnement complexe
Surveiller l'e-mail du compte pour les avis de changement tarifaire 24 h
Utiliser cron/files d'attente pour verrouiller le travail non temps réel en off-peak
Même en peak, l'output V4-Pro à $1,74/M reste 8,6× moins cher que Claude Opus 4.8 ($15/M).
Date limite : 24 juillet 2026, 15:59 UTC. Les noms legacy deepseek-chat et deepseek-reasoner seront définitivement désactivés.
| Ancien nom | Équivalent nouveau | Notes |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-thinking) | Drop-in pour la plupart des chats |
deepseek-reasoner | deepseek-v4-flash (thinking) ou deepseek-v4-pro | Raisonnement plus fort sur Pro |
# Ancien (s'arrête le 24 juillet)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])
# Nouveau
response = client.chat.completions.create(
model="deepseek-v4-pro", # ou deepseek-v4-flash
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)V4 supporte les API compatibles OpenAI et Anthropic Messages — même base_url, mettez à jour model uniquement.
Réponse courte : oui — surtout si le coût, l'ouverture ou le contrôle des données comptent. Vous obtenez le meilleur modèle de code open weight sur SWE-bench Verified (80,6 %), un contexte 1M économiquement viable, des tarifs qui battent tout concurrent closed source même en peak, et un raisonnement multi-mode pour ajuster vitesse vs profondeur.
Les tarifs peak ajoutent de la complexité opérationnelle aux pipelines 24/7, mais les tarifs off-peak restent agressivement bas et les stratégies d'atténuation sont simples.
Performance agents, maths et code améliorée ; tarifs peak/off-peak introduits. Même architecture MoE qu'en avril, désormais production-grade.
Heure de Pékin, jours ouvrés 09:00–12:00 et 14:00–18:00. Les tarifs doublent.
Oui — désactivé définitivement le 24 juillet 2026. Migrez vers deepseek-v4-flash ou deepseek-v4-pro.
DeepSeek V4 GA fixe une nouvelle barre pour la valeur open weight, mais le mettre en production implique migration API, planification heures de pointe et orchestration d'agents dans un vrai environnement de dev. Si votre poste principal est Windows ou Linux et que vous avez besoin d'une session GUI macOS native pour valider le routage multi-modèle OpenClaw, benchmarker contre SWE-bench ou tester des changements de config avant le 24 juillet, acheter un Mac coûte cher et SSH seul ne gère pas les dialogues de permissions système. Louer un Mac distant VNCMac vous donne un accès VNC horaire sur un nœud isolé pour brancher les API V4, lancer des tâches agent long contexte et vérifier les migrations — puis arrêter de payer. Voir les forfaits location Mac.