LLM open source 20 juillet 2026 ~22 min de lecture DeepSeek V4 Tarifs peak

DeepSeek V4 version complète
Tarifs, benchmarks & comparaison avec GPT-5.6

GA en ligne le 20 juillet 2026 · Tarifs peak-valley · 1M contexte · 80,6 % SWE-bench · Migration API avant le 24 juillet

DeepSeek V4 disponibilité générale modèle IA open weight

Synthèse : Après trois mois de preview, la famille DeepSeek V4 est officiellement en disponibilité générale (GA) depuis le 20 juillet 2026. La version complète apporte des gains nets sur les tâches agentiques, les maths et le code — plus une première chez DeepSeek : une tarification selon les heures de pointe. Ce guide couvre la chronologie, l'architecture CSA/HCA, les tableaux de benchmarks, des comparaisons honnêtes avec GPT-5.6 et Claude Fable 5, les tarifs peak-valley et la date limite de migration API du 24 juillet.

01

Nouveautés de la GA par rapport à la preview

DateJalon
24 avril 2026Preview V4 + poids ouverts MIT (V4-Pro 1,6T, V4-Flash 284B)
Mai 2026Flash & Pro calibrés production ; API généralement disponible
Juin 2026Output V4-Pro réduit de 75 % à $0,87/M tokens de façon permanente
29 juin 2026E-mail à tous les utilisateurs API : GA mi-juillet + première annonce tarifs peak-valley
19 juillet 2026Accès gray-release pour développeurs sélectionnés ; presse : « full release demain »
20 juillet 2026GA en ligne
24 juillet 2026deepseek-chat et deepseek-reasoner retirés définitivement

Points de friction avant la bascule

  1. 01

    Endpoints legacy expirés : deepseek-chat s'arrête le 24 juillet — le code prod avec les anciens noms cassera

  2. 02

    Complexité tarifs peak : les heures ouvrées doublent les tarifs ; les batchs non planifiés deviennent chers vite

  3. 03

    Plafond de coût closed-source : GPT-5.6 Sol et Claude Fable 5 tournent à $15–50/M en output — difficile à justifier à l'échelle

  4. 04

    Économie du contexte 1M : la plupart des modèles ne servent pas un million de tokens sans coûts KV cache prohibitifs

02

Architecture : comment DeepSeek rend 1M tokens viables

SpecV4-ProV4-Flash
Paramètres totaux1,6 billion284 milliards
Actifs par token49B (3 %)13B (4,6 %)
Couches6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Output max384K384K
PrécisionFP4 (experts MoE) + FP8Identique
Données d'entraînement33T+ tokens32T+ tokens
LicenceMITMIT

Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA)

V4 remplace MLA de V2/V3 par un hybride à deux pistes :

  • CSA : compression KV 4× via pooling softmax-gated ; indexeur FP4 « lightning » sélectionne les blocs top-k (Pro : 1024, Flash : 512) ; fenêtre glissante 128 tokens pour le contexte récent
  • HCA : compression 128× puis attention globale dense pour les motifs longue portée que CSA pourrait manquer

À 1M tokens : 27 % des FLOPs d'inférence V3.2 ; le KV cache tombe à 10 % de la mémoire V3.2 (Flash : 7 %).

mHC et Muon

Manifold-Constrained Hyper-Connections (mHC) utilisent un flux résiduel 4 canaux gouverné par une matrice doublement stochastique — gradients stables sur 61 couches. L'optimiseur Muon (pas AdamW) applique l'orthogonalisation Newton-Schulz pour un entraînement plus rapide et stable.

Trois modes de raisonnement

ModeDescriptionQuand l'utiliser
Non-thinkRapide, sans chaîne de penséeRoutage, classification, Q&R simples
Think HighBlocs de raisonnement explicitesDebug, complexité moyenne
Think MaxEffort maximal (384K+ contexte)Maths complexes, agents multi-étapes

Sampling recommandé : temperature=1.0, top_p=1.0 sur tous les modes.

03

Benchmarks : où V4 gagne — et où il ne gagne pas

BenchmarkV4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % record open weight96,0 %N/A~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Sur de vrais correctifs GitHub (SWE-bench Verified), les 80,6 % de V4-Pro sont le meilleur score open weight — à égalité avec Gemini 3.1 Pro. Claude Fable 5 mène globalement avec 96 % Verified et 80,3 % sur le SWE-bench Pro plus difficile.

Rapport coût-performance (Artificial Analysis)

  • Claude Fable 5 : 50 points, $3,48 par tâche
  • DeepSeek V4-Pro : 38 points, $0,03 par tâche

Soit 116× moins cher pour un écart de performance de 24 % — difficile à ignorer en production.

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5

V4-ProGPT-5.6 SolClaude Fable 5
Poids ouverts / auto-hébergeableOui (MIT)NonNon
Contexte 1MOuiNon confirméOui
Meilleur code globalDeuxième tierDeuxième tierMène SWE-bench Pro
Meilleurs algos/mathsMène LiveCodeBenchFort
Coût output (off-peak)$0,87/M~$15/M~$50/M
Coût output (peak)$1,74/M
Souveraineté des donnéesAuto-hébergement possibleNonNon

Choisir V4-Pro quand : auto-hébergement, volume API élevé, agents de code ou analyse documentaire avec budget serré. Choisir Fable 5 quand : le meilleur travail multi-fichiers repo compte plus que le budget. Choisir GPT-5.6 quand : workflows agent terminal/shell (mène Terminal-Bench 2.1) ou intégration Microsoft 365 / Azure profonde.

05

Tarifs peak-valley expliqués

ModèlePosteOff-peakPeak
V4-ProInput (cache hit)$0,0035/1M
Input (cache miss)$0,435/1M$0,87/1M
Output$0,87/1M$1,74/1M
V4-FlashInput (cache hit)$0,0028/1M
Input (cache miss)$0,14/1M$0,28/1M
Output$0,28/1M$0,56/1M

Heures de pointe (heure de Pékin) : Jours ouvrés 09:00–12:00 et 14:00–18:00.

Cinq étapes pour réduire la facture

  1. 01

    Planifier les batchs off-peak (après 18:00 ou avant 09:00 heure de Pékin)

  2. 02

    Maximiser les cache hits — prompts système statiques en tête de pile

  3. 03

    Router les requêtes simples vers V4-Flash ; n'escalader vers Pro que le raisonnement complexe

  4. 04

    Surveiller l'e-mail du compte pour les avis de changement tarifaire 24 h

  5. 05

    Utiliser cron/files d'attente pour verrouiller le travail non temps réel en off-peak

Même en peak, l'output V4-Pro à $1,74/M reste 8,6× moins cher que Claude Opus 4.8 ($15/M).

06

Guide de migration : vous avez jusqu'au 24 juillet

Date limite : 24 juillet 2026, 15:59 UTC. Les noms legacy deepseek-chat et deepseek-reasoner seront définitivement désactivés.

Ancien nomÉquivalent nouveauNotes
deepseek-chatdeepseek-v4-flash (non-thinking)Drop-in pour la plupart des chats
deepseek-reasonerdeepseek-v4-flash (thinking) ou deepseek-v4-proRaisonnement plus fort sur Pro
Python · OpenAI SDK
# Ancien (s'arrête le 24 juillet)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])

# Nouveau
response = client.chat.completions.create(
    model="deepseek-v4-pro",  # ou deepseek-v4-flash
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 supporte les API compatibles OpenAI et Anthropic Messages — même base_url, mettez à jour model uniquement.

07

Verdict : DeepSeek V4 vaut-il le coup en 2026 ?

Réponse courte : oui — surtout si le coût, l'ouverture ou le contrôle des données comptent. Vous obtenez le meilleur modèle de code open weight sur SWE-bench Verified (80,6 %), un contexte 1M économiquement viable, des tarifs qui battent tout concurrent closed source même en peak, et un raisonnement multi-mode pour ajuster vitesse vs profondeur.

Les tarifs peak ajoutent de la complexité opérationnelle aux pipelines 24/7, mais les tarifs off-peak restent agressivement bas et les stratégies d'atténuation sont simples.

Chiffres clés à citer

  • SWE-bench Verified : 80,6 % (record open weight)
  • Mémoire KV contexte 1M : 10 % de V3.2
  • Output V4-Pro off-peak : $0,87/M ; peak $1,74/M
  • Date limite migration API : 24 juillet 2026 15:59 UTC
08

FAQ

Performance agents, maths et code améliorée ; tarifs peak/off-peak introduits. Même architecture MoE qu'en avril, désormais production-grade.

Heure de Pékin, jours ouvrés 09:00–12:00 et 14:00–18:00. Les tarifs doublent.

Oui — désactivé définitivement le 24 juillet 2026. Migrez vers deepseek-v4-flash ou deepseek-v4-pro.

Mot de la fin

DeepSeek V4 GA fixe une nouvelle barre pour la valeur open weight, mais le mettre en production implique migration API, planification heures de pointe et orchestration d'agents dans un vrai environnement de dev. Si votre poste principal est Windows ou Linux et que vous avez besoin d'une session GUI macOS native pour valider le routage multi-modèle OpenClaw, benchmarker contre SWE-bench ou tester des changements de config avant le 24 juillet, acheter un Mac coûte cher et SSH seul ne gère pas les dialogues de permissions système. Louer un Mac distant VNCMac vous donne un accès VNC horaire sur un nœud isolé pour brancher les API V4, lancer des tâches agent long contexte et vérifier les migrations — puis arrêter de payer. Voir les forfaits location Mac.