GA с 20 июля 2026 · Peak-valley тарифы · 1M контекст · 80,6% SWE-bench · Миграция API до 24 июля
Кратко: После трёх месяцев preview семейство DeepSeek V4 официально вышло в general availability (GA) 20 июля 2026. Полный релиз даёт заметные улучшения в agent-задачах, математике и коде — плюс то, чего у DeepSeek ещё не было: тарификация по времени суток (peak-valley). В этом материале — хронология, архитектура CSA/HCA, таблицы бенчмарков, честное сравнение с GPT-5.6 и Claude Fable 5, peak-valley цены и дедлайн миграции API 24 июля.
| Дата | Веха |
|---|---|
| 24 апреля 2026 | Preview V4 + MIT open weights (V4-Pro 1,6T, V4-Flash 284B) |
| Май 2026 | Production-tuned Flash & Pro; API в общем доступе |
| Июнь 2026 | Output V4-Pro снижен на 75% до $0,87/M tokens навсегда |
| 29 июня 2026 | Письмо всем API-пользователям: GA в середине июля + первое раскрытие peak-valley |
| 19 июля 2026 | Gray-release для избранных разработчиков; пресса: «full release завтра» |
| 20 июля 2026 | GA-релиз в проде |
| 24 июля 2026 | deepseek-chat и deepseek-reasoner навсегда отключены |
Legacy endpoints истекают: deepseek-chat отключается 24 июля — prod-код со старыми именами сломается
Сложность peak-тарифов: в рабочие часы ставки удваиваются; незапланированные batch-задачи быстро дорожают
Потолок closed-source: GPT-5.6 Sol и Claude Fable 5 — $15–50/M output; сложно оправдать на масштабе
Экономика 1M контекста: большинство моделей не тянут миллион токенов без запретных затрат на KV cache
| Spec | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1,6 трлн | 284 млрд |
| Активных на token | 49B (3%) | 13B (4,6%) |
| Слоёв | 61 | 43 |
| Контекстное окно | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K | 384K |
| Точность | FP4 (MoE experts) + FP8 | То же |
| Обучающие данные | 33T+ tokens | 32T+ tokens |
| Лицензия | MIT | MIT |
V4 заменил MLA из V2/V3 двухдорожечным гибридом:
На 1M tokens: 27% inference FLOPs V3.2; KV cache падает до 10% памяти V3.2 (Flash: 7%).
Manifold-Constrained Hyper-Connections (mHC) используют 4-канальный residual stream под управлением doubly stochastic matrix — стабильные градиенты через 61 слой. Оптимизатор Muon (не AdamW) применяет Newton-Schulz orthogonalization для более быстрого и стабильного обучения.
| Режим | Описание | Когда использовать |
|---|---|---|
| Non-think | Быстро, без chain of thought | Роутинг, классификация, простые Q&A |
| Think High | Явные блоки рассуждения | Отладка, средняя сложность |
| Think Max | Максимальные усилия (384K+ контекст) | Сложная математика, multi-step агенты |
Рекомендуемый sampling: temperature=1.0, top_p=1.0 во всех режимах.
| Benchmark | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6% рекорд open weight | 96,0% | N/A | ~69% |
| SWE-bench Pro | 55,4% | 80,3% | 78,1% | 69,2% |
| LiveCodeBench (Pass@1) | 93,5% | 88,1% | 87,4% | 83,2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83,9% | 88,0% | 85,1% | 82,7% |
На реальных GitHub bugfix (SWE-bench Verified) 80,6% V4-Pro — лучший open-weight результат, наравне с Gemini 3.1 Pro. Claude Fable 5 всё ещё лидирует: 96% Verified и 80,3% на более жёстком SWE-bench Pro.
Это в 116 раз дешевле при разрыве в 24% по performance — в production сложно игнорировать.
| V4-Pro | GPT-5.6 Sol | Claude Fable 5 | |
|---|---|---|---|
| Open weights / self-host | Да (MIT) | Нет | Нет |
| 1M контекст | Да | Не подтверждено | Да |
| Лучший код в целом | Второй tier | Второй tier | Лидирует SWE-bench Pro |
| Лучшие алгоритмы/математика | Лидирует LiveCodeBench | Сильный | — |
| Output off-peak | $0,87/M | ~$15/M | ~$50/M |
| Output peak | $1,74/M | — | — |
| Суверенитет данных | Self-host возможен | Нет | Нет |
Выбирайте V4-Pro, если: нужен self-hosting, большой объём API, coding-агенты или анализ документов с ограниченным бюджетом. Fable 5 — если: важнее абсолютно лучшая multi-file repo работа, а бюджет вторичен. GPT-5.6 — если: terminal/shell agent workflows (лидирует Terminal-Bench 2.1) или глубокая интеграция Microsoft 365 / Azure.
| Модель | Статья | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | $0,0035/1M | 2× |
| Input (cache miss) | $0,435/1M | $0,87/1M | |
| Output | $0,87/1M | $1,74/1M | |
| V4-Flash | Input (cache hit) | $0,0028/1M | 2× |
| Input (cache miss) | $0,14/1M | $0,28/1M | |
| Output | $0,28/1M | $0,56/1M |
Peak-часы (пекинское время): Будни 09:00–12:00 и 14:00–18:00.
Планируйте batch off-peak (после 18:00 или до 09:00 по Пекину)
Максимизируйте cache hits — статические system prompts в начале стека сообщений
Роутите простые запросы на V4-Flash; на Pro эскалируйте только сложный reasoning
Следите за email аккаунта на уведомления об изменении тарифов за 24 часа
Используйте cron/очереди, чтобы не realtime работу привязать к off-peak окнам
Даже в peak output V4-Pro при $1,74/M в 8,6 раз дешевле Claude Opus 4.8 ($15/M).
Дедлайн: 24 июля 2026, 15:59 UTC. Legacy-имена deepseek-chat и deepseek-reasoner будут навсегда отключены.
| Старое имя | Новый эквивалент | Примечания |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-thinking) | Drop-in для большинства чатов |
deepseek-reasoner | deepseek-v4-flash (thinking) или deepseek-v4-pro | Более сильный reasoning на Pro |
# Старое (отключается 24 июля)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])
# Новое
response = client.chat.completions.create(
model="deepseek-v4-pro", # или deepseek-v4-flash
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)V4 поддерживает OpenAI-compatible и Anthropic Messages API — тот же base_url, меняйте только model.
Коротко: да — особенно если важны цена, открытость или контроль данных. Вы получаете сильнейшую open-weight coding-модель на SWE-bench Verified (80,6%), 1M контекст с реальной экономикой, цены ниже любого closed конкурента даже в peak, и multi-mode reasoning для баланса скорости и глубины.
Peak-тарифы усложняют 24/7 pipelines, но off-peak ставки остаются агрессивно низкими, а меры смягчения просты.
Улучшена performance на агентах, математике и коде; введены peak/off-peak тарифы. Та же MoE-архитектура с апреля, теперь production-grade.
Пекинское время, будни 09:00–12:00 и 14:00–18:00. Тарифы удваиваются.
Да — навсегда отключён 24 июля 2026. Мигрируйте на deepseek-v4-flash или deepseek-v4-pro.
DeepSeek V4 GA задаёт новую планку open-weight value, но production означает миграцию API, планирование peak-часов и оркестрацию агентов в реальной dev-среде. Если основная машина — Windows или Linux, а нужна нативная macOS GUI-сессия для проверки multi-model routing OpenClaw, бенчмарка против SWE-bench или batch-теста конфигов до 24 июля, покупка Mac дорога, а SSH не закрывает системные диалоги разрешений. Аренда удалённого Mac VNCMac даёт почасовой VNC на изолированном узле — подключить V4 API, гонять long-context agent tasks, верифицировать миграции и остановить оплату. См. тарифы аренды Mac.