Open-source LLM 20 июля 2026 ~22 мин чтения DeepSeek V4 Peak-тарифы

DeepSeek V4 полный релиз
Цены, бенчмарки и сравнение с GPT-5.6

GA с 20 июля 2026 · Peak-valley тарифы · 1M контекст · 80,6% SWE-bench · Миграция API до 24 июля

DeepSeek V4 general availability open-weight AI модель

Кратко: После трёх месяцев preview семейство DeepSeek V4 официально вышло в general availability (GA) 20 июля 2026. Полный релиз даёт заметные улучшения в agent-задачах, математике и коде — плюс то, чего у DeepSeek ещё не было: тарификация по времени суток (peak-valley). В этом материале — хронология, архитектура CSA/HCA, таблицы бенчмарков, честное сравнение с GPT-5.6 и Claude Fable 5, peak-valley цены и дедлайн миграции API 24 июля.

01

Что нового в GA по сравнению с preview

ДатаВеха
24 апреля 2026Preview V4 + MIT open weights (V4-Pro 1,6T, V4-Flash 284B)
Май 2026Production-tuned Flash & Pro; API в общем доступе
Июнь 2026Output V4-Pro снижен на 75% до $0,87/M tokens навсегда
29 июня 2026Письмо всем API-пользователям: GA в середине июля + первое раскрытие peak-valley
19 июля 2026Gray-release для избранных разработчиков; пресса: «full release завтра»
20 июля 2026GA-релиз в проде
24 июля 2026deepseek-chat и deepseek-reasoner навсегда отключены

Боли перед переходом

  1. 01

    Legacy endpoints истекают: deepseek-chat отключается 24 июля — prod-код со старыми именами сломается

  2. 02

    Сложность peak-тарифов: в рабочие часы ставки удваиваются; незапланированные batch-задачи быстро дорожают

  3. 03

    Потолок closed-source: GPT-5.6 Sol и Claude Fable 5 — $15–50/M output; сложно оправдать на масштабе

  4. 04

    Экономика 1M контекста: большинство моделей не тянут миллион токенов без запретных затрат на KV cache

02

Архитектура: как DeepSeek делает 1M токенов практичным

SpecV4-ProV4-Flash
Всего параметров1,6 трлн284 млрд
Активных на token49B (3%)13B (4,6%)
Слоёв6143
Контекстное окно1 000 000 tokens1 000 000 tokens
Max output384K384K
ТочностьFP4 (MoE experts) + FP8То же
Обучающие данные33T+ tokens32T+ tokens
ЛицензияMITMIT

Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA)

V4 заменил MLA из V2/V3 двухдорожечным гибридом:

  • CSA: 4× сжатие KV через softmax-gated pooling; FP4 «lightning indexer» выбирает top-k блоки (Pro: 1024, Flash: 512); sliding window 128 tokens для свежего контекста
  • HCA: сжатие 128×, затем плотная global attention для long-range паттернов, которые CSA может пропустить

На 1M tokens: 27% inference FLOPs V3.2; KV cache падает до 10% памяти V3.2 (Flash: 7%).

mHC и Muon

Manifold-Constrained Hyper-Connections (mHC) используют 4-канальный residual stream под управлением doubly stochastic matrix — стабильные градиенты через 61 слой. Оптимизатор Muon (не AdamW) применяет Newton-Schulz orthogonalization для более быстрого и стабильного обучения.

Три режима reasoning

РежимОписаниеКогда использовать
Non-thinkБыстро, без chain of thoughtРоутинг, классификация, простые Q&A
Think HighЯвные блоки рассужденияОтладка, средняя сложность
Think MaxМаксимальные усилия (384K+ контекст)Сложная математика, multi-step агенты

Рекомендуемый sampling: temperature=1.0, top_p=1.0 во всех режимах.

03

Бенчмарки: где V4 выигрывает — и где нет

BenchmarkV4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6% рекорд open weight96,0%N/A~69%
SWE-bench Pro55,4%80,3%78,1%69,2%
LiveCodeBench (Pass@1)93,5%88,1%87,4%83,2%
Codeforces Elo3 206
Terminal-Bench 2.183,9%88,0%85,1%82,7%

На реальных GitHub bugfix (SWE-bench Verified) 80,6% V4-Pro — лучший open-weight результат, наравне с Gemini 3.1 Pro. Claude Fable 5 всё ещё лидирует: 96% Verified и 80,3% на более жёстком SWE-bench Pro.

Соотношение цена/качество (Artificial Analysis)

  • Claude Fable 5: 50 points, $3,48 за задачу
  • DeepSeek V4-Pro: 38 points, $0,03 за задачу

Это в 116 раз дешевле при разрыве в 24% по performance — в production сложно игнорировать.

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5

V4-ProGPT-5.6 SolClaude Fable 5
Open weights / self-hostДа (MIT)НетНет
1M контекстДаНе подтвержденоДа
Лучший код в целомВторой tierВторой tierЛидирует SWE-bench Pro
Лучшие алгоритмы/математикаЛидирует LiveCodeBenchСильный
Output off-peak$0,87/M~$15/M~$50/M
Output peak$1,74/M
Суверенитет данныхSelf-host возможенНетНет

Выбирайте V4-Pro, если: нужен self-hosting, большой объём API, coding-агенты или анализ документов с ограниченным бюджетом. Fable 5 — если: важнее абсолютно лучшая multi-file repo работа, а бюджет вторичен. GPT-5.6 — если: terminal/shell agent workflows (лидирует Terminal-Bench 2.1) или глубокая интеграция Microsoft 365 / Azure.

05

Peak-valley тарифы: как это работает

МодельСтатьяOff-peakPeak
V4-ProInput (cache hit)$0,0035/1M
Input (cache miss)$0,435/1M$0,87/1M
Output$0,87/1M$1,74/1M
V4-FlashInput (cache hit)$0,0028/1M
Input (cache miss)$0,14/1M$0,28/1M
Output$0,28/1M$0,56/1M

Peak-часы (пекинское время): Будни 09:00–12:00 и 14:00–18:00.

Пять шагов, чтобы снизить счёт

  1. 01

    Планируйте batch off-peak (после 18:00 или до 09:00 по Пекину)

  2. 02

    Максимизируйте cache hits — статические system prompts в начале стека сообщений

  3. 03

    Роутите простые запросы на V4-Flash; на Pro эскалируйте только сложный reasoning

  4. 04

    Следите за email аккаунта на уведомления об изменении тарифов за 24 часа

  5. 05

    Используйте cron/очереди, чтобы не realtime работу привязать к off-peak окнам

Даже в peak output V4-Pro при $1,74/M в 8,6 раз дешевле Claude Opus 4.8 ($15/M).

06

Миграция: дедлайн 24 июля

Дедлайн: 24 июля 2026, 15:59 UTC. Legacy-имена deepseek-chat и deepseek-reasoner будут навсегда отключены.

Старое имяНовый эквивалентПримечания
deepseek-chatdeepseek-v4-flash (non-thinking)Drop-in для большинства чатов
deepseek-reasonerdeepseek-v4-flash (thinking) или deepseek-v4-proБолее сильный reasoning на Pro
Python · OpenAI SDK
# Старое (отключается 24 июля)
response = client.chat.completions.create(model="deepseek-chat", messages=[...])

# Новое
response = client.chat.completions.create(
    model="deepseek-v4-pro",  # или deepseek-v4-flash
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 поддерживает OpenAI-compatible и Anthropic Messages API — тот же base_url, меняйте только model.

07

Итог: стоит ли DeepSeek V4 в 2026?

Коротко: да — особенно если важны цена, открытость или контроль данных. Вы получаете сильнейшую open-weight coding-модель на SWE-bench Verified (80,6%), 1M контекст с реальной экономикой, цены ниже любого closed конкурента даже в peak, и multi-mode reasoning для баланса скорости и глубины.

Peak-тарифы усложняют 24/7 pipelines, но off-peak ставки остаются агрессивно низкими, а меры смягчения просты.

Ключевые цифры

  • SWE-bench Verified: 80,6% (рекорд open weight)
  • KV-память 1M контекста: 10% от V3.2
  • V4-Pro off-peak output: $0,87/M; peak $1,74/M
  • Дедлайн миграции API: 24 июля 2026 15:59 UTC
08

FAQ

Улучшена performance на агентах, математике и коде; введены peak/off-peak тарифы. Та же MoE-архитектура с апреля, теперь production-grade.

Пекинское время, будни 09:00–12:00 и 14:00–18:00. Тарифы удваиваются.

Да — навсегда отключён 24 июля 2026. Мигрируйте на deepseek-v4-flash или deepseek-v4-pro.

Заключение

DeepSeek V4 GA задаёт новую планку open-weight value, но production означает миграцию API, планирование peak-часов и оркестрацию агентов в реальной dev-среде. Если основная машина — Windows или Linux, а нужна нативная macOS GUI-сессия для проверки multi-model routing OpenClaw, бенчмарка против SWE-bench или batch-теста конфигов до 24 июля, покупка Mac дорога, а SSH не закрывает системные диалоги разрешений. Аренда удалённого Mac VNCMac даёт почасовой VNC на изолированном узле — подключить V4 API, гонять long-context agent tasks, верифицировать миграции и остановить оплату. См. тарифы аренды Mac.