Open-weight LLM 5 августа 2026 ~20 мин чтения DeepSeek V4 Harness

Новая модель DeepSeek правда в 100 раз дешевле Claude?
Разбор V4-Flash

31 июля 2026 · V4-Flash-0731 официален · Только пост-обучение · Harness анонсирован · Pro без даты

DeepSeek V4 Flash 0731 официальная open-weight модель бенчмарки концепт

Кратко: 31 июля DeepSeek перевёл deepseek-v4-flash в официальный публичный API-билд (тег 0731) с той же 284B-архитектурой, что в апрельском превью — прирост только от нового пост-обучения. Agent-баллы соперничают с Claude Opus 4.8 при цене порядка 1/36–1/179 (лист вендора). Флагман V4-Pro и собственный agent-фреймворк Harness не выпущены. Материал охватывает хронологию, таблицы цен, архитектуру, китайскую open-weight гонку, оговорки по бенчмаркам, нарратив «斩杀线» и чеклист из пяти шагов для разработчиков.

01

Четыре ловушки перед переходом

  1. 01

    Старые имена API мертвы: deepseek-chat и deepseek-reasoner сняты 24 июля — немигрированный прод ломается сразу

  2. 02

    «Официальный» ≠ новая архитектура: 0731 — переобученный Flash, не большая модель; неверные ожидания искажают routing

  3. 03

    Agent-оценки зависят от Harness: Terminal Bench 2.0 снят на неопубликованном minimal-mode Harness — не переносите слепо в Claude Code или Cursor

  4. 04

    Pro и Harness ещё нет: официален только Flash, только API; приложение и веб-чат без изменений; слухи GA 10–20 августа не подтверждены

02

Хронология: от апрельского превью к июльскому «официалу»

ДатаСобытие
24 апр. 2026Превью V4 + MIT open weights: V4-Pro (1,6T/49B active), V4-Flash (284B/13B active), контекст 1M
24 июл. 2026Legacy-алиасы сняты; весь трафик на имена семейства V4
27 июл. 2026Moonshot AI выпустил Kimi K3 open weights (2,8T суммарно) — прямое давление конкурента
31 июл. 2026Официальная API-бета V4-Flash-0731; веса на Hugging Face; changelog называет Harness «coming soon»; только API
На 5 авг. 2026Официальный V4-Pro всё ещё «как можно скорее»; окно СМИ 10–20 августа не подтверждено DeepSeek
03

Ключевые цифры (цены вендора)

МодельСтатусВсего / activeКонтекстInput $/M (miss / hit)Output $/MЛицензия
V4-Flash-0731Официален284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProТолько превью1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Open weights 27 июл.2,8T / ~104B оцен.~1,05M$3,00 / $0,30$15,00Modified MIT
GLM-5.2Open июнь 2026~744B / ~40B1MЗдесь не провереноMIT
Qwen3.8-MaxAPI GA 2 авг.2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Веса ожидаются

DeepSeek объявил будущую 2× наценку в пиковые часы (Пекин 9–12, 14–18) без даты вступления. Цифры на 5 августа 2026.

04

Как выросла производительность без scale-up

Та же архитектура, новое пост-обучение

V4-Flash-0731 идентичен по размеру и структуре апрельскому превью. DeepSeek объясняет скачок agent-бенчмарков только повторным пост-обучением — модель 284B/13B теперь обгоняет превью 1,6T/49B семейства на ряде agentic-задач, показывая, что гонка конца 2026 зависит от данных и методов не меньше, чем от числа параметров.

Гибридное внимание, mHC, Muon

Техотчёт описывает гибридное внимание CSA + HCA («DSA»), manifold-constrained hyper-connections (mHC) и оптимизатор Muon. Вендор заявляет: при 1M токенов V4-Pro требует 27% FLOPs/token от V3.2 и 10% KV-кэша — независимая репродукция ожидается.

Harness: первый собственный agent-фреймворк

31 июля впервые официально назван DeepSeek Harness — файловый I/O, вызовы инструментов, инженерные workflow — ответ DeepSeek на Claude Code. Каждый опубликованный agent-score (Terminal Bench 2.0, Toolathlon и др.) снят в minimal mode Harness (ещё не публичен). Changelog предупреждает: оценки «крайне чувствительны к выбору harness».

05

Сравнение: китайская open-weight свалка

МодельЛабВсего параметровAA Intelligence IndexСтоимость/задача (AA)
V4-Flash-0731DeepSeek284B50$0,03
Kimi K3Moonshot2,8T57$0,86
GLM-5.2Zhipu~744B~на 1 пт выше FlashНе проверено
GPT-5.6 SolOpenAIНе раскрытона 9+ пт выше$1,86
Claude Fable 5AnthropicНе раскрытона 9+ пт выше$3,15

В независимом индексе Artificial Analysis Flash не самый умный — но стоимость на задачу ~1/29 от Kimi K3 и ~1/105 от Claude Fable 5. DeepSeek оптимизирует «достаточный интеллект по беспрецедентной цене», что объясняет и семь недель лидерства превью в OpenRouter.

Матрица решений

СценарийСклоняться кПочему
Массовые агенты / API-пакетыV4-Flash-0731Минимальная цена; agent 0731 обгоняет превью Pro
Макс. независимый индексKimi K3 или закрытый флагманВыше AA, но и unit cost
Self-host + контекст 1MMIT-веса V4-FlashОткрытая лицензия на Hugging Face
Ждём HarnessДержать до официального ProФреймворк не вышел; нужны сторонние агенты
06

Оговорки: не верьте заголовкам слепо

  1. 01

    Lock-in Harness: Terminal Bench 2.0 на 82,7 (vs превью Pro 67,9) — неопубликованный minimal-mode Harness; это вендор + фреймворк, не переносимая истина

  2. 02

    Отзывы о usability: зарубежные разработчики жалуются на низкий cache-hit input и таймауты safety-классификатора

  3. 03

    Даты Pro/Harness: слухи GA 10–20 августа из анонимных СМИ — не подтверждение DeepSeek

  4. 04

    Слухи о раунде: ~$7,4 млрд / ~$48,7 млрд оценка без регуляторных filings — только фон

07

Цены «kill line» и пожатие плечами chip-акций

На китайских форумах основателя Лян Вэньфэна называли «Лян Пустое Обещание», когда Pro сорвал середину июля; после 0731 вернулся «Лян Мудрец» — быстрый барометр настроений.

Разработчики говорят о 斩杀线 (zhǎn shā xiàn) — «линии убийства»: достаточная способность плюс дно цен задаёт планку, которую конкуренты должны пробить по обеим осям. Сообщённое 80%-е снижение Luna у OpenAI вписывается в эту рамку. 31 июля Nvidia, Broadcom и AMD почти не сдвинулись — рынок воспринимает «эффективность DeepSeek» как рутинную инженерию, в отличие от распродажи чипов после R1 в 2025.

Чеклист разработчика из пяти шагов

  1. 01

    Направить прод на deepseek-v4-flash; убрать legacy-алиасы

  2. 02

    Отделить vendor agent scores от независимого индекса AA при routing

  3. 03

    Планировать bulk вне анонсированных 2× peak-окон (дата TBD)

  4. 04

    Валидировать агентов в OpenClaw / Claude Code — не полагаться только на TB2.0

  5. 05

    Следить changelog за Harness и Pro — API и веса могут снова разойтись

Цифры для цитирования

  • Flash 0731: 284B / 13B active; input от $0,0028/M cache-hit
  • vs Opus 4.8: ~1/36 cache-miss input, ~1/179 cache-hit, ~1/89 output (лист вендора, 21st Century Business Herald)
  • Terminal Bench 2.0: 82,7 (Harness minimal mode, отчёт вендора)
08

FAQ

Да — V4-Pro и V4-Flash, включая 0731, это MIT open weights на Hugging Face.

Лист ~в 36–179 раз дешевле на input и ~в 89 раз на output vs Opus 4.8 за миллион токенов (прайс вендора, не аудит).

Даты нет — changelog: «как можно скорее». Августовские слухи не подтверждены.

SWE-bench Verified — сильнее сигнал. Agent-оценки ждут стороннюю репродукцию Harness.

Собственный agent-фреймворк DeepSeek (файлы, инструменты, инженерные задачи) — назван 31 июля, пока не публичен.

Заключение

V4-Flash-0731 показывает, что пост-обучение и цена могут важнее очередного скачка параметров — но проверка multi-model routing OpenClaw, сравнение Harness vs Claude Code или пакетная миграция API выигрывают от настоящей macOS GUI-сессии. Если основная машина Windows или Linux, покупать Mac ради кликов по agent-разрешениям тяжело; одного SSH для системных диалогов мало. Арендуйте удалённый Mac VNCMac почасово, подключите DeepSeek V4 по VNC, гоняйте agent-нагрузки изолированно и остановите оплату после проекта. См. тарифы аренды Mac; также обзор V4 GA и Kimi K3 open weights.

Источники: документация API/changelog DeepSeek, техотчёт, Artificial Analysis (через финмедиа), 21st Century Business Herald. Проверьте цены и статус перед публикацией — цифры на 5 августа 2026.