LLM 4 августа 2026 г. ~18 мин Qwen3.8-Max Open Source

Qwen3.8-Max — open source?
Что Alibaba выпустила 3 августа 2026

GA 3 авг. · 2,4T / 95B активных · Arena Text #5 · веса обещаны на след. неделе · бенчмарки вендора

Релиз флагманской модели Alibaba Qwen3.8-Max и позиция на Arena

Кратко: пока нет. 3 августа 2026 года Alibaba вывела Qwen3.8-Max в GA через облачный API и пометила модель «Open-Source» на qwen.ai. На момент публикации нет репозитория на Hugging Face или ModelScope, нет лицензии и точной даты — только обещание выложить веса Qwen3.8-Max и Qwen3.8-27B «на следующей неделе». Ниже — хронология, опубликованные спецификации, сравнение с конкурентами, спор вокруг метки open source, пятиступенчатый чеклист внедрения и FAQ, плюс как проверить Agent-воркфлоу на удалённом Mac, когда OAuth и диалоги разрешений macOS нельзя закрыть по SSH.

01

Ловушки перед миграцией в продакшен

  1. 01

    Метка Open-Source раньше весов: qwen.ai называет модель открытой, но репозитория и лицензии пока нет

  2. 02

    Все бенчмарки — от вендора: PaperBench, QwenSWEBench, RecreationBench и др. прогнаны в harness Alibaba; на Arena статус «Preliminary»

  3. 03

    Число активных параметров раскрыли с задержкой: июльский preview молчал; GA наконец показал 95B активных

  4. 04

    Полный self-hosting нереалистичен: чекпоинт 2,4T — артефакт мультинодового дата-центра даже при MoE-разреженности

  5. 05

    Проверка агентов требует GUI: OpenClaw, Claude Code и Qoder CLI упираются в macOS permission prompts, которые чистый SSH не закроет

02

Хронология: что вышло, а что нет

ДатаСобытие
16 июляMoonshot AI выпускает Kimi K3 (2,8T MoE) с независимыми бенчмарками и техотчётом
19 июляPreview Qwen3.8-Max по 10% от итоговой цены; без числа активных параметров, без таблицы бенчмарков; ToS запрещает автоматизированное продакшен-использование
27 июляKimi K3 open weights выходят на Hugging Face по графику
31 июляDeepSeek V4-Flash обходит V4-Pro на девяти agentic/coding бенчмарках без прироста параметров
3 августаGA Qwen3.8-Max с полной таблицей бенчмарков; запуск агентного продукта «Qwen Office»; акции Alibaba +7% HK / +4,5% US
~10 августа (ожид.)Обещаны open weights для Qwen3.8-Max и Qwen3.8-27B; на момент публикации не вышли
03

Опубликованные спецификации

ПараметрQwen3.8-Max
Дата GA3 августа 2026
Всего / активных параметров2,4T / 95B
АрхитектураSparse MoE + гибридное внимание на базе Qwen3.5
Контекст1M токенов (≈983K с thinking; макс. вывод 131K)
МодальностиТекст, изображение, видео
Цены API$2 / $6 за млн input/output токенов
Arena Text (1 авг.)#5, 1 496 pts (Preliminary) — единственная не-Anthropic в топ-8
Arena Vision#2, ниже Claude Fable 5
PaperBench (Alibaba-run)93,0 (+28,2 к прошлому поколению)
SWE-bench Pro (Alibaba-run)67,7 — ниже 80,0 у Fable 5
Open weightsОбещаны на след. неделе; не опубликованы

В двух словах: 2,4T/95B · $2/$6 за M · Arena Text #5 (Preliminary) · API совместим с OpenAI и Anthropic.

04

Архитектура: большой total, малый active

Sparse MoE поднимает общее число параметров до 2,4 трлн, активируя лишь 95 млрд на токен. Стоимость инференса следует за active count — отсюда цены API ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50).

reasoning_effort (low / medium / xhigh) доступен через enable_thinking или Anthropic-совместимый reasoning.effort — стандартная «ручка» стоимости для agent-моделей.

Долгая автономия — главный PR-угол: 16-дневный unsupervised coding project, задача chip-design на 500+ шагов и RecreationBench (воссоздание приложения только из black-box взаимодействия). Частичные трейсы есть на GitHub (qwen-code-dev-bot/oh-my-cli), но бенчмарки — in-house.

Стратегия дистрибуции: интеграция в «Qwen Office» и подключение к Claude Code, Codex, Qoder CLI, Qwen Code и OpenClaw сменой base URL.

05

Матрица решений: Qwen3.8-Max vs конкуренты

МодельВсего / activeКонтекстЦена (in/out за M)Open weights?Независ. бенчмарк
Qwen3.8-Max2,4T / 95B1M$2 / $6ОбещаныПока нет
Kimi K32,8T / ~50B~1,05M$3 / $15Вышли 27 июляAA Index ≈57,11
DeepSeek V4-Pro1,6T / 49B1MНе полностью опублик.ВышлиSWE-bench Verified 80,6%
DeepSeek V4-FlashКак V4-Pro1MНе полностью опублик.ВышлиОбходит V4-Pro на 9 бенчах
Claude Fable 5Не раскрыто1M$10 / $50ЗакрытаяArena Text #1

Единственный независимый apples-to-apples тест (269-файловая архитектурная задача, слепое ревью): Kimi K3 — 83/100, preview Qwen3.8-Max — 80/100. Результат «на равных», а не чистая победа одной стороны.

06

Проблема метки open source

  1. 01

    Тег Open-Source появился раньше весов — маркетинговое решение, пока нет репозитория

  2. 02

    Каждый бенчмарк прогнан вендором; нейтральная площадка GA-цифры не воспроизвела

  3. 03

    Сноска намекает, что скоры Fable 5 «могут включать fallbacks» — без эквивалентного методологического раскрытия

  4. 04

    Июльский preview запрещал автоматизированное продакшен-использование и вышел без model card и safety evaluation

Примечание: это не значит, что модель слабая — единственный независимый слепой тест указывает на frontier-класс. Launch-day заявления лидерборда считайте vendor claims, пока веса не выйдут и сторонние лаборатории не догонят.

07

Пятиступенчатый чеклист внедрения

  1. 01

    Подключите API через Alibaba Cloud Model Studio; проверьте OpenAI- и Anthropic-совместимые эндпоинты и уровни reasoning.effort

  2. 02

    Сопоставьте нагрузку с опубликованными скорами — долгие agent-задачи vs слабый HLE (43,6)

  3. 03

    Направьте OpenClaw или Qoder на новый base URL; прогоните probe-задачи против Kimi K3 / DeepSeek по latency и cost

  4. 04

    Следите за Qwen3.8-27B на Hugging Face, если цель — on-prem развёртывание

  5. 05

    Завершите OAuth, browser DevTools и проверки macOS permissions в настоящей GUI-сессии macOS (см. VNCMac ниже)

08

Широкий контекст

  • Эра «scale-everything» может заканчиваться: DeepSeek V4-Flash улучшил agentic-скоры без прироста параметров
  • Alibaba разворачивается к открытости: первое обещание open weights класса Max на фоне Kimi K3 и DeepSeek
  • Потребительский угол: сжатый Qwen работает on-device в Apple Intelligence в Китае (iPhone 15+)
  • Регуляторный контраст: 4 августа Белый дом собрал лаборатории после agent safety инцидентов, пока китайские лабы гонятся за открытием frontier-весов
09

FAQ

Нет. API живой, но весов нет на Hugging Face или ModelScope. Метка Open-Source описывает намерение, а не готовый артефакт.

Один независимый слепой тест: Kimi K3 83/100 vs Qwen3.8-Max 80/100. У K3 публичные веса и сторонние скоры; у Qwen ниже цены API и шире мультимодальность.

Для полного чекпоинта — да. API это обходит. Qwen3.8-27B — реалистичная on-prem цель, когда веса выйдут.

Считайте vendor claims. Ждите сторонних воспроизведений или A/B на своей нагрузке. Arena ставит запись в статус Preliminary.

Qwen питает генеративные функции Apple Intelligence в Китае на iPhone 15+ — встроенная инфраструктура независимо от прямого API.

Итог

Qwen3.8-Max выходит на Arena Text #5 с агрессивными ценами API и OpenClaw-совместимыми эндпоинтами — но веса не опубликованы, а бенчмарки не проверены независимо. Если основная машина — Windows или Linux, а для Qwen Office, маршрутизации OpenClaw или параллельных iOS-билдов нужна настоящая macOS GUI, покупка Mac дорога, а SSH не нажмёт OAuth и диалоги разрешений.

Аренда удалённого Mac VNCMac даёт почасовой VNC-рабочий стол для изолированной проверки Agent-воркфлоу Qwen3.8-Max. См. тарифы Mac mini M4 и разбор Kimi K3 open weight для контекста.

Источники: анонсы Alibaba Cloud, Arena.ai, TechNode, Apple Intelligence China. Перед продакшен-миграцией сверяйте цены и статус open weights.