Open Weight 28 июля 2026 г. ~24 мин Kimi K3 Moonshot AI

Kimi K3 — это open source?
Разбор 2,8-триллионной модели Moonshot AI

Веса от 27 июля · 1,56 ТБ на Hugging Face · MoonEP / FlashKDA / AgentEnv · Кастомная лицензия · API $0,30–15/M

Концепция open-weight MoE-модели Kimi K3 с 2,8 трлн параметров

Кратко: вечером 27 июля 2026 года Moonshot AI опубликовала полные веса и технический отчёт Kimi K3 — Mixture-of-Experts модели с 2,8 трлн параметров, контекстом в 1 млн токенов и нативным пониманием изображений. Параллельно открыты три инфраструктурные технологии: MoonEP, FlashKDA и AgentEnv. Загрузка 1,56 ТБ за 30 минут вышла на 1-е место трендов Hugging Face. Moonshot последовательно называет релиз «open weight», а не «open source» — и это различие важнее спецификаций и бенчмарков.

01

Ловушки перед ставкой на «полный релиз»

  1. 01

    Open source vs open weight: Заголовки пишут «open source», Moonshot говорит open weight — обучающие данные и полный код обучения не публикуются

  2. 02

    Self-hosting не для потребителей: 1,56 ТБ на 896 экспертах; Moonshot рекомендует суперузлы с 64+ ускорителями

  3. 03

    Новые коммерческие пороги: Кастомная лицензия: порог MaaS $20 млн и атрибуция при 100 млн MAU — в отличие от эры Modified MIT у K2

  4. 04

    Возможности ≠ лучшая цена: ~$0,95/задача в Intelligence Index — дешевле Claude Fable 5, но дороже GLM-5.2 (~$0,47)

  5. 05

    Геополитика и обвинения в дистилляции: Обвинения США в промышленной дистилляции за дни до публикации весов — отделяйте техническую ценность от compliance-риска

02

Open source или только open weight?

По определению Open Source Initiative настоящий open source требует публичных обучающих данных, кода обучения и воспроизводимого пайплайна — а не только обученных весов. Kimi K3 публикует веса, технический отчёт и инфраструктурные инструменты рядом с обучением, но не данные и не полный код.

Лицензия — полностью кастомный документ с двумя коммерческими порогами:

  1. 01

    Порог выручки MaaS: Выручка Model-as-a-Service свыше $20 млн за любые 12 месяцев требует отдельного соглашения с Moonshot

  2. 02

    Порог атрибуции: Продукты с 100 млн MAU или $20 млн месячной выручки должны заметно указывать «Kimi K3»

03

Kimi K3 кратко

ПараметрЗначение
Всего параметров2,8 трлн
Активных параметров~104 млрд
АрхитектураMixture-of-Experts (MoE)
Эксперты896 маршрутизируемых, 16 активных на токен + общие эксперты
ВниманиеKimi Delta Attention (KDA) + Gated MLA
Контекст1 000 000 токенов
МультимодальностьНативное зрение (ViT-V2, 27 слоёв)
Формат весовMXFP4 веса, MXFP8 активации
Размер загрузки~1,56 ТБ (Hugging Face)
ЛицензияКастомная — Moonshot называет «open weight», не «open source»
API доступен16 июля 2026
Полные веса опубликованы27 июля 2026
04

Архитектура: KDA, Attention Residuals и Per-Head Muon

Kimi Delta Attention (KDA)

KDA заменяет скалярный gate забывания на поканальное гейтирование — каждое измерение признака получает свою скорость затухания. Реализовано как chunkwise DPLR для линейной по времени рекурсии; K3 чередует KDA с глобальными слоями Gated MLA для 1M контекста при малом KV-кэше.

Attention Residuals (AttnRes)

AttnRes заменяет равномерное накопление остатков на входозависимую агрегацию по предыдущим слоям — ~25% прироста эффективности обучения при <2% дополнительных затрат. Псевдо-векторы запроса инициализируются нулём для стабильного раннего обучения.

Per-Head Muon и Stable LatentMoE

Muon работает на голову внимания; MoE маршрутизирует 896 экспертов с 16 активными на токен (~1,8% разреженность), Quantile Balancing и MoonEP для балансировки нагрузки.

05

Три инфраструктурных релиза

ТехнологияНазначениеКлючевые цифры
MoonEPMoE-коммуникация в экстремальном масштабеДублирует перегруженных экспертов; доказывает верхнюю границу избыточных экспертов на ранг
FlashKDACUTLASS KDA-ядра (ранее открыты)Prefill в 1,72–2,22× быстрее на H20 vs flash-linear-attention
AgentEnvПесочница Firecracker microVM с KVCache.aiЧекпоинт ~133 мс, возобновление ~49 мс, до 6,5× overcommit памяти (данные вендора)
06

Бенчмарки vs GPT-5.6, Claude и GLM-5.2

SWE-bench Verified (Vals AI, июль 2026): Claude Opus 5 97%, GPT-5.6 Sol 96,2%, Claude Fable 5 95%, Kimi K3 93,4%.

Artificial Analysis Intelligence Index (макс. рассуждение): Fable 5 60, GPT-5.6 Sol 59, K3 ~57 (#3 в целом, #1 open weight), GLM-5.2 51. Стоимость задачи ~$0,95 — примерно на 60% ниже Fable 5 (~$2,40), но выше GLM-5.2 (~$0,47). Потолок возможностей open-weight сегмента, не лучший по цене. K3 — #1 на Frontend Code Arena (Arena.ai).

API vs self-hosting

ПутьЛучше дляБарьер / стоимость
Официальный API (kimi-k3)Частные лица, быстрая проверка$0,30/M кэшированный ввод; $3/M miss; $15/M вывод
OpenRouter и др.Мультимодельная маршрутизация~7 провайдеров, в основном официальные цены
Полный self-hostingГипермасштаб, лаборатории1,56 ТБ + суперузел 64+ ускорителей
07

Пятиступенчатый чеклист внедрения

  1. 01

    Вызовите https://api.moonshot.ai/v1 с ID модели kimi-k3 через OpenAI-совместимый SDK; протестируйте длинный контекст и cache hits

  2. 02

    Сопоставьте нагрузку с сильными сторонами K3 (фронтенд-код, длинные документы) и пробелами по SWE-bench и AA Index

  3. 03

    Передайте юристам LICENSE на Hugging Face для проверки порогов MaaS и MAU

  4. 04

    При self-hosting: заложите 1,56 ТБ и 64+ ускорителя; оцените интеграцию MoonEP / FlashKDA

  5. 05

    Проверьте Kimi Code / мультимодельных агентов OpenClaw в реальной macOS GUI-сессии (см. VNCMac ниже)

08

Контекст США–Китай и WAIC 2026

Релиз пришёлся на WAIC 2026 и на дни после обвинений США в промышленной дистилляции модели Fable от Anthropic. Министерство торговли КНР ответило 28 июля. Через три дня Alibaba представила Qwen3.8-Max-Preview (2,4T) — гонка open weight вступила в «клуб 3T».

09

FAQ

Нет по стандартам OSI. Open weight: веса, отчёт и часть инфры публичны; обучающие данные и полный код обучения — нет.

Да в большинстве случаев. MaaS >$20 млн за 12 мес. или 100 млн MAU / $20 млн в месяц — дополнительные условия.

64+ ускорителя на суперузле. Остальным — API или OpenRouter.

Ниже топовых закрытых на SWE-bench (93,4% vs 95–97%), но сильнейшая open-weight модель на рынке.

~3× параметров, AttnRes + Per-Head Muon, больший контекст и мультимодальность; новый порог MaaS.

Итог

K3 превратил крупнейший open-weight заголовок в загрузку 1,56 ТБ — но open weight — это не open source, и большинство команд по-прежнему будут потреблять K3 через API. Если основная машина — Windows или Linux, а для Kimi Code, маршрутизации OpenClaw или iOS-билдов нужна настоящая macOS GUI, покупка Mac дорога, а SSH не нажмёт диалоги разрешений. Арендуйте удалённый Mac VNCMac почасово, проверяйте агентов по VNC и останавливайте оплату после проекта. См. тарифы аренды Mac или обзор Kimi K3 от 17 июля.

Источники: блог Moonshot AI, Hugging Face, Vals AI, Artificial Analysis, VentureBeat, Simon Willison. Перед продакшеном сверяйтесь с официальными данными.