开放权重 2026年7月28日 约 24 分钟 Kimi K3 月之暗面

Kimi K3 全面开源
2.8 万亿参数、百万上下文,月之暗面这次放了什么大招

7/27 晚权重上架 · 1.56TB Hugging Face · MoonEP / FlashKDA / AgentEnv · 自定义许可证 · API $0.30–$15/M

Kimi K3 全面开源 2.8 万亿参数 MoE 大模型概念图

摘要:7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 完整模型权重与技术报告,并同步开源支撑训练的三项核心基础设施:MoonEP、FlashKDA、AgentEnv。K3 拥有 2.8 万亿总参数、约 1040 亿激活参数、100 万 token 上下文与原生视觉理解——这是全球首个被完整开放的 3 万亿参数级别模型,权重约 1.56TB,上线半小时内登顶 Hugging Face 趋势榜第一。本文严格依据官方发布与独立评测,覆盖时间线、架构创新、Infra 开源、跑分对比、开放权重许可门槛、API/自部署路径与中美 AI 争端背景,并附 FAQ。

01

选型前的痛点:为什么「全面开源」仍要读懂细节

  1. 01

    「开源」与「开放权重」混用:媒体常说「开源」,但 Moonshot 官方始终使用 open weight——训练数据与完整训练代码并未公开

  2. 02

    自部署门槛被低估:1.56TB 权重 + 896 专家 MoE,官方建议 64 卡以上超节点,与消费级硬件预期严重脱节

  3. 03

    许可证新增商业门槛:K3 自定义许可含 Model-as-a-Service 年收入 2000 万美元门槛与 1 亿 MAU 展示义务,与 K2 时代 Modified MIT 不同

  4. 04

    能力≠性价比:K3 是开源阵营能力天花板,但单任务成本约 $0.95,高于 GLM-5.2(约 $0.47)

  5. 05

    地缘与蒸馏争议:权重开源前美方指控「工业化蒸馏」,需区分技术发布与合规/舆论风险

02

时间线:从 API 首发到全面开源,只用了 11 天

日期事件
7 月 16 日夜Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首发(在线调用,权重未公开)
7 月 17 日行业密集分析架构;新华社称其为「目前全球参数最大的开源模型」
7 月 22–23 日中美「模型蒸馏」争端升级:白宫科技顾问指控月之暗面蒸馏 Anthropic Fable;财长威胁制裁
7 月 27 日晚 23 点完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源)
7 月 28 日中国商务部回应美方「AI 霸权主义」;国内媒体跟进开源细节

这次开源距离 K3 API 端首发仅 11 天——在 WAIC 2026 窗口期与中美 AI 争端叠加的背景下,月之暗面选择公开权重、技术报告与三项 Infra,某种程度上是用工程细节回应外界对其技术路径的质疑。

03

Kimi K3 核心参数一览

项目参数
总参数量2.8 万亿(2.8T)
激活参数量约 1040 亿
架构类型混合专家模型(MoE)
专家配置896 个路由专家,每 token 激活 16 个(另有共享专家)
注意力机制Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口100 万 token
多模态能力原生视觉理解(ViT-V2,27 层)
权重格式MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练)
权重体积约 1.56TB(Hugging Face)
License自定义许可证(官方称 open weight,非 open source)

可引用数据:896 选 16 稀疏度约 1.8% · 1M context · 1.56TB 下载 · MXFP4/MXFP8 原生低精度训练。

04

三大架构创新:KDA、AttnRes 与 Per-Head Muon

Kimi K3 重构了深度学习沿用多年的三大组件——注意力、残差连接、优化器,这也是它区别于「简单堆参数」的关键。

Kimi Delta Attention(KDA):让「遗忘」变得更精细

传统 Gated DeltaNet 使用标量级遗忘门;KDA 改为逐通道门控,每个特征维度拥有独立衰减率。采用 chunkwise DPLR 公式实现线性时间递归,K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合——这是支撑 100 万 token 上下文、同时压低 KV Cache 开销的核心。

Attention Residuals(AttnRes):残差连接选择性聚合

AttnRes 将均匀累加改为依据输入动态聚合前面所有层输出,每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,代价不到 2%。伪查询向量初始化为零,保证训练初期等价于均匀平均。

Per-Head Muon 与 Stable LatentMoE

K3 将 Muon 优化器扩展为逐注意力头独立优化;MoE 层 896 选 16,配合 Quantile Balancing 与 MoonEP 解决专家负载不均衡。

05

三大开源 Infra:MoonEP、FlashKDA、AgentEnv

技术定位关键能力
MoonEP超大规模细粒度 MoE 通信库临时复制过载专家保证各节点 token 均等;证明冗余专家数理论上界
FlashKDA基于 CUTLASS 的 KDA 算子(此前已开源)H20 上 prefill 较 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端
AgentEnv与 KVCache.ai 联合的智能体沙箱(Firecracker microVM)面向大规模 Agent RL;官方披露 checkpoint 133ms、恢复 49ms、内存超分最高 6.5 倍(待第三方复现)
06

跑分对比:与 GPT-5.6、Claude、GLM-4.5

以下优先引用独立第三方复测(Vals AI SWE-bench Verified,截至 2026 年 7 月):

模型SWE-bench Verified发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指数(max 推理档):Kimi K3 约 57,全球第 3、开源模型第 1;Claude Fable 5 为 60,GPT-5.6 Sol 为 59。单任务成本约 $0.95——比 Fable 5(约 $2.4)便宜约 60%,但高于 GLM-5.2(约 $0.47)。结论:开源阵营能力天花板最高,而非性价比最优。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。

API vs 自部署决策矩阵

路径适合谁门槛 / 成本
官方 API(kimi-k3)个人开发者、中小团队、快速验证缓存命中 $0.30/M 输入;未命中 $3/M;输出 $15/M
OpenRouter 等第三方需多模型路由、已有 OpenAI SDK 集成约 7 家服务商,定价大多与官方一致
自托管完整权重超大规模调用方、研究机构1.56TB 存储 + 64 卡以上超节点
07

开放权重 vs 开源:许可证两道商业门槛

月之暗面官方材料从未使用 open source,一直采用 open weight 表述。按 OSI 标准,真正开源需公开训练数据、训练代码与可复现流程;K3 只公开权重、技术报告与推理相关 Infra。

许可证为完全自定义文件(不再自称 Modified MIT),含两道商业门槛:

  1. 01

    Model-as-a-Service 收入门槛:若 MaaS 业务连续 12 个月累计收入超过 2000 万美元,须与月之暗面另行签署商业协议

  2. 02

    规模展示门槛:月活超过 1 亿或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」字样

对绝大多数中小团队,两道门槛几乎不会触发;若商业计划是「拿 K3 开与月之暗面竞争的模型服务」,第一道门槛是法务重点。

08

落地步骤:从 API 验收到权重核对(5 步)

  1. 01

    https://api.moonshot.ai/v1 用 OpenAI SDK 兼容接口调用 kimi-k3,验证长上下文与缓存命中成本

  2. 02

    对照 SWE-bench / AA Index,确认你的场景落在 K3 强项(前端代码、长文档)还是弱项

  3. 03

    阅读 Hugging Face 仓库 LICENSE 全文,由法务评估 MaaS 与 MAU 门槛

  4. 04

    若计划自托管:核算 1.56TB 存储与 64+ 卡预算;评估 MoonEP / FlashKDA 集成

  5. 05

    在真实 macOS 图形环境中用 Kimi Code / OpenClaw 做多模型 Agent 验收(见下文 VNCMac 场景)

API 定价表

Token 类型价格(每百万 token)
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出(含推理过程)$15.00

Mooncake 分离式推理在典型编程负载上缓存命中率可达 90% 以上,实际成本更接近 $0.30 档。

09

中美 AI 竞赛与 WAIC 2026 背景

K3 开源节点卡在 WAIC 2026 窗口期,叠加升级中的中美「模型蒸馏」争端。权重开源前几天,美方指控月之暗面「工业化蒸馏」Anthropic Fable 训练 K3;7 月 28 日中国商务部公开回应。三天后,阿里巴巴发布 24 万亿参数的 Qwen3.8-Max-Preview,国产大模型竞争进入「3T 俱乐部」阶段。

10

常见问题(FAQ)

严格来说不是。它属于开放权重模型:权重、技术报告和部分 Infra 公开,但训练数据与完整训练代码未公开,不符合 OSI 开源定义。

绝大多数商业场景不受限制;MaaS 年收入超 2000 万美元或 MAU 超 1 亿/月收入超 2000 万美元时需满足许可特定条款。

官方建议 64 卡及以上超节点;个人与大部分企业更现实的路径是官方 API 或 OpenRouter。

开源阵营综合能力最强,AA 指数全球第 3;成本高于 GLM-5.2,属能力天花板而非性价比最优。

K3 参数约为 K2.5 的 3 倍,新增 AttnRes 与 Per-Head Muon,上下文与多模态大幅提升;许可新增 MaaS 收入门槛。

结语

K3 把「全球最大开放权重」从预告变成了可下载的 1.56TB 现实——但权重开放 ≠ 人人本地可跑,也不等于 OSI 意义上的开源。若你主力机是 Windows/Linux,却要在真实 macOS 图形环境里跑 Kimi Code、对接 OpenClaw 多模型路由,或并行做 iOS 构建与 Agent 基准对照,自购 Mac 成本高、纯 SSH 又点不了系统弹窗。租用 VNCMac 远程 Mac 可按小时开通 VNC 桌面,在隔离节点上验收 K3 长上下文编程与 Agent 工作流。查看 Mac Mini M4 套餐;更多背景可参考站内 Kimi K3 深度评测蒸馏门周报

数据来源:Moonshot AI 官方博客、Hugging Face、Vals AI、Artificial Analysis、VentureBeat、Simon Willison 博客等。发布前请以官方最新数据为准。