7/27 晚权重上架 · 1.56TB Hugging Face · MoonEP / FlashKDA / AgentEnv · 自定义许可证 · API $0.30–$15/M
摘要:7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 完整模型权重与技术报告,并同步开源支撑训练的三项核心基础设施:MoonEP、FlashKDA、AgentEnv。K3 拥有 2.8 万亿总参数、约 1040 亿激活参数、100 万 token 上下文与原生视觉理解——这是全球首个被完整开放的 3 万亿参数级别模型,权重约 1.56TB,上线半小时内登顶 Hugging Face 趋势榜第一。本文严格依据官方发布与独立评测,覆盖时间线、架构创新、Infra 开源、跑分对比、开放权重许可门槛、API/自部署路径与中美 AI 争端背景,并附 FAQ。
「开源」与「开放权重」混用:媒体常说「开源」,但 Moonshot 官方始终使用 open weight——训练数据与完整训练代码并未公开
自部署门槛被低估:1.56TB 权重 + 896 专家 MoE,官方建议 64 卡以上超节点,与消费级硬件预期严重脱节
许可证新增商业门槛:K3 自定义许可含 Model-as-a-Service 年收入 2000 万美元门槛与 1 亿 MAU 展示义务,与 K2 时代 Modified MIT 不同
能力≠性价比:K3 是开源阵营能力天花板,但单任务成本约 $0.95,高于 GLM-5.2(约 $0.47)
地缘与蒸馏争议:权重开源前美方指控「工业化蒸馏」,需区分技术发布与合规/舆论风险
| 日期 | 事件 |
|---|---|
| 7 月 16 日夜 | Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首发(在线调用,权重未公开) |
| 7 月 17 日 | 行业密集分析架构;新华社称其为「目前全球参数最大的开源模型」 |
| 7 月 22–23 日 | 中美「模型蒸馏」争端升级:白宫科技顾问指控月之暗面蒸馏 Anthropic Fable;财长威胁制裁 |
| 7 月 27 日晚 23 点 | 完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源) |
| 7 月 28 日 | 中国商务部回应美方「AI 霸权主义」;国内媒体跟进开源细节 |
这次开源距离 K3 API 端首发仅 11 天——在 WAIC 2026 窗口期与中美 AI 争端叠加的背景下,月之暗面选择公开权重、技术报告与三项 Infra,某种程度上是用工程细节回应外界对其技术路径的质疑。
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE) |
| 专家配置 | 896 个路由专家,每 token 激活 16 个(另有共享专家) |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态能力 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 open source) |
可引用数据:896 选 16 稀疏度约 1.8% · 1M context · 1.56TB 下载 · MXFP4/MXFP8 原生低精度训练。
Kimi K3 重构了深度学习沿用多年的三大组件——注意力、残差连接、优化器,这也是它区别于「简单堆参数」的关键。
传统 Gated DeltaNet 使用标量级遗忘门;KDA 改为逐通道门控,每个特征维度拥有独立衰减率。采用 chunkwise DPLR 公式实现线性时间递归,K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合——这是支撑 100 万 token 上下文、同时压低 KV Cache 开销的核心。
AttnRes 将均匀累加改为依据输入动态聚合前面所有层输出,每层仅新增一个 RMSNorm 和一个伪查询向量,带来约 25% 训练效率提升,代价不到 2%。伪查询向量初始化为零,保证训练初期等价于均匀平均。
K3 将 Muon 优化器扩展为逐注意力头独立优化;MoE 层 896 选 16,配合 Quantile Balancing 与 MoonEP 解决专家负载不均衡。
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 通信库 | 临时复制过载专家保证各节点 token 均等;证明冗余专家数理论上界 |
| FlashKDA | 基于 CUTLASS 的 KDA 算子(此前已开源) | H20 上 prefill 较 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端 |
| AgentEnv | 与 KVCache.ai 联合的智能体沙箱(Firecracker microVM) | 面向大规模 Agent RL;官方披露 checkpoint 133ms、恢复 49ms、内存超分最高 6.5 倍(待第三方复现) |
以下优先引用独立第三方复测(Vals AI SWE-bench Verified,截至 2026 年 7 月):
| 模型 | SWE-bench Verified | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指数(max 推理档):Kimi K3 约 57,全球第 3、开源模型第 1;Claude Fable 5 为 60,GPT-5.6 Sol 为 59。单任务成本约 $0.95——比 Fable 5(约 $2.4)便宜约 60%,但高于 GLM-5.2(约 $0.47)。结论:开源阵营能力天花板最高,而非性价比最优。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。
| 路径 | 适合谁 | 门槛 / 成本 |
|---|---|---|
| 官方 API(kimi-k3) | 个人开发者、中小团队、快速验证 | 缓存命中 $0.30/M 输入;未命中 $3/M;输出 $15/M |
| OpenRouter 等第三方 | 需多模型路由、已有 OpenAI SDK 集成 | 约 7 家服务商,定价大多与官方一致 |
| 自托管完整权重 | 超大规模调用方、研究机构 | 1.56TB 存储 + 64 卡以上超节点 |
月之暗面官方材料从未使用 open source,一直采用 open weight 表述。按 OSI 标准,真正开源需公开训练数据、训练代码与可复现流程;K3 只公开权重、技术报告与推理相关 Infra。
许可证为完全自定义文件(不再自称 Modified MIT),含两道商业门槛:
Model-as-a-Service 收入门槛:若 MaaS 业务连续 12 个月累计收入超过 2000 万美元,须与月之暗面另行签署商业协议
规模展示门槛:月活超过 1 亿或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」字样
对绝大多数中小团队,两道门槛几乎不会触发;若商业计划是「拿 K3 开与月之暗面竞争的模型服务」,第一道门槛是法务重点。
在 https://api.moonshot.ai/v1 用 OpenAI SDK 兼容接口调用 kimi-k3,验证长上下文与缓存命中成本
对照 SWE-bench / AA Index,确认你的场景落在 K3 强项(前端代码、长文档)还是弱项
阅读 Hugging Face 仓库 LICENSE 全文,由法务评估 MaaS 与 MAU 门槛
若计划自托管:核算 1.56TB 存储与 64+ 卡预算;评估 MoonEP / FlashKDA 集成
在真实 macOS 图形环境中用 Kimi Code / OpenClaw 做多模型 Agent 验收(见下文 VNCMac 场景)
| Token 类型 | 价格(每百万 token) |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
Mooncake 分离式推理在典型编程负载上缓存命中率可达 90% 以上,实际成本更接近 $0.30 档。
K3 开源节点卡在 WAIC 2026 窗口期,叠加升级中的中美「模型蒸馏」争端。权重开源前几天,美方指控月之暗面「工业化蒸馏」Anthropic Fable 训练 K3;7 月 28 日中国商务部公开回应。三天后,阿里巴巴发布 24 万亿参数的 Qwen3.8-Max-Preview,国产大模型竞争进入「3T 俱乐部」阶段。
严格来说不是。它属于开放权重模型:权重、技术报告和部分 Infra 公开,但训练数据与完整训练代码未公开,不符合 OSI 开源定义。
绝大多数商业场景不受限制;MaaS 年收入超 2000 万美元或 MAU 超 1 亿/月收入超 2000 万美元时需满足许可特定条款。
官方建议 64 卡及以上超节点;个人与大部分企业更现实的路径是官方 API 或 OpenRouter。
开源阵营综合能力最强,AA 指数全球第 3;成本高于 GLM-5.2,属能力天花板而非性价比最优。
K3 参数约为 K2.5 的 3 倍,新增 AttnRes 与 Per-Head Muon,上下文与多模态大幅提升;许可新增 MaaS 收入门槛。
K3 把「全球最大开放权重」从预告变成了可下载的 1.56TB 现实——但权重开放 ≠ 人人本地可跑,也不等于 OSI 意义上的开源。若你主力机是 Windows/Linux,却要在真实 macOS 图形环境里跑 Kimi Code、对接 OpenClaw 多模型路由,或并行做 iOS 构建与 Agent 基准对照,自购 Mac 成本高、纯 SSH 又点不了系统弹窗。租用 VNCMac 远程 Mac 可按小时开通 VNC 桌面,在隔离节点上验收 K3 长上下文编程与 Agent 工作流。查看 Mac Mini M4 套餐;更多背景可参考站内 Kimi K3 深度评测与 蒸馏门周报。
数据来源:Moonshot AI 官方博客、Hugging Face、Vals AI、Artificial Analysis、VentureBeat、Simon Willison 博客等。发布前请以官方最新数据为准。