距权重公开还有 5 天 · Modified MIT · AA Index 57.1 · 自部署 1.4TB · API $3/$15 · 发布日核对清单
摘要:如果你在等「史上最大开源权重」落地——答案很明确:月之暗面(Moonshot AI)将于 2026 年 7 月 27 日在 Hugging Face 以 Modified MIT 许可公开 Kimi K3 完整 2.8 万亿参数权重,同步发布技术报告。API 与 Kimi 全家桶已于 7 月 16 日上线。本文严格覆盖调研要点:两个发布日期的区别、全量规格与跑分、$3/$15 定价与缓存真实成本、1.4TB / 64+ 加速器自部署门槛、7 月 27 日核对清单,以及「开源追平闭源」的行业判断——并诚实说明 K3 不是 Fable 5 杀手,却以约三分之一成本达到接近前沿的能力。
7 月 16 日:Kimi K3 通过 Kimi App、Kimi Work、Kimi Code 与 API 全面上线;Artificial Analysis 同日发布独立评测。
7 月 17 日:上海世界人工智能大会(WAIC)开幕,新华社将 K3 定调为「国家级里程碑」。
7 月 27 日:完整 2.8T 权重上架 Moonshot Hugging Face 组织(Modified MIT)+ 技术报告(架构、训练、评估细节)。
关键结论:K3 是全球首个 3 万亿参数级(实际 2.8T)开源权重模型,被普遍视为对闭源溢价定价的直接冲击;但综合智能仍排第三(AA Intelligence Index 57.1,落后 Claude Fable 5 的 59.9 与 GPT-5.6 Sol 的 58.9)。优势在于:开源权重 + 100 万 token 上下文,以及以约 1/3 成本达到接近前沿的能力——闭源模型给不了的两样东西。
两个日期混淆:API 已可用,权重尚未下载——搜索「K3 开源」常误把 7/16 当最终节点
「本地跑 K3」标题党:1.4TB 4-bit 权重 + 64+ 加速器,与笔记本/Ollama 预期严重脱节
闭源依赖溢价:Fable 5 单任务成本约为 K3 的 2.9 倍(AA 实测 $0.94 vs 更高档)
长上下文 KV 成本:多数标称长窗口模型实际可用长度远低于 1M
政策/区域风险:闭源可被下架;已发布的开源权重无法被「关掉」
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 通过 API / Kimi 全家桶上线;Artificial Analysis 同日发布独立评测 |
| 2026-07-17 | WAIC 开幕,新华社定调 K3 为国家级里程碑 |
| 2026-07-27 | 完整权重 Hugging Face 下载(Modified MIT)+ 技术报告发布 |
当前最大搜索困惑是:「K3 已经开源了吗?」——API 与产品端已可用,但完整权重文件仍以 7 月 27 日为节点。发布日后需把「scheduled for release」更新为「now available」,并附上 HF 直链——这是抢「K3 权重下载」流量的关键动作。
| 项目 | 数据 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T),史上最大开源权重模型 |
| 架构 | 稀疏 MoE:Stable LatentMoE,896 专家中每 token 激活 16 个 |
| 注意力 | Kimi Delta Attention(KDA,混合线性注意力)+ AttnRes + Gated MLA |
| 上下文 | 1,048,576 tokens(约 100 万) |
| 模态 | 原生视觉(文本+图像,产品端支持视频),输出为文本 |
| 权重格式 | MXFP4 权重 + MXFP8 激活(原生低精度训练,4-bit 接近训练精度) |
| 扩展效率 | 官方称较 K2 提升约 2.5 倍 |
| 训练稳定性 | Quantile Balancing、Per-Head Muon、SiTU 激活函数 |
| 长上下文解码 | KDA 在百万 token 下最高 6.3 倍解码加速 |
可引用数据:896 专家 / 激活 16 个 · 1M context · KDA 6.3× 解码 · 2.5× 相对 K2 扩展效率。
| 模型 | 分数 | 备注 |
|---|---|---|
| Claude Fable 5 | 59.9 | 第 1 |
| GPT-5.6 Sol | 58.9 | 第 2 |
| Kimi K3 | 57.1 | 第 3 / 189 |
官方的诚实态度(值得引用):月之暗面罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板——对 harness 传回推理内容敏感、意图模糊时过于主动等。基准经不同 harness 跑分,独立复现仍在进行(评测日期:2026-07-16)。
| 项目 | 价格(每百万 tokens) |
|---|---|
| 输入(缓存未命中) | $3.00 |
| 输入(缓存命中,自动缓存) | $0.30 |
| 输出 | $15.00 |
注意术语:英文社区严格区分 open weights(只放权重)与 open source(含训练代码/数据)。K3 属于前者——这本身是值得写进 FAQ 的精准信息。
诚实结论:这不是消费级硬件能跑的模型。
HF 仓库文件是否齐全(分片、索引、config)
LICENSE 原文(Modified MIT 具体条款)
量化版本(MXFP4 / GGUF 等)是否同步
vLLM / SGLang 启动命令与最低可行硬件说明
独立第三方长上下文复测与 BrowseComp 复现
能力差距在前沿基本闭合:AA Index 差距从「数百分」缩到「两三分」,闭源厂商难再纯靠能力证明溢价
地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic Fable/Mythos(7 月 1 日恢复)——「监管可以关掉闭源,关不掉已发布的开源权重」
中国厂商梯队集体逼近:Z.ai GLM-5.2(编码对标 Opus 4.8、价格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等——K3 是这波浪潮最高点
月之暗面翻身仗:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 开源路线重建地位
| 场景 | 推荐路径 | 原因 |
|---|---|---|
| 立即试用 / 编码 Agent | API 或 Kimi Code | 7/16 已上线,缓存降本 |
| 7/27 后微调 / 数据驻留 | 自托管(64+ 卡) | 需完整权重 + 合规 |
| 成本极度敏感 | DeepSeek V4 Pro API | 输出 $3.48/M |
| 长程推理 / GDPval 类 | Claude Fable 5 | 综合与长程判断力领先 |
| 等 GGUF / Ollama | 关注 K2 系列跟进节奏 | K3 量化版不会 Day-0 到消费级 |
在 platform.kimi.ai 开通 API,模型 ID kimi-k3
用 Kimi Code / OpenRouter(moonshotai/kimi-k3)跑一条长上下文任务验证缓存
对照本文跑分表,确认你的场景落在 K3 强项(SWE Marathon / Frontend)还是弱项(DeepSWE / GDPval)
7/27 前 bookmark Moonshot Hugging Face 组织页面
若计划自托管:提前核算 1.4TB 存储与 64+ 卡预算,否则锁定 API 配额
2026 年 7 月 27 日 Hugging Face 开放完整 2.8T 权重 + 技术报告;API 已于 7 月 16 日上线。
kimi.com 可免费使用;API 输入 $3/M、缓存 $0.30/M、输出 $15/M tokens。
4-bit 约 1.4TB,需 64+ 加速器超节点;消费级 GPU 不现实,多数人应走 API。
K3 参数与上下文更大、多项编程基准更强;DeepSeek V4 Pro API 成本显著更低。
综合 AA Index 仍排第三;编码/UI 部分场景领先,单任务成本比 Fable 5 低 65.8%。
计划 Modified MIT;以 7 月 27 日 Hugging Face LICENSE 原文为准。
K3 把「全球最大开源权重」从倒计时变成了可执行的日历事件——但权重开放 ≠ 人人本地可跑。1.4TB 与 64+ 卡门槛意味着:绝大多数开发者仍会在 API、Kimi Code 与 OpenRouter 上消费 K3;真正自托管的是机构与超大规模调用方。若你主力机是 Windows/Linux,却要在真实 macOS 图形环境里跑 Kimi Code Agent、对接 OpenClaw 多模型路由、或并行做 iOS 构建对照基准,自购 Mac 成本高、纯 SSH 又点不了系统弹窗。租用 VNCMac 远程 Mac 可按小时开通 VNC 桌面,在隔离节点上验收 K3 长上下文编程与 Agent 工作流,项目结束即停租。查看 Mac Mini M4 套餐 即可开始;更多架构细节可参考站内 7 月 17 日 Kimi K3 深度评测。