开源权重 2026年7月22日 约 22 分钟 Kimi K3 7月27日

Kimi K3 开源权重 7 月 27 日发布
2.8 万亿参数、百万上下文,闭源溢价还守得住吗?

距权重公开还有 5 天 · Modified MIT · AA Index 57.1 · 自部署 1.4TB · API $3/$15 · 发布日核对清单

Kimi K3 开源权重 7 月 27 日发布 2.8 万亿参数概念图

摘要:如果你在等「史上最大开源权重」落地——答案很明确:月之暗面(Moonshot AI)将于 2026 年 7 月 27 日在 Hugging Face 以 Modified MIT 许可公开 Kimi K3 完整 2.8 万亿参数权重,同步发布技术报告。API 与 Kimi 全家桶已于 7 月 16 日上线。本文严格覆盖调研要点:两个发布日期的区别、全量规格与跑分、$3/$15 定价与缓存真实成本、1.4TB / 64+ 加速器自部署门槛、7 月 27 日核对清单,以及「开源追平闭源」的行业判断——并诚实说明 K3 不是 Fable 5 杀手,却以约三分之一成本达到接近前沿的能力。

01

事件核心:TL;DR

7 月 16 日:Kimi K3 通过 Kimi App、Kimi Work、Kimi Code 与 API 全面上线;Artificial Analysis 同日发布独立评测。

7 月 17 日:上海世界人工智能大会(WAIC)开幕,新华社将 K3 定调为「国家级里程碑」。

7 月 27 日:完整 2.8T 权重上架 Moonshot Hugging Face 组织(Modified MIT)+ 技术报告(架构、训练、评估细节)。

关键结论:K3 是全球首个 3 万亿参数级(实际 2.8T)开源权重模型,被普遍视为对闭源溢价定价的直接冲击;但综合智能仍排第三(AA Intelligence Index 57.1,落后 Claude Fable 5 的 59.9 与 GPT-5.6 Sol 的 58.9)。优势在于:开源权重 + 100 万 token 上下文,以及以约 1/3 成本达到接近前沿的能力——闭源模型给不了的两样东西。

选型前的痛点

  1. 01

    两个日期混淆:API 已可用,权重尚未下载——搜索「K3 开源」常误把 7/16 当最终节点

  2. 02

    「本地跑 K3」标题党:1.4TB 4-bit 权重 + 64+ 加速器,与笔记本/Ollama 预期严重脱节

  3. 03

    闭源依赖溢价:Fable 5 单任务成本约为 K3 的 2.9 倍(AA 实测 $0.94 vs 更高档)

  4. 04

    长上下文 KV 成本:多数标称长窗口模型实际可用长度远低于 1M

  5. 05

    政策/区域风险:闭源可被下架;已发布的开源权重无法被「关掉」

02

时间线:API 上线 vs 权重开源

日期事件
2026-07-16Kimi K3 通过 API / Kimi 全家桶上线;Artificial Analysis 同日发布独立评测
2026-07-17WAIC 开幕,新华社定调 K3 为国家级里程碑
2026-07-27完整权重 Hugging Face 下载(Modified MIT)+ 技术报告发布

当前最大搜索困惑是:「K3 已经开源了吗?」——API 与产品端已可用,但完整权重文件仍以 7 月 27 日为节点。发布日后需把「scheduled for release」更新为「now available」,并附上 HF 直链——这是抢「K3 权重下载」流量的关键动作。

03

模型规格一览

项目数据
总参数量2.8 万亿(2.8T),史上最大开源权重模型
架构稀疏 MoE:Stable LatentMoE,896 专家中每 token 激活 16 个
注意力Kimi Delta Attention(KDA,混合线性注意力)+ AttnRes + Gated MLA
上下文1,048,576 tokens(约 100 万)
模态原生视觉(文本+图像,产品端支持视频),输出为文本
权重格式MXFP4 权重 + MXFP8 激活(原生低精度训练,4-bit 接近训练精度)
扩展效率官方称较 K2 提升约 2.5 倍
训练稳定性Quantile Balancing、Per-Head Muon、SiTU 激活函数
长上下文解码KDA 在百万 token 下最高 6.3 倍解码加速

可引用数据:896 专家 / 激活 16 个 · 1M context · KDA 6.3× 解码 · 2.5× 相对 K2 扩展效率。

04

跑分:K3 对比 Claude Fable 5 与 GPT-5.6 Sol

综合智能(Artificial Analysis Intelligence Index)

模型分数备注
Claude Fable 559.9第 1
GPT-5.6 Sol58.9第 2
Kimi K357.1第 3 / 189

K3 领先或打平的项目

  • Frontend Code Arena:盲测中开发者偏好其 UI 代码超过 Fable 与 Sol(第 1
  • Automation Bench、SpreadsheetBench 2:第 1
  • BrowseComp:91.2(第 1;配合 1M 无压缩策略可达 90.4+)
  • SWE Marathon(超长编码会话):42.0,明显领先(GPT-5.5 / GLM-5.2 崩到十几分)
  • Terminal Bench 2.1:88.3,与 Sol 的 88.8 基本打平
  • Program Bench:77.8,微超 Sol 的 77.6
  • FrontierSWE:81.2,大幅超 Sol 的 71.3(但落后 Fable 5 的 86.6)

K3 仍落后的项目

  • GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748(长程判断力仍是 Fable 天下)
  • DeepSWE:67.5 vs Sol 的 73.0
  • 幻觉率较 K2.6 有所上升(官方承认);Reddit 有用户反馈接入自建应用后幻觉多于顶级闭源
  • 对话打磨度、单次会话方差仍逊于 Fable 5 / Sol

官方的诚实态度(值得引用):月之暗面罕见地主动承认综合性能仍落后 Fable 5 和 GPT-5.6 Sol,并列出已知短板——对 harness 传回推理内容敏感、意图模糊时过于主动等。基准经不同 harness 跑分,独立复现仍在进行(评测日期:2026-07-16)。

05

API 定价与缓存后的真实成本

项目价格(每百万 tokens)
输入(缓存未命中)$3.00
输入(缓存命中,自动缓存)$0.30
输出$15.00
  • 定价刻意对齐西方标准(走「质量牌」而非「低价牌」),是中国大模型厂商中最高档之一,仍显著低于 Claude Opus 4.8 单任务成本
  • Artificial Analysis 实测单任务成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%
  • 编码类工作负载缓存命中率据称超 90%,实际成本远低于表面单价
06

7 月 27 日开源发布:会发生什么

  • 完整 2.8T 权重上架 Moonshot Hugging Face 组织,Modified MIT 许可证(具体条款以发布日 LICENSE 原文为准)
  • 同步发布技术报告(架构、训练、评估细节)
  • vLLM 对 KDA / prefix caching 的支持将随权重落地(官方正与推理伙伴对齐)
  • 预期后续:Ollama、GGUF 量化版本将像 K2 系列一样陆续跟进

注意术语:英文社区严格区分 open weights(只放权重)与 open source(含训练代码/数据)。K3 属于前者——这本身是值得写进 FAQ 的精准信息。

07

本地部署现实:别被「笔记本能跑」忽悠

诚实结论:这不是消费级硬件能跑的模型。

  • 4-bit 权重约 1.4 TB;官方建议 64+ 加速器的「超节点」部署,需专家并行 + 张量并行
  • 参照:上一代 1T 参数的 K2.7 Code,INT4 也要约 577 GB 显存;K3 是其 2.8 倍
  • 对绝大多数人正确答案是 API($3/$15);自部署只在三种场景成立:严格数据驻留 / 离线要求、需在自有数据上微调、调用量大到自建硬件反而便宜

7 月 27 日发布日核对清单

  1. 01

    HF 仓库文件是否齐全(分片、索引、config)

  2. 02

    LICENSE 原文(Modified MIT 具体条款)

  3. 03

    量化版本(MXFP4 / GGUF 等)是否同步

  4. 04

    vLLM / SGLang 启动命令与最低可行硬件说明

  5. 05

    独立第三方长上下文复测与 BrowseComp 复现

08

行业意义:闭源溢价还守得住吗?

  1. 01

    能力差距在前沿基本闭合:AA Index 差距从「数百分」缩到「两三分」,闭源厂商难再纯靠能力证明溢价

  2. 02

    地缘背景:发布赶在 WAIC 前;一个月前美国政府曾短暂下架 Anthropic Fable/Mythos(7 月 1 日恢复)——「监管可以关掉闭源,关不掉已发布的开源权重」

  3. 03

    中国厂商梯队集体逼近:Z.ai GLM-5.2(编码对标 Opus 4.8、价格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等——K3 是这波浪潮最高点

  4. 04

    月之暗面翻身仗:2025 年初被 DeepSeek R1 冲击后排名跌至国内第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 开源路线重建地位

使用路径决策矩阵

场景推荐路径原因
立即试用 / 编码 AgentAPI 或 Kimi Code7/16 已上线,缓存降本
7/27 后微调 / 数据驻留自托管(64+ 卡)需完整权重 + 合规
成本极度敏感DeepSeek V4 Pro API输出 $3.48/M
长程推理 / GDPval 类Claude Fable 5综合与长程判断力领先
等 GGUF / Ollama关注 K2 系列跟进节奏K3 量化版不会 Day-0 到消费级

五条落地步骤(发布前可先做)

  1. 01

    platform.kimi.ai 开通 API,模型 ID kimi-k3

  2. 02

    用 Kimi Code / OpenRouter(moonshotai/kimi-k3)跑一条长上下文任务验证缓存

  3. 03

    对照本文跑分表,确认你的场景落在 K3 强项(SWE Marathon / Frontend)还是弱项(DeepSWE / GDPval)

  4. 04

    7/27 前 bookmark Moonshot Hugging Face 组织页面

  5. 05

    若计划自托管:提前核算 1.4TB 存储与 64+ 卡预算,否则锁定 API 配额

信源清单

  • 官方:kimi.com/en/blog/kimi-k3platform.kimi.ai
  • 独立评测:Artificial Analysis(Intelligence Index 57.1,7 月 16 日)
  • 深度报道:VentureBeat、Northflank(自部署分析)
  • 社区:r/LocalLLaMA(benchmaxxed 质疑、open-weight 定义之争)、Hacker News
09

常见问题(FAQ)

2026 年 7 月 27 日 Hugging Face 开放完整 2.8T 权重 + 技术报告;API 已于 7 月 16 日上线。

kimi.com 可免费使用;API 输入 $3/M、缓存 $0.30/M、输出 $15/M tokens。

4-bit 约 1.4TB,需 64+ 加速器超节点;消费级 GPU 不现实,多数人应走 API。

K3 参数与上下文更大、多项编程基准更强;DeepSeek V4 Pro API 成本显著更低。

综合 AA Index 仍排第三;编码/UI 部分场景领先,单任务成本比 Fable 5 低 65.8%。

计划 Modified MIT;以 7 月 27 日 Hugging Face LICENSE 原文为准。

结语

K3 把「全球最大开源权重」从倒计时变成了可执行的日历事件——但权重开放 ≠ 人人本地可跑。1.4TB 与 64+ 卡门槛意味着:绝大多数开发者仍会在 API、Kimi Code 与 OpenRouter 上消费 K3;真正自托管的是机构与超大规模调用方。若你主力机是 Windows/Linux,却要在真实 macOS 图形环境里跑 Kimi Code Agent、对接 OpenClaw 多模型路由、或并行做 iOS 构建对照基准,自购 Mac 成本高、纯 SSH 又点不了系统弹窗。租用 VNCMac 远程 Mac 可按小时开通 VNC 桌面,在隔离节点上验收 K3 长上下文编程与 Agent 工作流,项目结束即停租。查看 Mac Mini M4 套餐 即可开始;更多架构细节可参考站内 7 月 17 日 Kimi K3 深度评测