7/27 晚權重上架 · 1.56TB Hugging Face · MoonEP / FlashKDA / AgentEnv · 自訂許可證 · API $0.30–$15/M
摘要:7 月 27 日晚 23 點左右,月之暗面(Moonshot AI)正式發布 Kimi K3 完整模型權重與技術報告,並同步開源支撐訓練的三項核心基礎設施:MoonEP、FlashKDA、AgentEnv。K3 擁有 2.8 萬億總參數、約 1040 億激活參數、100 萬 token 上下文與原生視覺理解——這是全球首個被完整開放的 3 萬億參數級別模型,權重約 1.56TB,上線半小時內登頂 Hugging Face 趨勢榜第一。本文嚴格依據官方發布與獨立評測,涵蓋時間軸、架構創新、Infra 開源、跑分對比、開放權重許可門檻、API/自部署路徑與中美 AI 爭端背景,並附 FAQ。
「開源」與「開放權重」混用:媒體常說「開源」,但 Moonshot 官方始終使用 open weight——訓練資料與完整訓練程式碼並未公開
自部署門檻被低估:1.56TB 權重 + 896 專家 MoE,官方建議 64 卡以上超節點,與消費級硬體預期嚴重脫節
許可證新增商業門檻:K3 自訂許可含 Model-as-a-Service 年收入 2000 萬美元門檻與 1 億 MAU 展示義務,與 K2 時代 Modified MIT 不同
能力≠性價比:K3 是開源陣營能力天花板,但單任務成本約 $0.95,高於 GLM-5.2(約 $0.47)
地緣與蒸餾爭議:權重開源前美方指控「工業化蒸餾」,需區分技術發布與合規/輿論風險
| 日期 | 事件 |
|---|---|
| 7 月 16 日夜 | Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 API 首發(線上呼叫,權重未公開) |
| 7 月 17 日 | 業界密集分析架構;新華社稱其為「目前全球參數最大的開源模型」 |
| 7 月 22–23 日 | 中美「模型蒸餾」爭端升級:白宮科技顧問指控月之暗面蒸餾 Anthropic Fable;財長威脅制裁 |
| 7 月 27 日晚 23 點 | 完整權重、技術報告發布;MoonEP、AgentEnv 開源(FlashKDA 此前已開源) |
| 7 月 28 日 | 中國商務部回應美方「AI 霸權主義」;國內媒體跟進開源細節 |
這次開源距離 K3 API 端首發僅 11 天——在 WAIC 2026 視窗期與中美 AI 爭端疊加的背景下,月之暗面選擇公開權重、技術報告與三項 Infra,某種程度上是用工程細節回應外界對其技術路徑的質疑。
| 項目 | 參數 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T) |
| 激活參數量 | 約 1040 億 |
| 架構類型 | 混合專家模型(MoE) |
| 專家配置 | 896 個路由專家,每 token 激活 16 個(另有共享專家) |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA) |
| 上下文視窗 | 100 萬 token |
| 多模態能力 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 激活(SFT 階段起量化感知訓練) |
| 權重體積 | 約 1.56TB(Hugging Face) |
| License | 自訂許可證(官方稱 open weight,非 open source) |
可引用資料:896 選 16 稀疏度約 1.8% · 1M context · 1.56TB 下載 · MXFP4/MXFP8 原生低精度訓練。
Kimi K3 重構了深度學習沿用多年的三大組件——注意力、殘差連接、優化器,這也是它區別於「簡單堆參數」的關鍵。
傳統 Gated DeltaNet 使用標量級遺忘門;KDA 改為逐通道門控,每個特徵維度擁有獨立衰減率。採用 chunkwise DPLR 公式實現線性時間遞迴,K3 將 KDA 與少量全局注意力層(Gated MLA)交替混合——這是支撐 100 萬 token 上下文、同時壓低 KV Cache 開銷的核心。
AttnRes 將均勻累加改為依據輸入動態聚合前面所有層輸出,每層僅新增一個 RMSNorm 和一個偽查詢向量,帶來約 25% 訓練效率提升,代價不到 2%。偽查詢向量初始化為零,保證訓練初期等價於均勻平均。
K3 將 Muon 優化器擴展為逐注意力頭獨立優化;MoE 層 896 選 16,配合 Quantile Balancing 與 MoonEP 解決專家負載不均衡。
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 通訊庫 | 臨時複製過載專家保證各節點 token 均等;證明冗餘專家數理論上界 |
| FlashKDA | 基於 CUTLASS 的 KDA 運算子(此前已開源) | H20 上 prefill 較 flash-linear-attention 基線快 1.72–2.22 倍;可作為 chunk_kda 直接替代後端 |
| AgentEnv | 與 KVCache.ai 聯合的智慧代理人沙箱(Firecracker microVM) | 面向大規模 Agent RL;官方披露 checkpoint 133ms、恢復 49ms、記憶體超分最高 6.5 倍(待第三方複現) |
以下優先引用獨立第三方複測(Vals AI SWE-bench Verified,截至 2026 年 7 月):
| 模型 | SWE-bench Verified | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指數(max 推理檔):Kimi K3 約 57,全球第 3、開源模型第 1;Claude Fable 5 為 60,GPT-5.6 Sol 為 59。單任務成本約 $0.95——比 Fable 5(約 $2.4)便宜約 60%,但高於 GLM-5.2(約 $0.47)。結論:開源陣營能力天花板最高,而非性價比最優。K3 目前在 Arena.ai Frontend Code Arena 榜單排名第一。
| 路徑 | 適合誰 | 門檻/成本 |
|---|---|---|
| 官方 API(kimi-k3) | 個人開發者、中小團隊、快速驗證 | 快取命中 $0.30/M 輸入;未命中 $3/M;輸出 $15/M |
| OpenRouter 等第三方 | 需多模型路由、已有 OpenAI SDK 整合 | 約 7 家服務商,定價大多與官方一致 |
| 自託管完整權重 | 超大規模呼叫方、研究機構 | 1.56TB 儲存 + 64 卡以上超節點 |
月之暗面官方材料從未使用 open source,一直採用 open weight 表述。按 OSI 標準,真正開源需公開訓練資料、訓練程式碼與可複現流程;K3 只公開權重、技術報告與推理相關 Infra。
許可證為完全自訂檔案(不再自稱 Modified MIT),含兩道商業門檻:
Model-as-a-Service 收入門檻:若 MaaS 業務連續 12 個月累計收入超過 2000 萬美元,須與月之暗面另行簽署商業協議
規模展示門檻:月活超過 1 億或月收入超過 2000 萬美元,須在介面顯著展示「Kimi K3」字樣
對絕大多數中小團隊,兩道門檻幾乎不會觸發;若商業計畫是「拿 K3 開與月之暗面競爭的模型服務」,第一道門檻是法務重點。
在 https://api.moonshot.ai/v1 用 OpenAI SDK 相容介面呼叫 kimi-k3,驗證長上下文與快取命中成本
對照 SWE-bench / AA Index,確認你的場景落在 K3 強項(前端程式碼、長文件)還是弱項
閱讀 Hugging Face 倉庫 LICENSE 全文,由法務評估 MaaS 與 MAU 門檻
若計畫自託管:核算 1.56TB 儲存與 64+ 卡預算;評估 MoonEP / FlashKDA 整合
在真實 macOS 圖形環境中用 Kimi Code / OpenClaw 做多模型 Agent 驗收(見下文 VNCMac 場景)
| Token 類型 | 價格(每百萬 token) |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
Mooncake 分離式推理在典型編程負載上快取命中率可達 90% 以上,實際成本更接近 $0.30 檔。
K3 開源節點卡在 WAIC 2026 視窗期,疊加升級中的中美「模型蒸餾」爭端。權重開源前幾天,美方指控月之暗面「工業化蒸餾」Anthropic Fable 訓練 K3;7 月 28 日中國商務部公開回應。三天後,阿里巴巴發布 24 萬億參數的 Qwen3.8-Max-Preview,國產大模型競爭進入「3T 俱樂部」階段。
嚴格來說不是。它屬於開放權重模型:權重、技術報告和部分 Infra 公開,但訓練資料與完整訓練程式碼未公開,不符合 OSI 開源定義。
絕大多數商業場景不受限制;MaaS 年收入超 2000 萬美元或 MAU 超 1 億/月收入超 2000 萬美元時需滿足許可特定條款。
官方建議 64 卡及以上超節點;個人與大部分企業更現實的路徑是官方 API 或 OpenRouter。
開源陣營綜合能力最強,AA 指數全球第 3;成本高於 GLM-5.2,屬能力天花板而非性價比最優。
K3 參數約為 K2.5 的 3 倍,新增 AttnRes 與 Per-Head Muon,上下文與多模態大幅提升;許可新增 MaaS 收入門檻。
K3 把「全球最大開放權重」從預告變成了可下載的 1.56TB 現實——但權重開放 ≠ 人人本地可跑,也不等於 OSI 意義上的開源。若你主力機是 Windows/Linux,卻要在真實 macOS 圖形環境裡跑 Kimi Code、對接 OpenClaw 多模型路由,或並行做 iOS 建置與 Agent 基準對照,自購 Mac 成本高、純 SSH 又點不了系統彈窗。租用 VNCMac 遠端 Mac 可按小時開通 VNC 桌面,在隔離節點上驗收 K3 長上下文編程與 Agent 工作流。查看 Mac Mini M4 套餐;更多背景可參考站內 Kimi K3 深度評測與 蒸餾門週報。
資料來源:Moonshot AI 官方部落格、Hugging Face、Vals AI、Artificial Analysis、VentureBeat、Simon Willison 部落格等。發布前請以官方最新資料為準。