距權重公開僅剩 5 天 · Modified MIT · AA Index 57.1 · 自部署 1.4TB · API $3/$15 · 發布日核對清單
摘要:若你在等「史上最大開源權重」落地——答案很明確:月之暗面(Moonshot AI)將於 2026 年 7 月 27 日在 Hugging Face 以 Modified MIT 許可公開 Kimi K3 完整 2.8 萬億參數權重,同步發布技術報告。API 與 Kimi 全家桶已於 7 月 16 日上線。本文嚴格涵蓋調研要點:兩個發布日期的區別、全量規格與基準測試、$3/$15 定價與快取真實成本、1.4TB / 64+ 加速器自部署門檻、7 月 27 日核對清單,以及「開源追平閉源」的業界判斷——並誠實說明 K3 並非 Fable 5 殺手,卻以約三分之一成本達到接近前沿的能力。
7 月 16 日:Kimi K3 透過 Kimi App、Kimi Work、Kimi Code 與 API 全面上線;Artificial Analysis 同日發布獨立評測。
7 月 17 日:上海世界人工智慧大會(WAIC)開幕,新華社將 K3 定調為「國家級里程碑」。
7 月 27 日:完整 2.8T 權重上架 Moonshot Hugging Face 組織(Modified MIT)+ 技術報告(架構、訓練、評估細節)。
關鍵結論:K3 是全球首個 3 萬億參數級(實際 2.8T)開源權重模型,被普遍視為對閉源溢價定價的直接衝擊;但綜合智能仍排第三(AA Intelligence Index 57.1,落後 Claude Fable 5 的 59.9 與 GPT-5.6 Sol 的 58.9)。優勢在於:開源權重 + 100 萬 token 上下文,以及以約 1/3 成本達到接近前沿的能力——閉源模型給不了的兩樣東西。
兩個日期混淆:API 已可用,權重尚未下載——搜尋「K3 開源」常誤把 7/16 當最終節點
「本地跑 K3」標題黨:1.4TB 4-bit 權重 + 64+ 加速器,與筆電/Ollama 預期嚴重脫節
閉源依賴溢價:Fable 5 單任務成本約為 K3 的 2.9 倍(AA 實測 $0.94 vs 更高檔)
長上下文 KV 成本:多數標稱長視窗模型實際可用長度遠低於 1M
政策/區域風險:閉源可被下架;已發布的開源權重無法被「關掉」
| 日期 | 事件 |
|---|---|
| 2026-07-16 | Kimi K3 透過 API / Kimi 全家桶上線;Artificial Analysis 同日發布獨立評測 |
| 2026-07-17 | WAIC 開幕,新華社定調 K3 為國家級里程碑 |
| 2026-07-27 | 完整權重 Hugging Face 下載(Modified MIT)+ 技術報告發布 |
當前最大搜尋困惑是:「K3 已經開源了嗎?」——API 與產品端已可用,但完整權重檔案仍以 7 月 27 日為節點。發布日後需把「scheduled for release」更新為「now available」,並附上 HF 直連——這是搶「K3 權重下載」流量的關鍵動作。
| 項目 | 數據 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T),史上最大開源權重模型 |
| 架構 | 稀疏 MoE:Stable LatentMoE,896 專家中每 token 啟用 16 個 |
| 注意力 | Kimi Delta Attention(KDA,混合線性注意力)+ AttnRes + Gated MLA |
| 上下文 | 1,048,576 tokens(約 100 萬) |
| 模態 | 原生視覺(文字+影像,產品端支援影片),輸出為文字 |
| 權重格式 | MXFP4 權重 + MXFP8 啟用(原生低精度訓練,4-bit 接近訓練精度) |
| 擴展效率 | 官方稱較 K2 提升約 2.5 倍 |
| 訓練穩定性 | Quantile Balancing、Per-Head Muon、SiTU 啟用函數 |
| 長上下文解碼 | KDA 在百萬 token 下最高 6.3 倍解碼加速 |
可引用數據:896 專家 / 啟用 16 個 · 1M context · KDA 6.3× 解碼 · 2.5× 相對 K2 擴展效率。
| 模型 | 分數 | 備註 |
|---|---|---|
| Claude Fable 5 | 59.9 | 第 1 |
| GPT-5.6 Sol | 58.9 | 第 2 |
| Kimi K3 | 57.1 | 第 3 / 189 |
官方的誠實態度(值得引用):月之暗面罕見地主動承認綜合性能仍落後 Fable 5 和 GPT-5.6 Sol,並列出已知短板——對 harness 傳回推理內容敏感、意圖模糊時過於主動等。基準經不同 harness 跑分,獨立複現仍在進行(評測日期:2026-07-16)。
| 項目 | 價格(每百萬 tokens) |
|---|---|
| 輸入(快取未命中) | $3.00 |
| 輸入(快取命中,自動快取) | $0.30 |
| 輸出 | $15.00 |
注意術語:英文社群嚴格區分 open weights(只放權重)與 open source(含訓練程式碼/資料)。K3 屬於前者——這本身是值得寫進 FAQ 的精準資訊。
誠實結論:這不是消費級硬體能跑的模型。
HF 倉庫檔案是否齊全(分片、索引、config)
LICENSE 原文(Modified MIT 具體條款)
量化版本(MXFP4 / GGUF 等)是否同步
vLLM / SGLang 啟動命令與最低可行硬體說明
獨立第三方長上下文複測與 BrowseComp 複現
能力差距在前沿基本閉合:AA Index 差距從「數百分」縮到「兩三分」,閉源廠商難再純靠能力證明溢價
地緣背景:發布趕在 WAIC 前;一個月前美國政府曾短暫下架 Anthropic Fable/Mythos(7 月 1 日恢復)——「監管可以關掉閉源,關不掉已發布的開源權重」
中國廠商梯隊集體逼近:Z.ai GLM-5.2(編碼對標 Opus 4.8、價格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等——K3 是這波浪潮最高點
月之暗面翻身仗:2025 年初被 DeepSeek R1 衝擊後排名跌至國內第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 開源路線重建地位
| 場景 | 推薦路徑 | 原因 |
|---|---|---|
| 立即試用 / 編碼 Agent | API 或 Kimi Code | 7/16 已上線,快取降本 |
| 7/27 後微調 / 資料駐留 | 自託管(64+ 卡) | 需完整權重 + 合規 |
| 成本極度敏感 | DeepSeek V4 Pro API | 輸出 $3.48/M |
| 長程推理 / GDPval 類 | Claude Fable 5 | 綜合與長程判斷力領先 |
| 等 GGUF / Ollama | 關注 K2 系列跟進節奏 | K3 量化版不會 Day-0 到消費級 |
在 platform.kimi.ai 開通 API,模型 ID kimi-k3
用 Kimi Code / OpenRouter(moonshotai/kimi-k3)跑一條長上下文任務驗證快取
對照本文基準表,確認你的場景落在 K3 強項(SWE Marathon / Frontend)還是弱項(DeepSWE / GDPval)
7/27 前 bookmark Moonshot Hugging Face 組織頁面
若計畫自託管:提前核算 1.4TB 儲存與 64+ 卡預算,否則鎖定 API 配額
2026 年 7 月 27 日 Hugging Face 開放完整 2.8T 權重 + 技術報告;API 已於 7 月 16 日上線。
kimi.com 可免費使用;API 輸入 $3/M、快取 $0.30/M、輸出 $15/M tokens。
4-bit 約 1.4TB,需 64+ 加速器超節點;消費級 GPU 不現實,多數人應走 API。
K3 參數與上下文更大、多項編程基準更強;DeepSeek V4 Pro API 成本顯著更低。
綜合 AA Index 仍排第三;編碼/UI 部分場景領先,單任務成本比 Fable 5 低 65.8%。
計畫 Modified MIT;以 7 月 27 日 Hugging Face LICENSE 原文為準。
K3 把「全球最大開源權重」從倒數計時變成了可執行的日曆事件——但權重開放 ≠ 人人本地可跑。1.4TB 與 64+ 卡門檻意味著:絕大多數開發者仍會在 API、Kimi Code 與 OpenRouter 上消費 K3;真正自託管的是機構與超大規模呼叫方。若你主力機是 Windows/Linux,卻要在真實 macOS 圖形環境裡跑 Kimi Code Agent、對接 OpenClaw 多模型路由、或並行做 iOS 建置對照基準,自購 Mac 成本高、純 SSH 又點不了系統彈窗。租用 VNCMac 遠端 Mac 可按小時開通 VNC 桌面,在隔離節點上驗收 K3 長上下文編程與 Agent 工作流,專案結束即停租。查看 Mac Mini M4 套餐 即可開始;更多架構細節可參考站內 7 月 17 日 Kimi K3 深度評測。