開源權重 2026年7月22日 約 22 分鐘 Kimi K3 7月27日

Kimi K3 開源權重 7 月 27 日發布
2.8 萬億參數、百萬上下文,閉源溢價還守得住嗎?

距權重公開僅剩 5 天 · Modified MIT · AA Index 57.1 · 自部署 1.4TB · API $3/$15 · 發布日核對清單

Kimi K3 開源權重 7 月 27 日發布 2.8 萬億參數概念圖

摘要:若你在等「史上最大開源權重」落地——答案很明確:月之暗面(Moonshot AI)將於 2026 年 7 月 27 日在 Hugging Face 以 Modified MIT 許可公開 Kimi K3 完整 2.8 萬億參數權重,同步發布技術報告。API 與 Kimi 全家桶已於 7 月 16 日上線。本文嚴格涵蓋調研要點:兩個發布日期的區別、全量規格與基準測試、$3/$15 定價與快取真實成本、1.4TB / 64+ 加速器自部署門檻、7 月 27 日核對清單,以及「開源追平閉源」的業界判斷——並誠實說明 K3 並非 Fable 5 殺手,卻以約三分之一成本達到接近前沿的能力。

01

事件核心:TL;DR

7 月 16 日:Kimi K3 透過 Kimi App、Kimi Work、Kimi Code 與 API 全面上線;Artificial Analysis 同日發布獨立評測。

7 月 17 日:上海世界人工智慧大會(WAIC)開幕,新華社將 K3 定調為「國家級里程碑」。

7 月 27 日:完整 2.8T 權重上架 Moonshot Hugging Face 組織(Modified MIT)+ 技術報告(架構、訓練、評估細節)。

關鍵結論:K3 是全球首個 3 萬億參數級(實際 2.8T)開源權重模型,被普遍視為對閉源溢價定價的直接衝擊;但綜合智能仍排第三(AA Intelligence Index 57.1,落後 Claude Fable 5 的 59.9 與 GPT-5.6 Sol 的 58.9)。優勢在於:開源權重 + 100 萬 token 上下文,以及以約 1/3 成本達到接近前沿的能力——閉源模型給不了的兩樣東西。

選型前的痛點

  1. 01

    兩個日期混淆:API 已可用,權重尚未下載——搜尋「K3 開源」常誤把 7/16 當最終節點

  2. 02

    「本地跑 K3」標題黨:1.4TB 4-bit 權重 + 64+ 加速器,與筆電/Ollama 預期嚴重脫節

  3. 03

    閉源依賴溢價:Fable 5 單任務成本約為 K3 的 2.9 倍(AA 實測 $0.94 vs 更高檔)

  4. 04

    長上下文 KV 成本:多數標稱長視窗模型實際可用長度遠低於 1M

  5. 05

    政策/區域風險:閉源可被下架;已發布的開源權重無法被「關掉」

02

時間軸:API 上線 vs 權重開源

日期事件
2026-07-16Kimi K3 透過 API / Kimi 全家桶上線;Artificial Analysis 同日發布獨立評測
2026-07-17WAIC 開幕,新華社定調 K3 為國家級里程碑
2026-07-27完整權重 Hugging Face 下載(Modified MIT)+ 技術報告發布

當前最大搜尋困惑是:「K3 已經開源了嗎?」——API 與產品端已可用,但完整權重檔案仍以 7 月 27 日為節點。發布日後需把「scheduled for release」更新為「now available」,並附上 HF 直連——這是搶「K3 權重下載」流量的關鍵動作。

03

模型規格一覽

項目數據
總參數量2.8 萬億(2.8T),史上最大開源權重模型
架構稀疏 MoE:Stable LatentMoE,896 專家中每 token 啟用 16 個
注意力Kimi Delta Attention(KDA,混合線性注意力)+ AttnRes + Gated MLA
上下文1,048,576 tokens(約 100 萬)
模態原生視覺(文字+影像,產品端支援影片),輸出為文字
權重格式MXFP4 權重 + MXFP8 啟用(原生低精度訓練,4-bit 接近訓練精度)
擴展效率官方稱較 K2 提升約 2.5 倍
訓練穩定性Quantile Balancing、Per-Head Muon、SiTU 啟用函數
長上下文解碼KDA 在百萬 token 下最高 6.3 倍解碼加速

可引用數據:896 專家 / 啟用 16 個 · 1M context · KDA 6.3× 解碼 · 2.5× 相對 K2 擴展效率。

04

基準測試:K3 對比 Claude Fable 5 與 GPT-5.6 Sol

綜合智能(Artificial Analysis Intelligence Index)

模型分數備註
Claude Fable 559.9第 1
GPT-5.6 Sol58.9第 2
Kimi K357.1第 3 / 189

K3 領先或打平的項目

  • Frontend Code Arena:盲測中開發者偏好其 UI 程式碼超過 Fable 與 Sol(第 1
  • Automation Bench、SpreadsheetBench 2:第 1
  • BrowseComp:91.2(第 1;配合 1M 無壓縮策略可達 90.4+)
  • SWE Marathon(超長編碼工作階段):42.0,明顯領先(GPT-5.5 / GLM-5.2 崩到十幾分)
  • Terminal Bench 2.1:88.3,與 Sol 的 88.8 基本打平
  • Program Bench:77.8,微超 Sol 的 77.6
  • FrontierSWE:81.2,大幅超 Sol 的 71.3(但落後 Fable 5 的 86.6)

K3 仍落後的項目

  • GDPval v2 Elo:1668–1687 vs Fable 5 的 1760、Sol 的 1748(長程判斷力仍是 Fable 天下)
  • DeepSWE:67.5 vs Sol 的 73.0
  • 幻覺率較 K2.6 有所上升(官方承認);Reddit 有使用者回饋接入自建應用後幻覺多於頂級閉源
  • 對話打磨度、單次工作階段方差仍遜於 Fable 5 / Sol

官方的誠實態度(值得引用):月之暗面罕見地主動承認綜合性能仍落後 Fable 5 和 GPT-5.6 Sol,並列出已知短板——對 harness 傳回推理內容敏感、意圖模糊時過於主動等。基準經不同 harness 跑分,獨立複現仍在進行(評測日期:2026-07-16)。

05

API 定價與快取後的真實成本

項目價格(每百萬 tokens)
輸入(快取未命中)$3.00
輸入(快取命中,自動快取)$0.30
輸出$15.00
  • 定價刻意對齊西方標準(走「品質牌」而非「低價牌」),是中國大模型廠商中最高檔之一,仍顯著低於 Claude Opus 4.8 單任務成本
  • Artificial Analysis 實測單任務成本 $0.94:比 GPT-5.6 Sol 低 9.4%,比 Claude Fable 5 低 65.8%
  • 編碼類工作負載快取命中率據稱超 90%,實際成本遠低於表面單價
06

7 月 27 日開源發布:會發生什麼

  • 完整 2.8T 權重上架 Moonshot Hugging Face 組織,Modified MIT 許可證(具體條款以發布日 LICENSE 原文為準)
  • 同步發布技術報告(架構、訓練、評估細節)
  • vLLM 對 KDA / prefix caching 的支援將隨權重落地(官方正與推理夥伴對齊)
  • 預期後續:Ollama、GGUF 量化版本將像 K2 系列一樣陸續跟進

注意術語:英文社群嚴格區分 open weights(只放權重)與 open source(含訓練程式碼/資料)。K3 屬於前者——這本身是值得寫進 FAQ 的精準資訊。

07

本地部署現實:別被「筆電能跑」誤導

誠實結論:這不是消費級硬體能跑的模型。

  • 4-bit 權重約 1.4 TB;官方建議 64+ 加速器的「超節點」部署,需專家並行 + 張量並行
  • 參照:上一代 1T 參數的 K2.7 Code,INT4 也要約 577 GB 顯存;K3 是其 2.8 倍
  • 對絕大多數人正確答案是 API($3/$15);自部署只在三種場景成立:嚴格資料駐留 / 離線要求、需在自有資料上微調、呼叫量大到自建硬體反而便宜

7 月 27 日發布日核對清單

  1. 01

    HF 倉庫檔案是否齊全(分片、索引、config)

  2. 02

    LICENSE 原文(Modified MIT 具體條款)

  3. 03

    量化版本(MXFP4 / GGUF 等)是否同步

  4. 04

    vLLM / SGLang 啟動命令與最低可行硬體說明

  5. 05

    獨立第三方長上下文複測與 BrowseComp 複現

08

業界意義:閉源溢價還守得住嗎?

  1. 01

    能力差距在前沿基本閉合:AA Index 差距從「數百分」縮到「兩三分」,閉源廠商難再純靠能力證明溢價

  2. 02

    地緣背景:發布趕在 WAIC 前;一個月前美國政府曾短暫下架 Anthropic Fable/Mythos(7 月 1 日恢復)——「監管可以關掉閉源,關不掉已發布的開源權重」

  3. 03

    中國廠商梯隊集體逼近:Z.ai GLM-5.2(編碼對標 Opus 4.8、價格 1/5)、DeepSeek V4 Pro(1.6T)、MiniMax 等——K3 是這波浪潮最高點

  4. 04

    月之暗面翻身仗:2025 年初被 DeepSeek R1 衝擊後排名跌至國內第七,靠 K2(2025-07)→ K2.5(2026-01)→ K3 開源路線重建地位

使用路徑決策矩陣

場景推薦路徑原因
立即試用 / 編碼 AgentAPI 或 Kimi Code7/16 已上線,快取降本
7/27 後微調 / 資料駐留自託管(64+ 卡)需完整權重 + 合規
成本極度敏感DeepSeek V4 Pro API輸出 $3.48/M
長程推理 / GDPval 類Claude Fable 5綜合與長程判斷力領先
等 GGUF / Ollama關注 K2 系列跟進節奏K3 量化版不會 Day-0 到消費級

五條落地步驟(發布前可先做)

  1. 01

    platform.kimi.ai 開通 API,模型 ID kimi-k3

  2. 02

    用 Kimi Code / OpenRouter(moonshotai/kimi-k3)跑一條長上下文任務驗證快取

  3. 03

    對照本文基準表,確認你的場景落在 K3 強項(SWE Marathon / Frontend)還是弱項(DeepSWE / GDPval)

  4. 04

    7/27 前 bookmark Moonshot Hugging Face 組織頁面

  5. 05

    若計畫自託管:提前核算 1.4TB 儲存與 64+ 卡預算,否則鎖定 API 配額

信源清單

  • 官方:kimi.com/en/blog/kimi-k3platform.kimi.ai
  • 獨立評測:Artificial Analysis(Intelligence Index 57.1,7 月 16 日)
  • 深度報導:VentureBeat、Northflank(自部署分析)
  • 社群:r/LocalLLaMA(benchmaxxed 質疑、open-weight 定義之爭)、Hacker News
09

常見問題(FAQ)

2026 年 7 月 27 日 Hugging Face 開放完整 2.8T 權重 + 技術報告;API 已於 7 月 16 日上線。

kimi.com 可免費使用;API 輸入 $3/M、快取 $0.30/M、輸出 $15/M tokens。

4-bit 約 1.4TB,需 64+ 加速器超節點;消費級 GPU 不現實,多數人應走 API。

K3 參數與上下文更大、多項編程基準更強;DeepSeek V4 Pro API 成本顯著更低。

綜合 AA Index 仍排第三;編碼/UI 部分場景領先,單任務成本比 Fable 5 低 65.8%。

計畫 Modified MIT;以 7 月 27 日 Hugging Face LICENSE 原文為準。

結語

K3 把「全球最大開源權重」從倒數計時變成了可執行的日曆事件——但權重開放 ≠ 人人本地可跑。1.4TB 與 64+ 卡門檻意味著:絕大多數開發者仍會在 API、Kimi Code 與 OpenRouter 上消費 K3;真正自託管的是機構與超大規模呼叫方。若你主力機是 Windows/Linux,卻要在真實 macOS 圖形環境裡跑 Kimi Code Agent、對接 OpenClaw 多模型路由、或並行做 iOS 建置對照基準,自購 Mac 成本高、純 SSH 又點不了系統彈窗。租用 VNCMac 遠端 Mac 可按小時開通 VNC 桌面,在隔離節點上驗收 K3 長上下文編程與 Agent 工作流,專案結束即停租。查看 Mac Mini M4 套餐 即可開始;更多架構細節可參考站內 7 月 17 日 Kimi K3 深度評測