7/24 Opus 5 成為 Claude Max 預設 · 白宮指控 K3 蒸餾 · Greenblatt 技術證據
本週 AI 圈兩件大事表面無關,實則都指向同一主題——「性價比」與「模型能力的真實來源」:Anthropic 於 2026 年 7 月 24 日發布日常主力模型 Claude Opus 5,並設為 Claude Max 預設模型;月之暗面剛發布的 Kimi K3 則被白宮官員公開指控「產業級蒸餾」,獨立研究者更發現 K3 會自稱是 Claude 並吐出內部部署版本號。本文嚴格依據調研素材,涵蓋 Opus 5 全量基準/定價/安全/資料留存、K3 規格與「蒸餾門」時間線、Greenblatt 技術分析、Anthropic 2 月指控背景、社群反應、Anthropic 2 月指控背景與社群反應,並附 FAQ。
2026 年 7 月 24 日(美國太平洋時間),Anthropic 正式發布 Claude Opus 5(模型 ID:claude-opus-5),同步成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。定位是日常主力模型:接近旗艦 Fable 5 智慧水準,價格為 Fable 5 的一半。
| 項目 | 內容 |
|---|---|
| 定價 | 輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens(與 Opus 4.8 完全相同) |
| 上下文視窗 | 100 萬 tokens(預設且唯一檔位) |
| 最大輸出 | 128K tokens |
| 預設推理 | Thinking 預設開啟,Effort 參數控制思考量 |
| 平台 | Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry |
| Fast 模式 | 速度約為預設 2.5 倍,價格為基礎價 2 倍(與 Opus 4.8 一致) |
| 資料留存 | 預設存取不強制資料留存(Fable 5 / Mythos 5 需接受 30 天留存政策) |
客戶回饋摘錄:Cursor 團隊稱 Opus 5「near Fable 5 intelligence at Opus speed and cost」;Zapier 稱其 AutomationBench 榜首且未消耗更多 tokens;Box 報告資料分析工作流提升 11%、盡職調查提升 17%、整體準確率提升 8%。
自動化行為審計顯示 Opus 5 是迄今為止最對齊的模型:欺騙行為發生率最低、最不易被誘導濫用、在避免難以逆轉的魯莽行為方面最安全。但在風險型雙用途能力(網路安全攻擊、生物安全)上故意沒有刷新前沿——仍由受限發行的 Mythos 5 佔據。網路安全分類器比 Fable 5 寬鬆約 85%(觸發攔截頻率降低約 85%),可用於原始碼級漏洞發現,仍屏蔽二進位漏洞掃描、滲透測試、exploit 生成。生物安全相關請求:原本在 Fable 5 上被攔截的,現在路由給 Opus 5(而非回 Opus 4.8)。
| 日期 | 事件 |
|---|---|
| 2026-06-09 | Claude Fable 5 / Mythos 5 正式發布 |
| 2026-07-01 | Fable 5 面向公眾正式可用 |
| 2026-07-24 | Claude Opus 5 發布,成為 Claude Max 預設模型 |
Fable 5 價格門檻:約 $10/$50 每百萬 input/output tokens,日常 Agent 工作流成本翻倍
30 天資料留存:Fable 5 / Mythos 5 需 opt-in 留存政策,企業合規場景受限
過度能力浪費:多數編碼/自動化任務不需要 Mythos 級雙用途前沿能力
模型切換成本:Pro/Max 使用者若預設仍停在舊 Opus,會錯過 2× 軟體工程提升
驗收環境:在 Cursor / Claude Code 中對比 Opus 5 與 Fable 5 常需 macOS 圖形工作階段與 OAuth 回呼
| 維度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 相對定價 | 約 一半($5/$25) | 約 $10/$50 |
| CursorBench 3.2(max) | 與峰值差 0.5% | 峰值基準 |
| 預設資料留存 | 不強制 | 需 30 天 opt-in |
| Claude Max 預設 | 是(7/24 起) | 否 |
| 雙用途前沿(網安/生物) | 故意未登頂 | Mythos 5 受限發行占頂 |
月之暗面(Moonshot AI)於 2026 年 7 月 16 日發布 Kimi K3:總參數 2.8 兆(2.8T),全球首個進入 3T 級的開源模型;稀疏 MoE,896 專家中每 token 啟用 16 個(約等效 500 億啟用參數);自研 Kimi Delta Attention(KDA) + Attention Residuals + Stable LatentMoE,訓練效率較 K2 提升約 2.5 倍;100 萬 token上下文與原生視覺理解。完整權重承諾 7 月 27 日放出(撰稿時尚未放出)。
| 基準 | 分數 | 備註 |
|---|---|---|
| GPQA-Diamond | 93.5% | 發布時開源模型最高分 |
| Terminal-Bench 2.1 | 88.3% | 落後 GPT-5.6 Sol 0.5 分 |
| BrowseComp | 91.2% | 發布時最高分 |
| Humanity's Last Exam(帶工具) | 56.0% | — |
| MCP Atlas | 84.2% | — |
| Program Bench | 77.8% | 綜合最佳 |
| SWE Marathon | 42.0% | 綜合最佳 |
| DeepSearchQA (F1) | 95.0% | — |
官方自稱整體能力僅次於 Claude Fable 5 與 GPT-5.6 Sol,價格大幅低於兩者。更多 K3 架構與 7/27 權重細節見站內開源權重倒數與深度評測。
2026 年 7 月 22–23 日,白宮科技政策辦公室(OSTP)主任 Michael Kratsios 在 X 上指控月之暗面透過「大規模、隱蔽的產業級蒸餾(distillation)」竊取 Anthropic Fable 模型能力,並涉嫌使用未獲出口許可的 Nvidia GB300(Grace Blackwell 300)晶片(可能經泰國伺服器間接取得)。原話:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」
財政部長 Scott Bessent 附和稱「在很多中國模型上發現了美國大模型的『浮水印』」——但財政部未回應「浮水印」具體指什麼。Kratsios 並未公開支撐指控的具體證據;月之暗面對訓練過程質詢未予回應。
這不是第一次:早在 2026 年 2 月,Anthropic 已公開指控月之暗面、DeepSeek、MiniMax 進行「產業級蒸餾攻擊」,稱透過虛假帳號識別出月之暗面超過 340 萬次異常互動,「明顯偏離正常使用模式,反映刻意能力提取而非合法使用」,並稱已透過 API 請求元資料追蹤到部分行為與月之暗面高層相關。月之暗面從未正面確認或否認。
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次公開指控月之暗面/DeepSeek/MiniMax 產業級蒸餾 |
| 2026-07-01 | Claude Fable 5 面向公眾開放 |
| 2026-07-16 | Kimi K3 API/產品正式發布 |
| 2026-07-22/23 | 白宮 OSTP 主任 Kratsios 公開指控蒸餾 + 違規晶片 |
| 2026-07-23 | TechCrunch 刊發專家質疑蒸餾說的報導 |
| 2026-07-24 左右 | Ryan Greenblatt 發布「K3 自稱 Claude」統計證據 |
| 2026-07-27(計劃) | Kimi K3 完整權重開源,外部可獨立驗證 |
TechCrunch(7 月 23 日)採訪多位獨立研究者,普遍對「蒸餾說」存疑——Fable 5 從 7 月 1 日才公開可用,到 K3 發布(7 月 16 日)僅兩週,深度蒸餾(尤其涉及 RL 式蒸餾需教師模型海量打分)在資料規模、算力與 API 成本上難以完成。
Braden Hancock(Laude Institute / Snorkel AI 共同創辦人):「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」
Nathan Lambert(Allen Institute for AI):隨著中國模型逼近前沿,蒸餾邊際收益變小,真正拉開差距的是更燒錢的 RL 訓練——若蒸餾真這麼好用,所有人早就靠蒸餾追平 GLM 或 K3 了,但事實並非如此。
也有專家指出「雙標」:Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱這在業界很常見——問題核心在於「正常技術借鑑」與「隱蔽工業級竊取」的邊界如何界定。
Redwood Research 首席科學家 Ryan Greenblatt 於 7 月 24 日左右發布統計分析(GitHub:rgreenblatt/which_claude_is_k3),對比多模型身份自認行為:
重要澄清:Greenblatt 強調這些發現不能直接證明蒸餾發生——身份混淆也可能來自訓練資料污染、系統提示詞洩露或公開資料集合樣本;但結合 Anthropic 2 月指控與統計規律性,這是「蒸餾說」迄今最接地氣的技術證據,而不只是政治喊話。英文差異化關鍵字:Why does Kimi K3 say it's Claude / Kimi K3 self-identifies as Claude——截至調研時幾乎無競爭。
Reddit r/LocalLLaMA 等呈現三種聲音:歡呼「開源與閉源差距縮短到幾天而非幾個月」;調侃「2.8T 參數幾乎沒人能在本地跑」;務實派認為 K3 真正賣點是低價 + 較少內容審查,而非「打敗 Fable 5」。
完整權重要到 7 月 27 日才發布,爭議爆發時外部研究者尚無法獨立驗證參數規模、架構細節與基準復現——輿論持續發酵的重要原因。爭議還牽動產業政策:美方正討論是否限制中國開放權重模型,晶片出口管制再次被提起(聯想到 2026 年 5 月 Supermicro 創辦人走私先進晶片被起訴案例)。
Opus 5 用「半價逼近旗艦」回應市場對性價比的訴求;Kimi K3 用「開源 + 低價 + 不設限」衝擊市場;圍繞 K3 的爭議,本質是各家在性價比戰爭裡對「你的低價到底是技術優化換來的,還是白嫖別人模型換來的」的公開攤牌。
對一般開發者更現實的建議:若場景對合規、資料留存、供應鏈風險敏感,Opus 5「價格沒漲、能力跳級」性價比很高;若更在意極限成本與開源可控性,K3 值得等到 7 月 27 日權重放出後再實測——此前真實能力仍只是「官方自評 + 外部猜測」。
合規優先:選 Opus 5 + 無強制留存 + Anthropic 官方 API
成本極限:等 K3 權重 + 獨立基準復現後再決策自部署 vs API
Agent 驗收:在 Cursor / Claude Code / Kimi Code 中對照 CursorBench 類任務
圖形工作階段:OAuth、Gateway 與模型切換在 VNC 遠端 Mac 上可點選驗收
7/27 追更:權重公開後關注獨立基準復現,看蒸餾指控是否被坐實
相同 token 單價檔位下 Opus 5 約為 Fable 5 一半($5/$25 vs 約 $10/$50 每百萬 input/output),CursorBench 與 Fable 5 峰值相差不到 1%。
是的,7 月 24 日發布當天起 Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 最強可用版本。
仍有爭議、未最終證實。白宮指控缺公開證據;專家從時間線認為兩週內深度蒸餾不現實;Greenblatt 的「自稱 Claude + 內部 ID」是目前最強技術間接證據。
官方承諾 2026 年 7 月 27 日;本文發布時尚未放出,外部尚無法完全獨立驗證架構與跑分。
K3 為 open-weight(權重可下載),非嚴格意義 fully open-source;許可預計沿用 Moonshot 此前 modified-MIT 路線,以 7/27 發布日 LICENSE 原文為準。
Opus 5 把「旗艦級 Agent 能力」壓到日常可承受的 token 帳單;K3 則把前沿能力以開源敘事推到輿論前台——但蒸餾指控 + 自稱 Claude 的統計證據提醒開發者:選型不能只看 benchmark 表格,還要看合規、資料留存與模型溯源。
若你要在 Cursor、Claude Code 或 Kimi Code 裡第一時間驗收 Opus 5 與 K3 路由,Windows/Linux 主力機常卡在 OAuth 回呼、macOS 權限彈窗與 Gateway 圖形對照;自購 Mac 還有睡眠策略與系統更新打斷 Agent 常駐的隱性成本。相較之下,租用 VNCMac 遠端 Mac + VNC 圖形工作階段可在與 Gateway 同機環境下完成多模型切換與日誌核對,把「本週兩大瓜」變成可復現的 Agent 驗收,而非只看新聞標題。