AI 週報 2026年7月25日 約 24 分鐘 Claude Opus 5 Kimi K3

Claude Opus 5 價格減半逼近旗艦實力
Kimi K3 卻陷「自稱 Claude」蒸餾門

7/24 Opus 5 成為 Claude Max 預設 · 白宮指控 K3 蒸餾 · Greenblatt 技術證據

Claude Opus 5 發布與 Kimi K3 蒸餾門 AI 週報概念圖

本週 AI 圈兩件大事表面無關,實則都指向同一主題——「性價比」與「模型能力的真實來源」:Anthropic 於 2026 年 7 月 24 日發布日常主力模型 Claude Opus 5,並設為 Claude Max 預設模型;月之暗面剛發布的 Kimi K3 則被白宮官員公開指控「產業級蒸餾」,獨立研究者更發現 K3 會自稱是 Claude 並吐出內部部署版本號。本文嚴格依據調研素材,涵蓋 Opus 5 全量基準/定價/安全/資料留存、K3 規格與「蒸餾門」時間線、Greenblatt 技術分析、Anthropic 2 月指控背景、社群反應、Anthropic 2 月指控背景與社群反應,並附 FAQ。

01

Claude Opus 5 發布:不是旗艦,但可能是最值得用的 Claude

2026 年 7 月 24 日(美國太平洋時間),Anthropic 正式發布 Claude Opus 5(模型 ID:claude-opus-5),同步成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。定位是日常主力模型:接近旗艦 Fable 5 智慧水準,價格為 Fable 5 的一半。

項目內容
定價輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens(與 Opus 4.8 完全相同)
上下文視窗100 萬 tokens(預設且唯一檔位)
最大輸出128K tokens
預設推理Thinking 預設開啟,Effort 參數控制思考量
平台Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry
Fast 模式速度約為預設 2.5 倍,價格為基礎價 2 倍(與 Opus 4.8 一致)
資料留存預設存取不強制資料留存(Fable 5 / Mythos 5 需接受 30 天留存政策)

關鍵效能數據(Anthropic 官方)

  • Frontier-Bench v0.1(軟體工程):超越所有模型,是 Opus 4.8 的兩倍以上,單任務成本更低
  • CursorBench 3.2:max effort 與 Fable 5 峰值相差僅 0.5%,成本為 Fable 5 一半;high/xhigh/max 檔位性價比超市面所有模型
  • ARC-AGI 3:得分是次優模型的3 倍
  • Zapier AutomationBench:通過率約為次優模型 1.5 倍;最低 effort 仍超其他任何模型;端到端帳戶健康工作流 100% 通過(此前模型均未通過)
  • OSWorld 2.0:任意成本下優於其他模型;僅用 Fable 5 成本三分之一多一點超過 Fable 5 最佳成績
  • 科研/生命科學:結構生物學、有機化學、生物資訊學全面超 Opus 4.8;光譜反推分子結構內部評測高 10.2 個百分點;蛋白質序列變異功能預測高 7.7 個百分點

客戶回饋摘錄:Cursor 團隊稱 Opus 5「near Fable 5 intelligence at Opus speed and cost」;Zapier 稱其 AutomationBench 榜首且未消耗更多 tokens;Box 報告資料分析工作流提升 11%、盡職調查提升 17%、整體準確率提升 8%

對齊與安全

自動化行為審計顯示 Opus 5 是迄今為止最對齊的模型:欺騙行為發生率最低、最不易被誘導濫用、在避免難以逆轉的魯莽行為方面最安全。但在風險型雙用途能力(網路安全攻擊、生物安全)上故意沒有刷新前沿——仍由受限發行的 Mythos 5 佔據。網路安全分類器比 Fable 5 寬鬆約 85%(觸發攔截頻率降低約 85%),可用於原始碼級漏洞發現,仍屏蔽二進位漏洞掃描、滲透測試、exploit 生成。生物安全相關請求:原本在 Fable 5 上被攔截的,現在路由給 Opus 5(而非回 Opus 4.8)。

日期事件
2026-06-09Claude Fable 5 / Mythos 5 正式發布
2026-07-01Fable 5 面向公眾正式可用
2026-07-24Claude Opus 5 發布,成為 Claude Max 預設模型
02

選型前的痛點:Opus 5 vs Fable 5 決策矩陣

  1. 01

    Fable 5 價格門檻:約 $10/$50 每百萬 input/output tokens,日常 Agent 工作流成本翻倍

  2. 02

    30 天資料留存:Fable 5 / Mythos 5 需 opt-in 留存政策,企業合規場景受限

  3. 03

    過度能力浪費:多數編碼/自動化任務不需要 Mythos 級雙用途前沿能力

  4. 04

    模型切換成本:Pro/Max 使用者若預設仍停在舊 Opus,會錯過 2× 軟體工程提升

  5. 05

    驗收環境:在 Cursor / Claude Code 中對比 Opus 5 與 Fable 5 常需 macOS 圖形工作階段與 OAuth 回呼

維度Claude Opus 5Claude Fable 5
相對定價一半($5/$25)約 $10/$50
CursorBench 3.2(max)與峰值差 0.5%峰值基準
預設資料留存不強制需 30 天 opt-in
Claude Max 預設是(7/24 起)
雙用途前沿(網安/生物)故意未登頂Mythos 5 受限發行占頂
03

Kimi K3:全球首個「3T 級」開源模型與基準

月之暗面(Moonshot AI)於 2026 年 7 月 16 日發布 Kimi K3:總參數 2.8 兆(2.8T),全球首個進入 3T 級的開源模型;稀疏 MoE,896 專家中每 token 啟用 16 個(約等效 500 億啟用參數);自研 Kimi Delta Attention(KDA) + Attention Residuals + Stable LatentMoE,訓練效率較 K2 提升約 2.5 倍100 萬 token上下文與原生視覺理解。完整權重承諾 7 月 27 日放出(撰稿時尚未放出)。

基準分數備註
GPQA-Diamond93.5%發布時開源模型最高分
Terminal-Bench 2.188.3%落後 GPT-5.6 Sol 0.5 分
BrowseComp91.2%發布時最高分
Humanity's Last Exam(帶工具)56.0%
MCP Atlas84.2%
Program Bench77.8%綜合最佳
SWE Marathon42.0%綜合最佳
DeepSearchQA (F1)95.0%

官方自稱整體能力僅次於 Claude Fable 5 與 GPT-5.6 Sol,價格大幅低於兩者。更多 K3 架構與 7/27 權重細節見站內開源權重倒數深度評測

04

「蒸餾門」:白宮下場與 Anthropic 2 月指控

2026 年 7 月 22–23 日,白宮科技政策辦公室(OSTP)主任 Michael Kratsios 在 X 上指控月之暗面透過「大規模、隱蔽的產業級蒸餾(distillation)」竊取 Anthropic Fable 模型能力,並涉嫌使用未獲出口許可的 Nvidia GB300(Grace Blackwell 300)晶片(可能經泰國伺服器間接取得)。原話:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」

財政部長 Scott Bessent 附和稱「在很多中國模型上發現了美國大模型的『浮水印』」——但財政部未回應「浮水印」具體指什麼。Kratsios 並未公開支撐指控的具體證據;月之暗面對訓練過程質詢未予回應。

這不是第一次:早在 2026 年 2 月,Anthropic 已公開指控月之暗面、DeepSeek、MiniMax 進行「產業級蒸餾攻擊」,稱透過虛假帳號識別出月之暗面超過 340 萬次異常互動,「明顯偏離正常使用模式,反映刻意能力提取而非合法使用」,並稱已透過 API 請求元資料追蹤到部分行為與月之暗面高層相關。月之暗面從未正面確認或否認。

日期事件
2026-02Anthropic 首次公開指控月之暗面/DeepSeek/MiniMax 產業級蒸餾
2026-07-01Claude Fable 5 面向公眾開放
2026-07-16Kimi K3 API/產品正式發布
2026-07-22/23白宮 OSTP 主任 Kratsios 公開指控蒸餾 + 違規晶片
2026-07-23TechCrunch 刊發專家質疑蒸餾說的報導
2026-07-24 左右Ryan Greenblatt 發布「K3 自稱 Claude」統計證據
2026-07-27(計劃)Kimi K3 完整權重開源,外部可獨立驗證
05

獨立專家反駁:時間線根本不夠

TechCrunch(7 月 23 日)採訪多位獨立研究者,普遍對「蒸餾說」存疑——Fable 5 從 7 月 1 日才公開可用,到 K3 發布(7 月 16 日)僅兩週,深度蒸餾(尤其涉及 RL 式蒸餾需教師模型海量打分)在資料規模、算力與 API 成本上難以完成。

"

Braden Hancock(Laude Institute / Snorkel AI 共同創辦人):「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」

"

Nathan Lambert(Allen Institute for AI):隨著中國模型逼近前沿,蒸餾邊際收益變小,真正拉開差距的是更燒錢的 RL 訓練——若蒸餾真這麼好用,所有人早就靠蒸餾追平 GLM 或 K3 了,但事實並非如此。

也有專家指出「雙標」:Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱這在業界很常見——問題核心在於「正常技術借鑑」與「隱蔽工業級竊取」的邊界如何界定。

06

最硬核證據:K3 會「自稱是 Claude」

Redwood Research 首席科學家 Ryan Greenblatt 於 7 月 24 日左右發布統計分析(GitHub:rgreenblatt/which_claude_is_k3),對比多模型身份自認行為:

  • Kimi K3 異常高頻自稱 Claude,甚至吐出 Claude 官方內部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真實 Claude Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不會主動報出這類內部版本號,或只會報舊錯誤版本號
  • Greenblatt 判斷:模型說出的教師模型部署元資料比教師模型自己還準確,很難用「模仿對話風格」解釋,更可能指向訓練資料混入帶部署元資料標註的 Claude 資料(API 日誌或打標合成資料)
  • K3 自稱版本鎖定在「Claude 4.5 時代」(2025 年末),而非當前 Fable/Mythos;K2 信號指向更早 Claude Sonnet 4(2025 年中)——呈現「逐代追新」規律

重要澄清:Greenblatt 強調這些發現不能直接證明蒸餾發生——身份混淆也可能來自訓練資料污染、系統提示詞洩露或公開資料集合樣本;但結合 Anthropic 2 月指控與統計規律性,這是「蒸餾說」迄今最接地氣的技術證據,而不只是政治喊話。英文差異化關鍵字:Why does Kimi K3 say it's Claude / Kimi K3 self-identifies as Claude——截至調研時幾乎無競爭。

07

社群反應與 7/27 權重懸念

Reddit r/LocalLLaMA 等呈現三種聲音:歡呼「開源與閉源差距縮短到幾天而非幾個月」;調侃「2.8T 參數幾乎沒人能在本地跑」;務實派認為 K3 真正賣點是低價 + 較少內容審查,而非「打敗 Fable 5」。

完整權重要到 7 月 27 日才發布,爭議爆發時外部研究者尚無法獨立驗證參數規模、架構細節與基準復現——輿論持續發酵的重要原因。爭議還牽動產業政策:美方正討論是否限制中國開放權重模型,晶片出口管制再次被提起(聯想到 2026 年 5 月 Supermicro 創辦人走私先進晶片被起訴案例)。

08

兩件事放在一起看:性價比才是主戰場

Opus 5 用「半價逼近旗艦」回應市場對性價比的訴求;Kimi K3 用「開源 + 低價 + 不設限」衝擊市場;圍繞 K3 的爭議,本質是各家在性價比戰爭裡對「你的低價到底是技術優化換來的,還是白嫖別人模型換來的」的公開攤牌。

對一般開發者更現實的建議:若場景對合規、資料留存、供應鏈風險敏感,Opus 5「價格沒漲、能力跳級」性價比很高;若更在意極限成本與開源可控性,K3 值得等到 7 月 27 日權重放出後再實測——此前真實能力仍只是「官方自評 + 外部猜測」。

  1. 01

    合規優先:選 Opus 5 + 無強制留存 + Anthropic 官方 API

  2. 02

    成本極限:等 K3 權重 + 獨立基準復現後再決策自部署 vs API

  3. 03

    Agent 驗收:在 Cursor / Claude Code / Kimi Code 中對照 CursorBench 類任務

  4. 04

    圖形工作階段:OAuth、Gateway 與模型切換在 VNC 遠端 Mac 上可點選驗收

  5. 05

    7/27 追更:權重公開後關注獨立基準復現,看蒸餾指控是否被坐實

FAQ

常見問題

相同 token 單價檔位下 Opus 5 約為 Fable 5 一半($5/$25 vs 約 $10/$50 每百萬 input/output),CursorBench 與 Fable 5 峰值相差不到 1%。

是的,7 月 24 日發布當天起 Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 最強可用版本。

仍有爭議、未最終證實。白宮指控缺公開證據;專家從時間線認為兩週內深度蒸餾不現實;Greenblatt 的「自稱 Claude + 內部 ID」是目前最強技術間接證據。

官方承諾 2026 年 7 月 27 日;本文發布時尚未放出,外部尚無法完全獨立驗證架構與跑分。

K3 為 open-weight(權重可下載),非嚴格意義 fully open-source;許可預計沿用 Moonshot 此前 modified-MIT 路線,以 7/27 發布日 LICENSE 原文為準。

結語

Opus 5 把「旗艦級 Agent 能力」壓到日常可承受的 token 帳單;K3 則把前沿能力以開源敘事推到輿論前台——但蒸餾指控 + 自稱 Claude 的統計證據提醒開發者:選型不能只看 benchmark 表格,還要看合規、資料留存與模型溯源。

若你要在 Cursor、Claude Code 或 Kimi Code 裡第一時間驗收 Opus 5 與 K3 路由,Windows/Linux 主力機常卡在 OAuth 回呼、macOS 權限彈窗與 Gateway 圖形對照;自購 Mac 還有睡眠策略與系統更新打斷 Agent 常駐的隱性成本。相較之下,租用 VNCMac 遠端 Mac + VNC 圖形工作階段可在與 Gateway 同機環境下完成多模型切換與日誌核對,把「本週兩大瓜」變成可復現的 Agent 驗收,而非只看新聞標題。