AI 周报 2026年7月25日 约 24 分钟 Claude Opus 5 Kimi K3

Claude Opus 5 价格减半逼近旗舰实力
Kimi K3 却陷「自称 Claude」蒸馏门

7/24 Opus 5 成为 Claude Max 默认 · 白宫指控 K3 蒸馏 · Greenblatt 技术证据 · 开发者选型

Claude Opus 5 发布与 Kimi K3 蒸馏门 AI 周报概念图

本周 AI 圈两件大事表面无关,实则都指向同一主题——「性价比」与「模型能力的真实来源」:Anthropic 于 2026 年 7 月 24 日发布日常主力模型 Claude Opus 5,并设为 Claude Max 默认模型;月之暗面刚发布的 Kimi K3 则被白宫官员公开指控「产业级蒸馏」,独立研究者更发现 K3 会自称是 Claude 并吐出内部部署版本号。本文严格依据调研素材,覆盖 Opus 5 全量基准/定价/安全/数据留存、K3 规格与「蒸馏门」时间线、Greenblatt 技术分析、Anthropic 2 月指控背景、社区反应与开发者选型建议,并附 FAQ。

01

Claude Opus 5 发布:不是旗舰,但可能是最值得用的 Claude

2026 年 7 月 24 日(美国太平洋时间),Anthropic 正式发布 Claude Opus 5(模型 ID:claude-opus-5),同步成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。定位是日常主力模型:接近旗舰 Fable 5 智能水平,价格为 Fable 5 的一半。

项目内容
定价输入 $5 / 百万 tokens,输出 $25 / 百万 tokens(与 Opus 4.8 完全相同)
上下文窗口100 万 tokens(默认且唯一档位)
最大输出128K tokens
默认推理Thinking 默认开启,Effort 参数控制思考量
平台Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry
Fast 模式速度约为默认 2.5 倍,价格为基础价 2 倍(与 Opus 4.8 一致)
数据留存默认访问不强制数据留存(Fable 5 / Mythos 5 需接受 30 天留存政策)

关键性能数据(Anthropic 官方)

  • Frontier-Bench v0.1(软件工程):超越所有模型,是 Opus 4.8 的两倍以上,单任务成本更低
  • CursorBench 3.2:max effort 与 Fable 5 峰值相差仅 0.5%,成本为 Fable 5 一半;high/xhigh/max 档位性价比超市面所有模型
  • ARC-AGI 3:得分是次优模型的3 倍
  • Zapier AutomationBench:通过率约为次优模型 1.5 倍;最低 effort 仍超其他任何模型;端到端账户健康工作流 100% 通过(此前模型均未通过)
  • OSWorld 2.0:任意成本下优于其他模型;仅用 Fable 5 成本三分之一多一点超过 Fable 5 最佳成绩
  • 科研/生命科学:结构生物学、有机化学、生物信息学全面超 Opus 4.8;光谱反推分子结构内部评测高 10.2 个百分点;蛋白质序列变异功能预测高 7.7 个百分点

客户反馈摘录:Cursor 团队称 Opus 5「near Fable 5 intelligence at Opus speed and cost」;Zapier 称其 AutomationBench 榜首且未消耗更多 tokens;Box 报告数据分析工作流提升 11%、尽职调查提升 17%、整体准确率提升 8%

对齐与安全

自动化行为审计显示 Opus 5 是迄今为止最对齐的模型:欺骗行为发生率最低、最不易被诱导滥用、在避免难以逆转的鲁莽行为方面最安全。但在风险型双用途能力(网络安全攻击、生物安全)上故意没有刷新前沿——仍由受限发行的 Mythos 5 占据。网络安全分类器比 Fable 5 宽松约 85%(触发拦截频率降低约 85%),可用于源码级漏洞发现,仍屏蔽二进制漏洞扫描、渗透测试、exploit 生成。生物安全相关请求:原本在 Fable 5 上被拦截的,现在路由给 Opus 5(而非回 Opus 4.8)。

日期事件
2026-06-09Claude Fable 5 / Mythos 5 正式发布
2026-07-01Fable 5 面向公众正式可用
2026-07-24Claude Opus 5 发布,成为 Claude Max 默认模型
02

选型前的痛点:Opus 5 vs Fable 5 决策矩阵

  1. 01

    Fable 5 价格门槛:约 $10/$50 每百万 input/output tokens,日常 Agent 工作流成本翻倍

  2. 02

    30 天数据留存:Fable 5 / Mythos 5 需 opt-in 留存政策,企业合规场景受限

  3. 03

    过度能力浪费:多数编码/自动化任务不需要 Mythos 级双用途前沿能力

  4. 04

    模型切换成本:Pro/Max 用户若默认仍停在旧 Opus,会错过 2× 软件工程提升

  5. 05

    验收环境:在 Cursor / Claude Code 中对比 Opus 5 与 Fable 5 常需 macOS 图形会话与 OAuth 回调

维度Claude Opus 5Claude Fable 5
相对定价一半($5/$25)约 $10/$50
CursorBench 3.2(max)与峰值差 0.5%峰值基准
默认数据留存不强制需 30 天 opt-in
Claude Max 默认是(7/24 起)
双用途前沿(网安/生物)故意未登顶Mythos 5 受限发行占顶
03

Kimi K3:全球首个「3T 级」开源模型与基准

月之暗面(Moonshot AI)于 2026 年 7 月 16 日发布 Kimi K3:总参数 2.8 万亿(2.8T),全球首个进入 3T 级的开源模型;稀疏 MoE,896 专家中每 token 激活 16 个(约等效 500 亿激活参数);自研 Kimi Delta Attention(KDA) + Attention Residuals + Stable LatentMoE,训练效率较 K2 提升约 2.5 倍100 万 token上下文与原生视觉理解。完整权重承诺 7 月 27 日放出(撰稿时尚未放出)。

基准分数备注
GPQA-Diamond93.5%发布时开源模型最高分
Terminal-Bench 2.188.3%落后 GPT-5.6 Sol 0.5 分
BrowseComp91.2%发布时最高分
Humanity's Last Exam(带工具)56.0%
MCP Atlas84.2%
Program Bench77.8%综合最佳
SWE Marathon42.0%综合最佳
DeepSearchQA (F1)95.0%

官方自称整体能力仅次于 Claude Fable 5 与 GPT-5.6 Sol,价格大幅低于两者。更多 K3 架构与 7/27 权重细节见站内开源权重倒计时深度评测

04

「蒸馏门」:白宫下场与 Anthropic 2 月指控

2026 年 7 月 22–23 日,白宫科技政策办公室(OSTP)主任 Michael Kratsios 在 X 上指控月之暗面通过「大规模、隐蔽的产业级蒸馏(distillation)」窃取 Anthropic Fable 模型能力,并涉嫌使用未获出口许可的 Nvidia GB300(Grace Blackwell 300)芯片(可能经泰国服务器间接获取)。原话:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」

财政部长 Scott Bessent 附和称「在很多中国模型上发现了美国大模型的『水印』」——但财政部未回应「水印」具体指什么。Kratsios 并未公开支撑指控的具体证据;月之暗面对训练过程质询未予回应。

这不是第一次:早在 2026 年 2 月,Anthropic 已公开指控月之暗面、DeepSeek、MiniMax 进行「产业级蒸馏攻击」,称通过虚假账号识别出月之暗面超过 340 万次异常交互,「明显偏离正常使用模式,反映刻意能力提取而非合法使用」,并称已通过 API 请求元数据追踪到部分行为与月之暗面高层相关。月之暗面从未正面确认或否认。

日期事件
2026-02Anthropic 首次公开指控月之暗面/DeepSeek/MiniMax 产业级蒸馏
2026-07-01Claude Fable 5 面向公众开放
2026-07-16Kimi K3 API/产品正式发布
2026-07-22/23白宫 OSTP 主任 Kratsios 公开指控蒸馏 + 违规芯片
2026-07-23TechCrunch 刊发专家质疑蒸馏说的报道
2026-07-24 左右Ryan Greenblatt 发布「K3 自称 Claude」统计证据
2026-07-27(计划)Kimi K3 完整权重开源,外部可独立验证
05

独立专家反驳:时间线根本不够

TechCrunch(7 月 23 日)采访多位独立研究者,普遍对「蒸馏说」存疑——Fable 5 从 7 月 1 日才公开可用,到 K3 发布(7 月 16 日)仅两周,深度蒸馏(尤其涉及 RL 式蒸馏需教师模型海量打分)在数据规模、算力与 API 成本上难以完成。

"

Braden Hancock(Laude Institute / Snorkel AI 联合创始人):「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」

"

Nathan Lambert(Allen Institute for AI):随着中国模型逼近前沿,蒸馏边际收益变小,真正拉开差距的是更烧钱的 RL 训练——若蒸馏真这么好用,所有人早就靠蒸馏追平 GLM 或 K3 了,但事实并非如此。

也有专家指出「双标」:Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称这在行业内很常见——问题核心在于「正常技术借鉴」与「隐蔽工业级窃取」的边界如何界定。

06

最硬核证据:K3 会「自称是 Claude」

Redwood Research 首席科学家 Ryan Greenblatt 于 7 月 24 日左右发布统计分析(GitHub:rgreenblatt/which_claude_is_k3),对比多模型身份自认行为:

  • Kimi K3 异常高频自称 Claude,甚至吐出 Claude 官方内部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真实 Claude Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不会主动报出这类内部版本号,或只会报旧错误版本号
  • Greenblatt 判断:模型说出的教师模型部署元数据比教师模型自己还准确,很难用「模仿对话风格」解释,更可能指向训练数据混入带部署元数据标注的 Claude 数据(API 日志或打标合成数据)
  • K3 自称版本锁定在「Claude 4.5 时代」(2025 年末),而非当前 Fable/Mythos;K2 信号指向更早 Claude Sonnet 4(2025 年中)——呈现「逐代追新」规律

重要澄清:Greenblatt 强调这些发现不能直接证明蒸馏发生——身份混淆也可能来自训练数据污染、系统提示词泄露或公开数据集合成样本;但结合 Anthropic 2 月指控与统计规律性,这是「蒸馏说」迄今最接地气的技术证据,而不只是政治喊话。这也是目前「蒸馏说」最具技术含量的间接证据,而不只是政治层面的喊话。

07

社区反应与 7/27 权重悬念

Reddit r/LocalLLaMA 等呈现三种声音:欢呼「开源与闭源差距缩短到几天而非几个月」;调侃「2.8T 参数几乎没人能在本地跑」;务实派认为 K3 真正卖点是低价 + 更少内容审查,而非「打败 Fable 5」。

完整权重要到 7 月 27 日才发布,争议爆发时外部研究者尚无法独立验证参数规模、架构细节与基准复现——舆论持续发酵的重要原因。争议还牵动产业政策:美方正讨论是否限制中国开放权重模型,芯片出口管制再次被提起(联想到 2026 年 5 月 Supermicro 创始人走私先进芯片被起诉案例)。

08

两件事放在一起看:性价比才是主战场

Opus 5 用「半价逼近旗舰」回应市场对性价比的诉求;Kimi K3 用「开源 + 低价 + 不设限」冲击市场;围绕 K3 的争议,本质是各家在性价比战争里对「你的低价到底是技术优化换来的,还是白嫖别人模型换来的」的公开摊牌。

对普通开发者更现实的建议:若场景对合规、数据留存、供应链风险敏感,Opus 5「价格没涨、能力跳级」性价比很高;若更在意极限成本与开源可控性,K3 值得等到 7 月 27 日权重放出后再实测——此前真实能力仍只是「官方自评 + 外部猜测」。

  1. 01

    合规优先:选 Opus 5 + 无强制留存 + Anthropic 官方 API

  2. 02

    成本极限:等 K3 权重 + 独立基准复现后再决策自部署 vs API

  3. 03

    Agent 验收:在 Cursor / Claude Code / Kimi Code 中对照 CursorBench 类任务

  4. 04

    图形会话:OAuth、Gateway 与模型切换在 VNC 远程 Mac 上可点选验收

  5. 05

    7/27 追更:权重公开后关注独立基准复现,看蒸馏指控是否被坐实

FAQ

常见问题

相同 token 单价档位下 Opus 5 约为 Fable 5 一半($5/$25 vs 约 $10/$50 每百万 input/output),CursorBench 与 Fable 5 峰值相差不到 1%。

是的,7 月 24 日发布当天起 Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 最强可用版本。

仍有争议、未最终证实。白宫指控缺公开证据;专家从时间线认为两周内深度蒸馏不现实;Greenblatt 的「自称 Claude + 内部 ID」是目前最强技术间接证据。

官方承诺 2026 年 7 月 27 日;本文发布时尚未放出,外部尚无法完全独立验证架构与跑分。

K3 为 open-weight(权重可下载),非严格意义 fully open-source;许可预计沿用 Moonshot 此前 modified-MIT 路线,以 7/27 发布日 LICENSE 原文为准。

结语

Opus 5 把「旗舰级 Agent 能力」压到日常可承受的 token 账单;K3 则把前沿能力以开源叙事推到舆论前台——但蒸馏指控 + 自称 Claude 的统计证据提醒开发者:选型不能只看 benchmark 表格,还要看合规、数据留存与模型溯源。

若你要在 Cursor、Claude Code 或 Kimi Code 里第一时间验收 Opus 5 与 K3 路由,Windows/Linux 主力机常卡在 OAuth 回调、macOS 权限弹窗与 Gateway 图形对照;自购 Mac 还有睡眠策略与系统更新打断 Agent 常驻的隐性成本。相较之下,租用 VNCMac 远程 Mac + VNC 图形会话可在与 Gateway 同机环境下完成多模型切换与日志核对,把「本周两大瓜」变成可复现的 Agent 验收,而非只看新闻标题。