7/24 Opus 5 成为 Claude Max 默认 · 白宫指控 K3 蒸馏 · Greenblatt 技术证据 · 开发者选型
本周 AI 圈两件大事表面无关,实则都指向同一主题——「性价比」与「模型能力的真实来源」:Anthropic 于 2026 年 7 月 24 日发布日常主力模型 Claude Opus 5,并设为 Claude Max 默认模型;月之暗面刚发布的 Kimi K3 则被白宫官员公开指控「产业级蒸馏」,独立研究者更发现 K3 会自称是 Claude 并吐出内部部署版本号。本文严格依据调研素材,覆盖 Opus 5 全量基准/定价/安全/数据留存、K3 规格与「蒸馏门」时间线、Greenblatt 技术分析、Anthropic 2 月指控背景、社区反应与开发者选型建议,并附 FAQ。
2026 年 7 月 24 日(美国太平洋时间),Anthropic 正式发布 Claude Opus 5(模型 ID:claude-opus-5),同步成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。定位是日常主力模型:接近旗舰 Fable 5 智能水平,价格为 Fable 5 的一半。
| 项目 | 内容 |
|---|---|
| 定价 | 输入 $5 / 百万 tokens,输出 $25 / 百万 tokens(与 Opus 4.8 完全相同) |
| 上下文窗口 | 100 万 tokens(默认且唯一档位) |
| 最大输出 | 128K tokens |
| 默认推理 | Thinking 默认开启,Effort 参数控制思考量 |
| 平台 | Claude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry |
| Fast 模式 | 速度约为默认 2.5 倍,价格为基础价 2 倍(与 Opus 4.8 一致) |
| 数据留存 | 默认访问不强制数据留存(Fable 5 / Mythos 5 需接受 30 天留存政策) |
客户反馈摘录:Cursor 团队称 Opus 5「near Fable 5 intelligence at Opus speed and cost」;Zapier 称其 AutomationBench 榜首且未消耗更多 tokens;Box 报告数据分析工作流提升 11%、尽职调查提升 17%、整体准确率提升 8%。
自动化行为审计显示 Opus 5 是迄今为止最对齐的模型:欺骗行为发生率最低、最不易被诱导滥用、在避免难以逆转的鲁莽行为方面最安全。但在风险型双用途能力(网络安全攻击、生物安全)上故意没有刷新前沿——仍由受限发行的 Mythos 5 占据。网络安全分类器比 Fable 5 宽松约 85%(触发拦截频率降低约 85%),可用于源码级漏洞发现,仍屏蔽二进制漏洞扫描、渗透测试、exploit 生成。生物安全相关请求:原本在 Fable 5 上被拦截的,现在路由给 Opus 5(而非回 Opus 4.8)。
| 日期 | 事件 |
|---|---|
| 2026-06-09 | Claude Fable 5 / Mythos 5 正式发布 |
| 2026-07-01 | Fable 5 面向公众正式可用 |
| 2026-07-24 | Claude Opus 5 发布,成为 Claude Max 默认模型 |
Fable 5 价格门槛:约 $10/$50 每百万 input/output tokens,日常 Agent 工作流成本翻倍
30 天数据留存:Fable 5 / Mythos 5 需 opt-in 留存政策,企业合规场景受限
过度能力浪费:多数编码/自动化任务不需要 Mythos 级双用途前沿能力
模型切换成本:Pro/Max 用户若默认仍停在旧 Opus,会错过 2× 软件工程提升
验收环境:在 Cursor / Claude Code 中对比 Opus 5 与 Fable 5 常需 macOS 图形会话与 OAuth 回调
| 维度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 相对定价 | 约 一半($5/$25) | 约 $10/$50 |
| CursorBench 3.2(max) | 与峰值差 0.5% | 峰值基准 |
| 默认数据留存 | 不强制 | 需 30 天 opt-in |
| Claude Max 默认 | 是(7/24 起) | 否 |
| 双用途前沿(网安/生物) | 故意未登顶 | Mythos 5 受限发行占顶 |
月之暗面(Moonshot AI)于 2026 年 7 月 16 日发布 Kimi K3:总参数 2.8 万亿(2.8T),全球首个进入 3T 级的开源模型;稀疏 MoE,896 专家中每 token 激活 16 个(约等效 500 亿激活参数);自研 Kimi Delta Attention(KDA) + Attention Residuals + Stable LatentMoE,训练效率较 K2 提升约 2.5 倍;100 万 token上下文与原生视觉理解。完整权重承诺 7 月 27 日放出(撰稿时尚未放出)。
| 基准 | 分数 | 备注 |
|---|---|---|
| GPQA-Diamond | 93.5% | 发布时开源模型最高分 |
| Terminal-Bench 2.1 | 88.3% | 落后 GPT-5.6 Sol 0.5 分 |
| BrowseComp | 91.2% | 发布时最高分 |
| Humanity's Last Exam(带工具) | 56.0% | — |
| MCP Atlas | 84.2% | — |
| Program Bench | 77.8% | 综合最佳 |
| SWE Marathon | 42.0% | 综合最佳 |
| DeepSearchQA (F1) | 95.0% | — |
官方自称整体能力仅次于 Claude Fable 5 与 GPT-5.6 Sol,价格大幅低于两者。更多 K3 架构与 7/27 权重细节见站内开源权重倒计时与深度评测。
2026 年 7 月 22–23 日,白宫科技政策办公室(OSTP)主任 Michael Kratsios 在 X 上指控月之暗面通过「大规模、隐蔽的产业级蒸馏(distillation)」窃取 Anthropic Fable 模型能力,并涉嫌使用未获出口许可的 Nvidia GB300(Grace Blackwell 300)芯片(可能经泰国服务器间接获取)。原话:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」
财政部长 Scott Bessent 附和称「在很多中国模型上发现了美国大模型的『水印』」——但财政部未回应「水印」具体指什么。Kratsios 并未公开支撑指控的具体证据;月之暗面对训练过程质询未予回应。
这不是第一次:早在 2026 年 2 月,Anthropic 已公开指控月之暗面、DeepSeek、MiniMax 进行「产业级蒸馏攻击」,称通过虚假账号识别出月之暗面超过 340 万次异常交互,「明显偏离正常使用模式,反映刻意能力提取而非合法使用」,并称已通过 API 请求元数据追踪到部分行为与月之暗面高层相关。月之暗面从未正面确认或否认。
| 日期 | 事件 |
|---|---|
| 2026-02 | Anthropic 首次公开指控月之暗面/DeepSeek/MiniMax 产业级蒸馏 |
| 2026-07-01 | Claude Fable 5 面向公众开放 |
| 2026-07-16 | Kimi K3 API/产品正式发布 |
| 2026-07-22/23 | 白宫 OSTP 主任 Kratsios 公开指控蒸馏 + 违规芯片 |
| 2026-07-23 | TechCrunch 刊发专家质疑蒸馏说的报道 |
| 2026-07-24 左右 | Ryan Greenblatt 发布「K3 自称 Claude」统计证据 |
| 2026-07-27(计划) | Kimi K3 完整权重开源,外部可独立验证 |
TechCrunch(7 月 23 日)采访多位独立研究者,普遍对「蒸馏说」存疑——Fable 5 从 7 月 1 日才公开可用,到 K3 发布(7 月 16 日)仅两周,深度蒸馏(尤其涉及 RL 式蒸馏需教师模型海量打分)在数据规模、算力与 API 成本上难以完成。
Braden Hancock(Laude Institute / Snorkel AI 联合创始人):「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」
Nathan Lambert(Allen Institute for AI):随着中国模型逼近前沿,蒸馏边际收益变小,真正拉开差距的是更烧钱的 RL 训练——若蒸馏真这么好用,所有人早就靠蒸馏追平 GLM 或 K3 了,但事实并非如此。
也有专家指出「双标」:Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称这在行业内很常见——问题核心在于「正常技术借鉴」与「隐蔽工业级窃取」的边界如何界定。
Redwood Research 首席科学家 Ryan Greenblatt 于 7 月 24 日左右发布统计分析(GitHub:rgreenblatt/which_claude_is_k3),对比多模型身份自认行为:
重要澄清:Greenblatt 强调这些发现不能直接证明蒸馏发生——身份混淆也可能来自训练数据污染、系统提示词泄露或公开数据集合成样本;但结合 Anthropic 2 月指控与统计规律性,这是「蒸馏说」迄今最接地气的技术证据,而不只是政治喊话。这也是目前「蒸馏说」最具技术含量的间接证据,而不只是政治层面的喊话。
Reddit r/LocalLLaMA 等呈现三种声音:欢呼「开源与闭源差距缩短到几天而非几个月」;调侃「2.8T 参数几乎没人能在本地跑」;务实派认为 K3 真正卖点是低价 + 更少内容审查,而非「打败 Fable 5」。
完整权重要到 7 月 27 日才发布,争议爆发时外部研究者尚无法独立验证参数规模、架构细节与基准复现——舆论持续发酵的重要原因。争议还牵动产业政策:美方正讨论是否限制中国开放权重模型,芯片出口管制再次被提起(联想到 2026 年 5 月 Supermicro 创始人走私先进芯片被起诉案例)。
Opus 5 用「半价逼近旗舰」回应市场对性价比的诉求;Kimi K3 用「开源 + 低价 + 不设限」冲击市场;围绕 K3 的争议,本质是各家在性价比战争里对「你的低价到底是技术优化换来的,还是白嫖别人模型换来的」的公开摊牌。
对普通开发者更现实的建议:若场景对合规、数据留存、供应链风险敏感,Opus 5「价格没涨、能力跳级」性价比很高;若更在意极限成本与开源可控性,K3 值得等到 7 月 27 日权重放出后再实测——此前真实能力仍只是「官方自评 + 外部猜测」。
合规优先:选 Opus 5 + 无强制留存 + Anthropic 官方 API
成本极限:等 K3 权重 + 独立基准复现后再决策自部署 vs API
Agent 验收:在 Cursor / Claude Code / Kimi Code 中对照 CursorBench 类任务
图形会话:OAuth、Gateway 与模型切换在 VNC 远程 Mac 上可点选验收
7/27 追更:权重公开后关注独立基准复现,看蒸馏指控是否被坐实
相同 token 单价档位下 Opus 5 约为 Fable 5 一半($5/$25 vs 约 $10/$50 每百万 input/output),CursorBench 与 Fable 5 峰值相差不到 1%。
是的,7 月 24 日发布当天起 Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 最强可用版本。
仍有争议、未最终证实。白宫指控缺公开证据;专家从时间线认为两周内深度蒸馏不现实;Greenblatt 的「自称 Claude + 内部 ID」是目前最强技术间接证据。
官方承诺 2026 年 7 月 27 日;本文发布时尚未放出,外部尚无法完全独立验证架构与跑分。
K3 为 open-weight(权重可下载),非严格意义 fully open-source;许可预计沿用 Moonshot 此前 modified-MIT 路线,以 7/27 发布日 LICENSE 原文为准。
Opus 5 把「旗舰级 Agent 能力」压到日常可承受的 token 账单;K3 则把前沿能力以开源叙事推到舆论前台——但蒸馏指控 + 自称 Claude 的统计证据提醒开发者:选型不能只看 benchmark 表格,还要看合规、数据留存与模型溯源。
若你要在 Cursor、Claude Code 或 Kimi Code 里第一时间验收 Opus 5 与 K3 路由,Windows/Linux 主力机常卡在 OAuth 回调、macOS 权限弹窗与 Gateway 图形对照;自购 Mac 还有睡眠策略与系统更新打断 Agent 常驻的隐性成本。相较之下,租用 VNCMac 远程 Mac + VNC 图形会话可在与 Gateway 同机环境下完成多模型切换与日志核对,把「本周两大瓜」变成可复现的 Agent 验收,而非只看新闻标题。