AI 週報 2026年7月25日 約 24 分 Claude Opus 5 Kimi K3

Claude Opus 5 半額で Fable 5 に迫る
Kimi K3 は「Claude 自称」蒸留疑惑に

7/24 Opus 5 が Claude Max デフォルト · ホワイトハウス蒸留疑惑 · Greenblatt 技術分析

Claude Opus 5 リリースと Kimi K3 蒸留疑惑 AI 週報コンセプト図

今週の AI 界は、一見無関係な二つのニュースが同じ問いを突きつけています——「コスパ」と「能力の出所」です。2026年7月24日、Anthropic は日常主力モデル Claude Opus 5 を発表し Claude Max のデフォルトに設定しました。一方、月之暗面(Moonshot AI)の Kimi K3 は、ホワイトハウス高官から「産業規模の蒸留」と公然と非難され、独立研究者は K3 がClaude を名乗り内部デプロイ ID を漏らす異常行動を報告しています。本稿では Opus 5 のベンチマーク・料金・安全・データ保持、K3 の 2.8T MoE 仕様、蒸留疑惑のタイムライン、Greenblatt 分析、Anthropic 2月の340万回 API 疑惑、r/LocalLLaMA の反応、Anthropic 2月の340万回 API 疑惑、r/LocalLLaMA の反応、FAQ まで整理します。

01

Claude Opus 5 発表:旗艦ではないが、最も使い勝手の良い Claude かもしれない

2026年7月24日(米太平洋時間)、Anthropic は Claude Opus 5(モデル ID:claude-opus-5)を正式リリースしました。同日から Claude Max のデフォルトモデルとなり、Claude Pro で使える最強版でもあります。位置づけは「日常の主力」——旗艦 Fable 5 に近い知能を、Fable 5 の半額で提供します。

項目内容
料金入力 $5 / 100万 tokens、出力 $25 / 100万 tokens(Opus 4.8 と同一)
コンテキスト100万 tokens(デフォルト・唯一の枠)
最大出力128K tokens
推論Thinking デフォルト ON、Effort で思考量を制御
プラットフォームClaude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry
Fast モード約 2.5 倍速、料金 2 倍(Opus 4.8 と同様)
データ保持デフォルトで強制保持なし(Fable 5 / Mythos 5 は 30 日 opt-in 必須)

主要ベンチマーク(Anthropic 公式)

  • Frontier-Bench v0.1(ソフトウェア工学):全モデル超越、Opus 4.8 の2倍以上、タスク単価はより低い
  • CursorBench 3.2:max effort で Fable 5 峰值とわずか 0.5% 差、コストは半分。high/xhigh/max 帯のコスパは市場最高水準
  • ARC-AGI 3:次点モデルの3倍スコア
  • Zapier AutomationBench:次点の約 1.5 倍通過率。最低 effort でも他モデルを上回る。アカウント健全性 E2E ワークフロー 100% 通過(過去モデルは未達)
  • OSWorld 2.0:任意コスト帯で他モデル上回る。Fable 5 コストの約3分の1強で Fable 5 ベストを超える
  • 科学・生命科学:構造生物学・有機化学・バイオinformatics で Opus 4.8 を全面超越。分光から分子構造を逆算する内部評価で +10.2pp、タンパク質変異機能予測で +7.7pp

顧客コメント:Cursor は「near Fable 5 intelligence at Opus speed and cost」と評価。Zapier は AutomationBench 首位かつ token 消費増なし。Box は分析ワークフロー +11%、デューデリ +17%、全体精度 +8% を報告しています。

アライメントと安全

自動行動監査では Opus 5 はこれまでで最もアラインされたモデルとされます。欺瞞行動率が最低、悪用誘導に最も耐性があり、不可逆な鲁莽行動を避ける点でも最安全です。一方、リスクの高い二用途能力(サイバー攻撃・バイオセキュリティ)のフロンティア更新は意図的に行っていません——ここは限定提供の Mythos 5 が占めます。サイバーセキュリティ分類器は Fable 5 より約85%緩い(ブロック頻度が約85%低下)ため、ソースコードレベルの脆弱性発見に使えますが、バイナリスキャン・ペンテスト・exploit 生成は引き続きブロックされます。Fable 5 で遮断されていたバイオ関連リクエストは Opus 5 にルーティングされます(Opus 4.8 へのフォールバックではありません)。

日付イベント
2026-06-09Claude Fable 5 / Mythos 5 正式発表
2026-07-01Fable 5 が一般公開
2026-07-24Claude Opus 5 発表、Claude Max デフォルト化
02

選定前の悩み:Opus 5 vs Fable 5 決定マトリクス

  1. 01

    Fable 5 の価格壁:約 $10/$50 /100万 tokens で、日常 Agent ワークフローのコストが倍増

  2. 02

    30日データ保持:Fable 5 / Mythos 5 は opt-in 保持必須で、企業コンプライアンスに制約

  3. 03

    過剰スペック:多くのコーディング・自動化タスクに Mythos 級の二用途能力は不要

  4. 04

    切替コスト:Pro/Max ユーザーが旧 Opus のままだと、ソフトウェア工学 2× 改善を取り逃す

  5. 05

    検証環境:Cursor / Claude Code で Opus 5 と Fable 5 を比較するには macOS GUI セッションと OAuth コールバックが必要な場面が多い

Claude Opus 5Claude Fable 5
相対料金半分($5/$25)約 $10/$50
CursorBench 3.2(max)峰值との差 0.5%峰值ベースライン
デフォルトデータ保持強制なし30日 opt-in 必要
Claude Max デフォルトはい(7/24〜)いいえ
二用途フロンティア意図的に未更新Mythos 5 が限定提供
03

Kimi K3:世界初の「3T 級」オープンウェイトとベンチマーク

Moonshot AI は 2026年7月16日Kimi K3 を発表しました。総パラメータ 2.8兆(2.8T)、世界初の 3T 級オープンウェイト。896 エキスパートのスパース MoE で、トークンあたり 16 エキスパート活性(約500億相当)。自社 Kimi Delta Attention(KDA) + Attention Residuals + Stable LatentMoE で K2 比 2.5倍の学習効率。100万 tokenコンテキストとネイティブ視覚理解。完全ウェイトは 7月27日公開予定(執筆時未公開)です。

ベンチマークスコア備考
GPQA-Diamond93.5%発表時オープンウェイト最高
Terminal-Bench 2.188.3%GPT-5.6 Sol に 0.5pt 差
BrowseComp91.2%発表時最高
Humanity's Last Exam(ツール付)56.0%
MCP Atlas84.2%
Program Bench77.8%総合ベスト
SWE Marathon42.0%総合ベスト
DeepSearchQA (F1)95.0%

公式は総合力が Claude Fable 5 と GPT-5.6 Sol に次ぐとし、価格は大幅に低いとしています。K3 アーキテクチャと 7/27 ウェイト詳細はオープンウェイト公開カウントダウン深度評価をご覧ください。

04

蒸留疑惑:ホワイトハウス介入と Anthropic 2月の340万回疑惑

2026年7月22–23日、ホワイトハウス科学技術政策局(OSTP)長官 Michael Kratsios が X で Moonshot を非難しました。「大規模かつ隠蔽的な産業規模の蒸留(distillation)」で Anthropic Fable の能力を窃取し、輸出許可のない Nvidia GB300(Grace Blackwell 300)チップ(タイ経由の可能性)を使用した疑いがある、と。原文:「Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.」

財務長官 Scott Bessent も「多くの中国モデルに米国大モデルの『ウォーターマーク』を発見した」と付和しましたが、財務省は「ウォーターマーク」の具体的内容に応答していません。Kratsios は公開証拠を示しておらず、Moonshot は学習プロセスへの問い合わせに無回答です。

これは初めてではありません。2026年2月、Anthropic は Moonshot・DeepSeek・MiniMax への「産業規模蒸留攻撃」を公表済みです。偽アカウント経由で Moonshot から340万回超の異常 API 相互作用を特定し、「正常利用から明らかに逸脱し、意図的能力抽出を反映する」と述べ、API メタデータから一部行為が Moonshot 幹部に紐づくと主張しました。Moonshot は確認も否定もしていません。

日付イベント
2026-02Anthropic が Moonshot/DeepSeek/MiniMax 蒸留を初公開非難
2026-07-01Claude Fable 5 一般公開
2026-07-16Kimi K3 API/製品正式リリース
2026-07-22/23OSTP 長官 Kratsios が蒸留+違法チップ疑惑を公開
2026-07-23TechCrunch が専家の蒸留説懐疑を報道
2026-07-24 頃Ryan Greenblatt が「K3 Claude 自称」統計を公開
2026-07-27(予定)Kimi K3 完全ウェイト公開、外部独立検証可能に
05

独立専家の反論:タイムラインが物理的に足りない

TechCrunch(7月23日)は複数の独立研究者に取材し、蒸留説への懐疑が主流でした——Fable 5 は7月1日から一般利用可能、K3 リリース(7月16日)までわずか2週間。RL 式蒸留に必要な教師モデルの大量スコアリングを含む深度蒸留は、データ規模・算力・API コストの面で現実的でない、という指摘です。

"

Braden Hancock(Laude Institute / Snorkel AI 共同創業):「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」

"

Nathan Lambert(Allen Institute for AI):中国モデルがフロンティアに近づくほど蒸留の限界効用は下がり、差を広げるのはより高コストな RL 訓練です。蒸留がそれほど有効なら、業界全体が既に GLM や K3 に追いついているはず——だがそうはなっていません。

「二重基準」も指摘されています。Elon Musk は xAI が Grok 訓練時に OpenAI モデルを蒸留したと法廷で認め、業界では珍しくないと述べました——問題は「通常の技術参考」と「隠蔽的な産業規模窃取」の境界線です。

06

最も硬い証拠:K3 が「Claude だと名乗る」

Redwood Research 首席科学者 Ryan Greenblatt が7月24日頃、統計分析を公開しました(GitHub:rgreenblatt/which_claude_is_k3)。複数モデルの自己認識行動を比較した結果:

  • Kimi K3 は異常に高頻度で Claude を名乗る。内部デプロイ ID まで漏らす——claude-opus-4-5-20250929claude-sonnet-4-5-20250929 など
  • 本物の Claude Sonnet 4.5 は「Claude Sonnet 4.5 です」と答える程度。Opus 4.5 は内部バージョン番号を自発的に報告しないか、古い誤った番号しか言わない
  • Greenblatt の判断:K3 が語る教師モデルのデプロイメタデータは、教師自身より正確。「会話スタイルの模倣」では説明しにくく、デプロイメタデータ付き Claude データ(API ログやラベル付き合成データ)の混入を示唆
  • K3 の自称バージョンは「Claude 4.5 時代」(2025年末)に固定。現行 Fable/Mythos ではない。K2 はより古い Claude Sonnet 4(2025年中期)を指す——世代を追うパターン

重要な但し書き:Greenblatt はこれらの発見が蒸留の直接証明にはならないと強調しています。学習データ汚染、システムプロンプト漏洩、公開データセット合成も説明可能です。ただし Anthropic 2月疑惑と統計的規則性を合わせると、蒸留説の最も技術的な間接証拠と言えます。英語差別化 KW:Why does Kimi K3 say it's Claude / Kimi K3 self-identifies as Claude——調査時点で競合記事はほぼありません。

07

コミュニティ反応と 7/27 ウェイトの suspense

Reddit r/LocalLLaMA では三つの声が交錯しています。「オープンとクローズドの差が数ヶ月ではなく数日に縮まった」という歓喜。「2.8T パラメータは誰もローカルで回せない」という自嘲。そして K3 の真の売りは低価格+緩いコンテンツ制限であり「Fable 5 打倒」ではない、という現実派です。

完全ウェイトは 7月27日まで公開されず、疑惑が沸騰した時点で外部研究者はパラメータ規模・アーキテクチャ・ベンチ再現を独立検証できませんでした——論争が長引く構造的原因です。産業政策にも波及:米国は中国オープンウェイトモデルの制限を議論し、チップ輸出規制が再燃(2026年5月 Supermicro 創業者の先端チップ密輸起訴を想起)。

08

二つを並べて見る:コスパこそが主戦場

Opus 5 は「半額で旗艦に迫る」ことで市場のコスパ要求に応えました。Kimi K3 は「オープン+低価格+制限緩和」で攻勢。K3 を巡る疑惑の本質は、コスパ戦争の中で「あなたの安さは技術最適化の成果か、それとも他人のモデルを無断利用した結果か」を公然と問うことです。

開発者への現実的アドバイス:コンプライアンス・データ保持・サプライチェーンリスクが重要なら、Opus 5 は「値上げなしで能力ジャンプ」として非常に魅力的です。極限コストとオープンウェイト制御を優先するなら、7月27日のウェイト公開後に実測する価値があります——それまでは公式自評+外部推測に過ぎません。

  1. 01

    コンプライアンス優先:Opus 5 + 強制保持なし + Anthropic 公式 API

  2. 02

    コスト極限:K3 ウェイト+独立ベンチ再現後に自ホスト vs API を判断

  3. 03

    Agent 検証:Cursor / Claude Code / Kimi Code で CursorBench 系タスクを対照

  4. 04

    GUI セッション:OAuth・Gateway・モデル切替は VNC リモート Mac でクリック検証

  5. 05

    7/27 追記:ウェイト公開後に本文アンカー更新、「K3 ウェイト DL」「蒸留証明?」ロングテールを狙う

FAQ

よくある質問

同一トークン単価帯で Opus 5 は Fable 5 の約半分($5/$25 vs 約 $10/$50 /100万 input/output)。CursorBench は Fable 5 峰值と 1% 未満の差です。

はい。7月24日リリース当日から Opus 5 が Claude Max デフォルト、Claude Pro 最強版です。

争点あり、未確定。ホワイトハウス疑惑に公開証拠乏しい。専家は2週間タイムラインで深度蒸留は非現実的。Greenblatt の「Claude 自称+内部 ID」が最強の技術間接証拠です。

公式は 2026年7月27日。本文執筆時未公開のため、外部はアーキテクチャとベンチを完全独立検証できません。

open-weight(ウェイト DL 可)であり、厳密な fully open-source ではありません。ライセンスは Moonshot 従来の modified-MIT 路線の見込み。7/27 LICENSE 原文で確認してください。

まとめ

Opus 5 は旗艦級 Agent 能力を日常の token 請求に収めました。K3 はオープン叙事でフロンティアを世論の中心に——しかし蒸留疑惑と Claude 自称の統計は、ベンチ表だけで選んではいけないことを示しています。コンプライアンス、データ保持、モデル由来も同等に重要です。

Cursor、Claude Code、Kimi Code で Opus 5 と K3 ルーティングを即検証する場合、Windows/Linux 主力機では OAuth コールバック、macOS 権限ダイアログ、Gateway GUI 対照で詰まりがちです。Mac 購入にはスリープ設定・OS 更新・減価償却の隠れコストもあります。VNCMac リモート Mac + VNC グラフィカルセッションなら Gateway と同一環境でマルチモデル切替とログ照合ができ、今週の二大トピックを再現可能な Agent 検証に変えられます。