AI Wochenrückblick 25. Juli 2026 ~24 Min. Claude Opus 5 Kimi K3

Claude Opus 5 zum halben Preis —
Kimi K3 in der Destillations-Kontroverse

Opus 5 wird Claude-Max-Standard · Weißes Haus wirft K3 Destillation vor · Greenblatts technische Indizien

Claude Opus 5 Release und Kimi K3 Destillations-Kontroverse AI Wochenrückblick

Zwei Schlagzeilen, ein Thema — Preis-Leistung und die Herkunft von Modellintelligenz: Am 24. Juli 2026 stellt Anthropic Claude Opus 5 als neues Claude-Max-Standardmodell vor; Moonshot AIs frisch veröffentlichtes Kimi K3 steht unter dem Vorwurf der industriellen Destillation durch das Weiße Haus — und unabhängige Forscher zeigen, dass K3 sich als Claude ausgibt und interne Deployment-IDs ausspuckt. Dieser Leitfaden deckt Opus-5-Benchmarks, Preise, Sicherheit und Datenspeicherung, K3-Specs, die Destillations-Timeline, Greenblatts Analyse, Anthropics Februar-Vorwürfe, Community-Reaktionen, das Preis-Leistungs-Thema, Community-Reaktionen sowie FAQ ab.

01

Claude Opus 5: kein Flaggschiff, aber vielleicht das sinnvollste Claude

Am 24. Juli 2026 (US-Pacific) veröffentlichte Anthropic Claude Opus 5 (Modell-ID: claude-opus-5) als Claude-Max-Standard und stärkste Version für Claude Pro. Positionierung: Alltags-Arbeitsmodell — nahe Fable-5-Intelligenz zum halben Preis.

MerkmalDetails
PreiseInput 5 $ / Mio. Tokens, Output 25 $ / Mio. Tokens (identisch zu Opus 4.8)
Kontext1 Mio. Tokens (Standard und einzige Stufe)
Max. Output128K Tokens
ReasoningThinking standardmäßig an; Effort-Parameter steuert Denkaufwand
PlattformenClaude API / Platform / AWS Bedrock / Google Vertex AI / Microsoft Foundry
Fast-Modus~2,5× schneller, 2× Preis (wie Opus 4.8)
DatenspeicherungKeine erzwungene Speicherung bei Standardzugriff (Fable 5 / Mythos 5: 30-Tage-Opt-in)

Benchmarks (Anthropic offiziell)

  • Frontier-Bench v0.1 (Software-Engineering): übertrifft alle Modelle, mehr als doppelt so gut wie Opus 4.8, geringere Kosten pro Task
  • CursorBench 3.2: max effort nur 0,5 % unter Fable-5-Peak, Kosten halbiert; high/xhigh/max bietet bestes Preis-Leistungs-Verhältnis
  • ARC-AGI 3: der nächstbesten Modelle
  • Zapier AutomationBench: ~1,5× Pass-Rate; niedrigster Effort schlägt alle anderen; End-to-End-Account-Health 100 %
  • OSWorld 2.0: bei jedem Kostenpunkt führend; mit ~⅓ Fable-5-Kosten übertrifft es Fable-5-Bestwerte
  • Forschung/Life Sciences: Strukturbiologie, organische Chemie, Bioinformatik über Opus 4.8; Spektrum-zu-Struktur +10,2 PP; Protein-Varianten +7,7 PP

Kundenstimmen: Cursor: „near Fable 5 intelligence at Opus speed and cost“; Zapier: AutomationBench-Spitze ohne mehr Tokens; Box: +11 % Datenanalyse, +17 % Due Diligence, +8 % Gesamtgenauigkeit.

Alignment und Sicherheit

Opus 5 gilt als bisher am besten aligned: niedrigste Täuschungsrate, schwerer zu missbrauchen, sicherste Vermeidung irreversibler Fehlhandlungen. Bei dual-use-Risiken (Cybersecurity, Biosicherheit) bewusst nicht an der Frontier — dort dominiert Mythos 5 (eingeschränkt). Cybersecurity-Klassifikator ~85 % lockerer als Fable 5 (Quellcode-Schwachstellen ja, Binär-Scans/Exploits nein). Biosicherheitsanfragen, die Fable 5 blockierte, gehen an Opus 5 statt an Opus 4.8.

DatumEreignis
2026-06-09Claude Fable 5 / Mythos 5 veröffentlicht
2026-07-01Fable 5 öffentlich verfügbar
2026-07-24Claude Opus 5 Release, Claude-Max-Standard
02

Entscheidungsmatrix: Opus 5 vs. Fable 5

  1. 01

    Fable-5-Preis: ~10 $/50 $ pro Mio. Input/Output — Agent-Workflows doppelt so teuer

  2. 02

    30-Tage-Speicherung: Fable 5 / Mythos 5 erfordern Opt-in — Compliance-Hürde

  3. 03

    Überdimensionierung: Die meisten Coding-/Automatisierungsaufgaben brauchen kein Mythos-Niveau

  4. 04

    Modellwechsel: Wer auf altem Opus bleibt, verpasst ~2× Software-Engineering-Gewinn

  5. 05

    Abnahme: Cursor / Claude Code Vergleiche brauchen oft macOS-GUI und OAuth-Callbacks

DimensionClaude Opus 5Claude Fable 5
Relativer Preis~50 % (5 $/25 $)~10 $/50 $
CursorBench 3.2 (max)0,5 % unter PeakPeak-Referenz
DatenspeicherungNicht erzwungen30-Tage-Opt-in
Claude-Max-StandardJa (ab 24.7.)Nein
Dual-use-FrontierBewusst nicht SpitzeMythos 5 (eingeschränkt)
03

Kimi K3: erstes 2,8T-Open-Weight-Modell und Benchmarks

Moonshot AI veröffentlichte Kimi K3 am 16. Juli 2026: 2,8 Billionen Parameter (erstes Open-Weight-Modell in der 3T-Klasse); sparsames MoE mit 896 Experten, 16 aktiv pro Token (~50 Mrd. aktive Parameter); Kimi Delta Attention (KDA) + Attention Residuals + Stable LatentMoE; Trainings-Effizienz ~2,5× gegenüber K2; 1 Mio. Token Kontext und natives Vision-Verständnis. Vollständige Gewichte versprochen für 27. Juli (zum Redaktionsschluss noch nicht live).

BenchmarkScoreAnmerkung
GPQA-Diamond93,5 %Höchster Open-Weight-Score zum Release
Terminal-Bench 2.188,3 %0,5 PP hinter GPT-5.6 Sol
BrowseComp91,2 %Release-Höchstwert
Humanity's Last Exam (mit Tools)56,0 %
MCP Atlas84,2 %
Program Bench77,8 %Gesamtbeste
SWE Marathon42,0 %Gesamtbeste
DeepSearchQA (F1)95,0 %

Moonshot positioniert K3 knapp hinter Claude Fable 5 und GPT-5.6 Sol, deutlich günstiger. Mehr zu Architektur und dem 27.7.-Weight-Drop: Open-Weights-Countdown.

04

Destillations-Kontroverse: Weißes Haus und Anthropic

Am 22.–23. Juli 2026 beschuldigte OSTP-Direktor Michael Kratsios auf X Moonshot der „groß angelegten, verdeckten industriellen Destillation“ von Anthropic Fable — plus mutmaßlicher Nutzung nicht exportierter Nvidia GB300-Chips (Grace Blackwell 300, möglicherweise über Thailand). Zitat: „Large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology and undermining American research is unacceptable.“

Finanzminister Scott Bessent sprach von „Wasserzeichen“ US-Modelle in chinesischen Systemen — ohne Details. Kratsios legte keine öffentlichen Beweise vor; Moonshot antwortete auf Trainingsfragen nicht.

Nicht neu: Bereits Februar 2026 warnte Anthropic vor „industriellen Destillationsangriffen“ durch Moonshot, DeepSeek und MiniMax — über 3,4 Mio. anomale API-Interaktionen bei Moonshot, „deutlich abweichend vom Normalgebrauch“, teils bis in die Führungsebene zurückverfolgt. Moonshot bestätigte oder dementierte nie.

DatumEreignis
2026-02Anthropic: erste öffentliche Destillationsvorwürfe
2026-07-01Fable 5 öffentlich verfügbar
2026-07-16Kimi K3 API/Produkt-Release
2026-07-22/23Weißes Haus: Destillation + Chip-Vorwurf
2026-07-23TechCrunch: Experten zweifeln Timeline
~2026-07-24Ryan Greenblatt: „K3 nennt sich Claude“
2026-07-27 (geplant)K3 Open Weights — externe Verifikation
05

Experten-Einwand: die Timeline reicht nicht

TechCrunch (23. Juli) zitiert unabhängige Forscher: Fable 5 war erst ab 1. Juli öffentlich — K3 erschien am 16. Juli, also 14 Tage später. Tiefe Destillation (besonders RL-basiert mit Millionen Teacher-Scores) ist in dieser Zeit kaum machbar.

"

Braden Hancock (Laude Institute / Snorkel AI): „I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.“

"

Nathan Lambert (Allen Institute for AI): Mit chinesischen Modellen an der Frontier schrumpft der Destillations-Hebel; teures RL trennt die Spitze. Wäre Destillation so mächtig, hätten alle längst aufgeholt.

Doppelstandard-Debatte: Elon Musk gab zu, xAI habe Grok mit OpenAI-Daten destilliert — die Grenze zwischen „normaler Branchenpraxis“ und „verdecktem Diebstahl“ bleibt politisch, nicht technisch scharf gezogen.

06

Stärkstes technisches Indiz: K3 nennt sich Claude

Ryan Greenblatt (Redwood Research) veröffentlichte um den 24. Juli eine Statistik (GitHub: rgreenblatt/which_claude_is_k3):

  • K3 nennt sich ungewöhnlich oft Claude und nennt interne Deployment-IDs wie claude-opus-4-5-20250929, claude-sonnet-4-5-20250929
  • Echtes Claude Sonnet 4.5 sagt nur „Ich bin Claude Sonnet 4.5“; Opus 4.5 nennt solche IDs selten oder falsch
  • Greenblatt: Der Schüler kennt Deployment-Metadaten präziser als der Lehrer — schwer als Stilimitation zu erklären; eher Trainingsdaten mit API-Log-Metadaten
  • K3 fixiert auf die Claude-4.5-Ära (Ende 2025), nicht Fable/Mythos; K2 zeigt frühere Sonnet-4-Signale — Muster des „Nachziehens“

Klarstellung: Das beweist Destillation nicht direkt — auch Datenkontamination oder synthetische Datensätze erklären es teilweise. Zusammen mit Anthropics Februar-Daten ist es das stärkste technische Indiz bisher. Differenzierende Keywords: Why does Kimi K3 say it's Claude / Kimi K3 self-identifies as Claude.

07

Community und die 27.7.-Gewichts-Suspense

Reddit r/LocalLLaMA: Jubel über „Open vs. Closed in Tagen statt Monaten“; Spott über 2,8T, die niemand lokal betreibt; Pragmatiker betonen niedrigen Preis und weniger Moderation statt „Fable 5 schlagen“.

Vollständige Gewichte erst am 27. Juli — deshalb konnten externe Forscher Architektur und Benchmarks noch nicht unabhängig prüfen. Die Debatte berührt Chip-Exportkontrolle und mögliche Beschränkungen chinesischer Open-Weight-Modelle (vgl. Supermicro-Chipschmuggel Mai 2026).

08

Gemeinsamer Nenner: Preis-Leistung als Schlachtfeld

Opus 5 antwortet mit „halber Preis, fast Flaggschiff“. K3 mit „Open Weight + günstig + weniger Limits“. Die Destillationsdebatte ist die offene Frage: Ist der niedrige Preis echte Optimierung — oder ausgeliehene Intelligenz?

Pragmatische Empfehlung: Compliance und Datenspeicherung → Opus 5; extrem niedrige Kosten und Open Weights → K3 erst nach 27.7. und unabhängigen Tests bewerten.

  1. 01

    Compliance: Opus 5 + keine erzwungene Speicherung + offizielle Anthropic-API

  2. 02

    Kostenminimum: K3-Gewichte abwarten + Benchmark-Replikation

  3. 03

    Agent-Abnahme: Cursor / Claude Code / Kimi Code gegen CursorBench-ähnliche Tasks

  4. 04

    GUI-Session: OAuth und Gateway-Vergleich auf VNC-Remote-Mac

  5. 05

    27.7. Update: Nach Weight-Drop Long-Tail-Keywords „K3 Download“ / „Destillation bewiesen?“

FAQ

Häufige Fragen

Etwa die Hälfte: 5 $/25 $ vs. ca. 10 $/50 $ pro Million Input/Output. CursorBench max liegt weniger als 1 % unter Fable-5-Peak.

Ja — seit dem 24. Juli 2026 Standard in Claude Max und stärkste Pro-Version.

Unbewiesen. Weißes Haus ohne öffentliche Belege; Timeline-Kritik; Greenblatts „Claude-Identität + interne IDs“ ist das stärkste technische Indiz.

Offiziell 27. Juli 2026. Zum Redaktionsschluss noch nicht veröffentlicht.

Open Weights (Gewichte downloadbar), nicht vollständig Open Source. Lizenz voraussichtlich Modified MIT — LICENSE am 27.7. prüfen.

Fazit

Opus 5 bringt Flaggschiff-Agent-Fähigkeit in eine alltagstaugliche Token-Rechnung; K3 drückt die Frontier in die Open-Weight-Debatte — aber Destillationsvorwürfe und Greenblatts Statistik erinnern: Benchmarks allein reichen nicht; Compliance, Datenspeicherung und Modellherkunft zählen mit.

Wer Cursor, Claude Code oder Kimi Code sofort gegen Opus 5 und K3 testen will, scheitert auf Windows/Linux oft an OAuth, macOS-Rechten und Gateway-GUI. VNCMac Remote Mac + VNC liefert die Graphik-Session auf demselben Host wie Gateway — Multi-Modell-Abnahme statt Schlagzeilen-Lesen.