Echtes Token-Volumen · 46 % China-Anteil · Nutzung ≠ Qualität · Apps-Ebene · August-Ausblick
Wer sein LLM noch nach einem Benchmark von vor zwei Monaten wählt, liegt bereits zurück.Fazit: OpenRouter bewertet Labs nicht – es routet echten, bezahlten Traffic. Stand 25. Juli 2026 führt Xiaomis Mimo V2.5 mit ~1,4 Billionen Tokens/Tag, chinesische Labs halten ~46 %, und Nutzungsrang ist kein Qualitätssignal – der Markt spaltet sich in günstiges Open-Weight-Volumen und geschlossene Frontier-Preismacht bei schweren Aufgaben.Dieser Leitfaden: Top-12-Modelle, Anbieteranteile, Apps-Ranking (Hermes / Kilo Code / OpenClaw), August-Ausblick, rollenbasiertes Routing und eine fünfstufige Mac-Akzeptanz-Checkliste. Siehe auch Juni-Rankings und OpenRouter-API-Leitfaden.
Stand 25. Juli sind die Top drei nach täglichem Token-Volumen Mimo V2.5 (1,4T/Tag), DeepSeek V4 Flash (943,9B/Tag) und Tencent Hy3 (590B/Tag). Sieben der Top-10-Modelle sind chinesisch; NVIDIA Nemotron 3 Ultra, Claude und Gemini halten die US-Seite.
| Rang | Modell | Lab | Tokens/Tag | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1,4T | 31,2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943,9B | 23,6T |
| 3 | Hy3 | Tencent | 590B | 23,4T |
| 4 | Nemotron 3 Ultra 550B (kostenlos) | NVIDIA | 428,6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413,7B | 11,6T |
| 6 | GLM 5.2 | Z.ai | 316,7B | 13,3T |
| 7 | MiniMax M3 | MiniMax | 262,5B | 15,1T |
| 8 | Step 3.7 Flash | StepFun | 204,8B | 5,9T |
| 9 | Kimi K3 | Moonshot | 157,6B | 1,6T (neu) |
| 10 | Ling 3.0 Flash | InclusionAI | 128,3B | 417,3B |
| 11 | Gemini 3 Flash Preview | 106,3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99,5B | 3,6T |
Auf Anbieterebene machen chinesische Labs ~46 % des identifizierten Token-Volumens aus – vor einem Jahr unter 2 %. US-Labs (OpenAI, Anthropic, Google) sanken von ~70 % Mitte 2025 auf 30–36 %. Das ist Preisarithmetik: DeepSeek V4 Flash kostet ~$0,05–$0,14/M Input vs. GPT-5.5 bei ~$5/M – rund 35× Unterschied.
Zitierbar: DeepSeek bleibt stabilstes #1-Lab (~16–18 %), aber die „Modell des Monats“-Krone rotiert – MiniMax M2.5 im Februar, MiMo-V2-Pro im April, Mimo V2.5 im Juli.
Ein günstiges, schnelles Modell in einer hochfrequentierten Consumer-App kann ein fähigeres Modell überholen, das für die schwersten 10 % reserviert ist.
Volumen mit Fähigkeit verwechseln: Roleplay, Chat und leichtes Coding dominieren Open-Model-Traffic – nicht Enterprise-Reasoning.
Ausgabenmix ignorieren: Nach Kategorie: Chat 35,7 %, agentische Workflows 30,4 %, Code 26,5 % – bei Klassifikation Claude Sonnet 4.6 und Opus 4.7 je ~13,5 %.
Tägliche Volatilität: Claude Opus 4.8 war am 24.7. in den Top 10; Ling 3.0 Flash drängte es bis 25.7. aus den Top 12. Stichtag immer nennen.
Steigende Sicherheitsgewichtung: OpenAIs Sandbox-Escape-Offenlegung diese Woche bringt „Vendor-Safety-Track-Record“ in Enterprise-Scorecards.
Single-Model-Lock-in: Claude Opus 5 (24.7.) führt FrontierBench v0.1 mit 43,3 % bei Opus-Preisen $5/$25 – Frontier-Labs behalten Preismacht bei schweren Tasks.
| Segment | Typische Workloads | Volumen-Chart | Schwer-Task-Ausgaben |
|---|---|---|---|
| Hochvolumen, tolerant | Chat, Kreativ, Roleplay, Routine-Coding | Chinesische Open-Flash-Modelle | Geringer Anteil |
| Niedrigtoleranz, hoher Wert | Komplexes Reasoning, Agent-Planung, Klassifikation | Selten Top 10 | Claude / GPT Frontier |
Modell-Rankings zeigen, welches Gehirn beliebt ist. Das Apps-Leaderboard zeigt, wofür es genutzt wird:
| Rang | App | Typ | Anteil (~) |
|---|---|---|---|
| 1 | Hermes Agent | Persönlicher / CLI-Agent | ~45 % |
| 2 | Kilo Code | Coding-Agent | ~13 % |
| 3 | OpenClaw | Allgemeiner Agent | ~9 % |
| 4 | Claude Code | Coding-Agent | ~6 % |
| 5 | Descript | Content | ~4,5 % |
| 6–10 | pi, Lemonade, ISEKAI ZERO, Janitor AI, Cline | Agent / Companion / Roleplay | je ~1,7 %–3,3 % |
Cline → Roo Code → Kilo Code sind drei Forks derselben Linie; der jüngste Fork Kilo Code hat beide Vorgänger überholt – First-Mover-Vorteil in Open-Source-Dev-Tools hält nicht lange.
OpenRouter × a16z State of AI: kreatives Roleplay macht über die Hälfte der Open-Model-Nutzung aus. Wer nur Enterprise-Schlagzeilen liest, verpasst die halbe Marktseite.
Chinesischer Open-Weight-Anteil steigt Richtung 50 %+ – sofern kein US-Anbieter massiv senkt.
Monatliches #1 rotiert weiter zwischen Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot.
Anthropic könnte günstigeres Volumen-Tier liefern – Opus 5 ist ihr vierter Flagship in unter zwei Monaten.
Kimi K3s 1,4TB-Gewichte sollten in 2–4 Wochen Community-Quantisierung sehen.
Sicherheit und Governance werden Auswahlkriterien – US-„AI Kill Switch“-Gesetz und White-House-Vorab-Review vor August erwartet.
| Modell | Input/M | Output/M | Positionierung |
|---|---|---|---|
| DeepSeek V4 Flash | ~$0,05–0,14 | ~$0,24–0,28 | Bestes Preis-Leistungs; agentisches Coding |
| MiniMax M3 | $0,10 | $1,21 | Langer Kontext günstig |
| GLM 5.2 | $0,45 | $3,31 | Open-Weight Opus-Planung |
| Kimi K3 | ~$3 | ~$15 | 1,4TB Open Weights |
| Claude Opus 5 | $5 (fast $10) | $25 (fast $50) | Geschlossene Frontier; schwere Tasks |
| Rolle | Empfohlener Ansatz |
|---|---|
| Indie / kleines Team | OpenRouter als Sandbox; Coding mit DeepSeek V4 Flash und GLM 5.2 starten, Opus 5 / GPT-5.6 nur bei echten Fehlern |
| Infra-Lead | Nicht nur nach Nutzungsrang wählen; Routen nach Task-Risiko staffeln, Vendor-Safety in Scorecards |
| Agent- / DevTool-Builder | Kilo-Code-Fork-Geschichte studieren; Companion-/Entertainment-Volumen ist real, auch ohne Enterprise-Presse |
Auf dem Mac mit Claude Code, OpenClaw oder Kilo Code Barbell-Routing in dieser Reihenfolge umsetzen:
Tasks staffeln: S-Tier (schwerste 5 %) → geschlossene Frontier-Modelle; A-Tier → DeepSeek / GLM; B-Tier → Flash-Klasse.
Ein Router: OpenRouter oder OpenClaw-models-Config – kein hardcodierter Provider im App-Code.
Ausgaben-Alerts: Tages-/Wochenlimits pro Modell, damit Agents nicht versehentlich Opus loopen.
Qualitäts-Probes: 10–20 feste Regressions-Prompts vor Traffic-Verschiebung auf neues Modell.
VNC-Akzeptanz: OAuth, Gateway, Browser-MCP und Berechtigungsdialoge in grafischer Mac-Session neben dem Agent prüfen.
Ein Key, 400+ Modelle.
Lesen →61 % China-Anteil und Q3-Ausblick.
Lesen →Zwei Schlagzeilen Ende Juli.
Lesen →Nein – sortiert nach bezahltem Token-Volumen. Bei Schwer-Task-Ausgaben führen Claude Sonnet 4.6 und Opus 4.7.
Stand 25. Juli Xiaomi Mimo V2.5 mit ~1,4T Tokens/Tag, dann DeepSeek V4 Flash und Tencent Hy3.
Rund 46 % zusammen (vor einem Jahr unter 2 %). US-Labs ~30–36 %.
Nous Researchs offener selbstverbessernder Agent hält ~45 % App-Token-Anteil – hohe persönliche Automatisierung, kein Qualitätsvote.
Die Juli-Linie zum Merken: Fähigkeit und Popularität divergieren. Chinesische Open-Weight-Modelle kauften mit dem Preis die halbe Marktseite; US-geschlossene Frontier-Labs verteidigen die andere Hälfte bei schweren Tasks und Sicherheitsglaubwürdigkeit.
Wer Windows oder Linux nutzt, aber macOS für Claude Code, OpenClaw oder Kilo Code braucht: Mac-Kauf bedeutet Abschreibung und Sleep-Policy-Overhead; reines SSH verpasst OAuth und Berechtigungsdialoge. VNCMac Remote Mac mit VNC erlaubt Barbell-Routing gegen das OpenRouter-Dashboard auf derselben Maschine wie Ihr Gateway. Preise und Startseite prüfen.
Datenstand 25. Juli 2026 – vor Zitaten live prüfen unter openrouter.ai/rankings.