GA 3. Aug. · 2,4T / 95B aktiv · Arena Text #5 (Preliminary) · Gewichte nächste Woche · vendor-run Benchmarks
Kurzantwort: noch nicht. Am 3. August 2026 hat Alibaba Qwen3.8-Max per Cloud-API allgemein verfügbar gemacht (GA) und auf qwen.ai als „Open-Source“ markiert. Zum Redaktionsschluss gibt es kein Hugging-Face- oder ModelScope-Repository, keine Lizenzbedingungen und kein festes Datum — nur das Versprechen, dass Gewichte für Qwen3.8-Max und Qwen3.8-27B „nächste Woche“ folgen. Dieser Artikel ordnet Timeline, veröffentlichte Specs, Kimi-K3-/DeepSeek-V4-Vergleich, Open-Source-Label-Streit, fünf Adoptionsschritte und FAQ ein — plus, wie Sie Agent-Workflows auf einem Remote-Mac mit echter macOS-GUI validieren.
Open-Source-Label vor Gewichten: qwen.ai markiert das Modell als offen, aber Repo und Lizenz fehlen noch auf Hugging Face
Alle Benchmarks sind vendor-run: PaperBench, QwenSWEBench, RecreationBench nutzen Alibabas eigenes Framework; Arena führt mit „Preliminary“
Aktive Parameter erst bei GA: Die Juli-Preview nannte weder 95B aktiv noch eine Benchmark-Tabelle; ToS untersagte automatisierte Produktionsaufrufe
Vollständiges Self-Hosting unrealistisch: 2,4T Checkpoint ist selbst mit MoE-Sparsity ein Multi-Node-Rechenzentrum-Artifact
Agent-Validierung braucht GUI: OpenClaw, Claude Code und Qoder CLI stoßen auf macOS-Berechtigungsdialoge, die reines SSH nicht bedient
| Datum | Ereignis |
|---|---|
| 16. Juli | Moonshot AI veröffentlicht Kimi K3 (2,8T MoE) mit unabhängigen Benchmarks und Technikbericht |
| 19. Juli | Qwen3.8-Max Preview zu 10 % des Endpreises; keine aktiven Parameter, keine Benchmark-Tabelle, ToS verbietet automatisierte Produktion |
| 27. Juli | Kimi K3 Open Weights planmäßig auf Hugging Face |
| 31. Juli | DeepSeek V4-Flash schlägt V4-Pro auf neun agentischen/Coding-Benchmarks ohne zusätzliche Parameter |
| 3. Aug. | Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle; Agent-Produkt „Qianwen Office“ startet; Alibaba-Aktien +7 % HK / +4,5 % US |
| ~10. Aug. (erwartet) | Open Weights für Qwen3.8-Max und Qwen3.8-27B angekündigt; zum Redaktionsschluss nicht live |
| Spezifikation | Qwen3.8-Max |
|---|---|
| GA-Datum | 3. August 2026 |
| Gesamt- / aktive Parameter | 2,4 Billionen / 95 Milliarden |
| Architektur | Sparse MoE + Hybrid-Attention auf Qwen3.5-Basis |
| Kontextfenster | 1 Mio. Token (≈983K mit Thinking; max. 131K Output) |
| Modalitäten | Text, Bild, Video |
| API-Preise | 2 $ / 6 $ pro Million Input/Output-Token |
| Arena Text (1. Aug.) | #5, 1.496 Pkt. (Preliminary) — einziges Nicht-Anthropic-Modell in Top 8 |
| Arena Vision | #2, hinter Claude Fable 5 |
| PaperBench (Alibaba-run) | 93,0 (+28,2 vs. Vorgänger) |
| SWE-bench Pro (Alibaba-run) | 67,7 — hinter Fable 5s 80,0 |
| Open Weights | Nächste Woche versprochen; noch nicht live |
Merksatz: 2,4T/95B · 2 $/6 $ pro M · Arena Text #5 (Preliminary) · OpenAI- und Anthropic-kompatible API.
Sparse MoE treibt die Gesamtparameter auf 2,4 Billionen, aktiviert aber nur 95 Milliarden pro Token. Inferenzkosten folgen der aktiven Zahl — deshalb unterbietet die API Claude Opus 5 (5 $/25 $) und Fable 5 (10 $/50 $).
reasoning_effort (low / medium / xhigh) ist über enable_thinking oder Anthropic-kompatibles reasoning.effort steuerbar — Standard-Kostendrehknopf für Agent-Modelle.
Langfrist-Autonomie ist das Marketing-Highlight: 16-tägiges unbeaufsichtigtes Coding-Projekt, 500+-Schritt-Chip-Design-Aufgabe und RecreationBench (App-Nachbau nur aus Black-Box-Interaktion). Teilspuren existieren auf GitHub (qwen-code-dev-bot/oh-my-cli), Benchmarks sind jedoch in-house.
Distribution: Anbindung an „Qianwen Office“ und Drop-in für Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw per Base-URL-Tausch.
| Modell | Gesamt / aktiv | Kontext | Preis (in/out pro M) | Open Weights? | Unabhängiger Bench |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 1M | 2 $ / 6 $ | Versprochen | Noch keine |
| Kimi K3 | 2,8T / ~50B | ~1,05M | 3 $ / 15 $ | 27. Juli geliefert | AA Index ≈57,11 |
| DeepSeek V4-Pro | 1,6T / 49B | 1M | Nicht voll publiziert | Geliefert | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | Wie V4-Pro | 1M | Nicht voll publiziert | Geliefert | Schlägt V4-Pro auf 9 Benches |
| Claude Fable 5 | Nicht offengelegt | 1M | 10 $ / 50 $ | Geschlossen | Arena Text #1 |
Der einzige vergleichbare unabhängige Blindtest (269-Dateien-Architekturaufgabe): Kimi K3 83/100, Qwen3.8-Max Preview 80/100 — gleiches Niveau, kein klarer Sieger. K3 hat öffentliche Gewichte und Drittanbieter-Daten; Qwen bietet günstigere API und breiteres natives Multimodal. Details: Kimi K3 Open Weight erklärt.
Open-Source-Tag auf qwen.ai vs. fehlendes Hugging-Face-/ModelScope-Repo, Lizenz und festes Datum
Alle veröffentlichten Benchmarks stammen aus Alibabas eigenem Framework; keine unabhängige GA-Reproduktion durch Artificial Analysis oder Arena
Fußnote in Vergleichstabellen erwähnt „Fallback-Möglichkeit“ bei Fable-5-Ergebnissen, ohne gleichwertige Methodenoffenlegung für eigene Tests
Preview-ToS untersagte automatisierte Produktionsaufrufe; kein Model Card, keine Sicherheitsbewertung — mehrere Labs rieten von sofortiger Produktionsmigration ab
Hinweis: Das bedeutet nicht, dass das Modell schwach ist — der eine unabhängige Blindtest deutet auf Frontier-Niveau hin. Launch-Day-Leaderboard-Zahlen jedoch als Herstellerangaben behandeln, bis Gewichte landen und Dritte nachziehen.
API über QwenCloud / Alibaba Cloud Model Studio aktivieren; OpenAI- und Anthropic-kompatible Endpoints sowie reasoning.effort-Stufen testen
Workload gegen SWE-bench Pro und Arena-Vorläufrang abgleichen — Stärken (Langzeit-Agenten, Multimodal) vs. Schwächen (HLE 43,6)
In OpenClaw / Qoder Base-URL und API-Key umstellen; Probe-Tasks gegen Kimi K3 / DeepSeek für Latenz und Kosten
Qwen3.8-27B auf Hugging Face verfolgen — für On-Prem ist 27B realistischer als 2,4T Vollversion
OAuth, Browser-DevTools und macOS-Berechtigungen in einer echten GUI-macOS-Session abschließen (VNCMac unten)
{
"model": "qwen3.8-max",
"reasoning": { "effort": "xhigh" },
"enable_thinking": true,
"max_tokens": 8192
}
Nein. Die API ist live, Gewichte fehlen auf Hugging Face und ModelScope. Das Open-Source-Label beschreibt derzeit Absicht, kein ausgeliefertes Artefakt. Gewichte für Qwen3.8-Max und Qwen3.8-27B werden für ~10. August erwartet.
Kein autoritativer Head-to-Head. Unabhängiger Blindtest: K3 83/100, Qwen Preview 80/100 — gleiches Niveau. K3 hat Gewichte und Drittanbieter-Benchmarks; Qwen günstigere API und breiteres Multimodal.
Für den vollen Checkpoint ja. Die API umgeht das. Qwen3.8-27B ist das realistische On-Prem-Ziel, sobald Gewichte landen.
Als Herstellerangaben behandeln. Auf Drittanbieter-Reproduktion oder eigenen A/B-Test warten. Arena führt mit Preliminary.
Qwen treibt generative Apple-Intelligence-Features in China on-device — eingebettete Infrastruktur unabhängig von direkter API-Nutzung.
Qwen3.8-Max bringt Arena Text auf #5, aggressive API-Preise und OpenClaw-kompatible Endpoints — aber Gewichte fehlen und Benchmarks sind nicht unabhängig verifiziert. Wenn Ihr Hauptrechner Windows oder Linux ist und Sie eine echte macOS-GUI für Qianwen Office, OpenClaw-Routing oder parallele iOS-Builds brauchen: Hardware kaufen ist teuer, SSH allein klickt keine OAuth- oder Berechtigungsdialoge.
Mieten Sie einen VNCMac Remote-Mac stundenweise, validieren Sie Qwen3.8-Max-Agent-Workflows per VNC in isolierten Nodes. Siehe Mac-Mietpläne, Kimi K3 Open Weight und OpenClaw VNC-Grafik-Deployment.
Quellen: Alibaba Cloud, Arena.ai, TechNode, Apple Intelligence China-Berichterstattung. Preise und Open-Weight-Status vor Produktionsmigration offiziell prüfen.