LLM 4. August 2026 ~18 Min. Qwen3.8-Max Alibaba

Ist Qwen3.8-Max Open Source?
Was Alibaba am 3. August wirklich lieferte

GA 3. Aug. · 2,4T / 95B aktiv · Arena Text #5 (Preliminary) · Gewichte nächste Woche · vendor-run Benchmarks

Alibaba Qwen3.8-Max Flaggschiff-Modell GA und Arena-Ranking Konzept

Kurzantwort: noch nicht. Am 3. August 2026 hat Alibaba Qwen3.8-Max per Cloud-API allgemein verfügbar gemacht (GA) und auf qwen.ai als „Open-Source“ markiert. Zum Redaktionsschluss gibt es kein Hugging-Face- oder ModelScope-Repository, keine Lizenzbedingungen und kein festes Datum — nur das Versprechen, dass Gewichte für Qwen3.8-Max und Qwen3.8-27B „nächste Woche“ folgen. Dieser Artikel ordnet Timeline, veröffentlichte Specs, Kimi-K3-/DeepSeek-V4-Vergleich, Open-Source-Label-Streit, fünf Adoptionsschritte und FAQ ein — plus, wie Sie Agent-Workflows auf einem Remote-Mac mit echter macOS-GUI validieren.

01

Stolpersteine vor der Produktionsmigration

  1. 01

    Open-Source-Label vor Gewichten: qwen.ai markiert das Modell als offen, aber Repo und Lizenz fehlen noch auf Hugging Face

  2. 02

    Alle Benchmarks sind vendor-run: PaperBench, QwenSWEBench, RecreationBench nutzen Alibabas eigenes Framework; Arena führt mit „Preliminary“

  3. 03

    Aktive Parameter erst bei GA: Die Juli-Preview nannte weder 95B aktiv noch eine Benchmark-Tabelle; ToS untersagte automatisierte Produktionsaufrufe

  4. 04

    Vollständiges Self-Hosting unrealistisch: 2,4T Checkpoint ist selbst mit MoE-Sparsity ein Multi-Node-Rechenzentrum-Artifact

  5. 05

    Agent-Validierung braucht GUI: OpenClaw, Claude Code und Qoder CLI stoßen auf macOS-Berechtigungsdialoge, die reines SSH nicht bedient

02

Timeline: Was kam, was fehlt

DatumEreignis
16. JuliMoonshot AI veröffentlicht Kimi K3 (2,8T MoE) mit unabhängigen Benchmarks und Technikbericht
19. JuliQwen3.8-Max Preview zu 10 % des Endpreises; keine aktiven Parameter, keine Benchmark-Tabelle, ToS verbietet automatisierte Produktion
27. JuliKimi K3 Open Weights planmäßig auf Hugging Face
31. JuliDeepSeek V4-Flash schlägt V4-Pro auf neun agentischen/Coding-Benchmarks ohne zusätzliche Parameter
3. Aug.Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle; Agent-Produkt „Qianwen Office“ startet; Alibaba-Aktien +7 % HK / +4,5 % US
~10. Aug. (erwartet)Open Weights für Qwen3.8-Max und Qwen3.8-27B angekündigt; zum Redaktionsschluss nicht live
03

Veröffentlichte Specs

SpezifikationQwen3.8-Max
GA-Datum3. August 2026
Gesamt- / aktive Parameter2,4 Billionen / 95 Milliarden
ArchitekturSparse MoE + Hybrid-Attention auf Qwen3.5-Basis
Kontextfenster1 Mio. Token (≈983K mit Thinking; max. 131K Output)
ModalitätenText, Bild, Video
API-Preise2 $ / 6 $ pro Million Input/Output-Token
Arena Text (1. Aug.)#5, 1.496 Pkt. (Preliminary) — einziges Nicht-Anthropic-Modell in Top 8
Arena Vision#2, hinter Claude Fable 5
PaperBench (Alibaba-run)93,0 (+28,2 vs. Vorgänger)
SWE-bench Pro (Alibaba-run)67,7 — hinter Fable 5s 80,0
Open WeightsNächste Woche versprochen; noch nicht live

Merksatz: 2,4T/95B · 2 $/6 $ pro M · Arena Text #5 (Preliminary) · OpenAI- und Anthropic-kompatible API.

04

Architektur: große Gesamtzahl, kleine Aktivierung

Sparse MoE treibt die Gesamtparameter auf 2,4 Billionen, aktiviert aber nur 95 Milliarden pro Token. Inferenzkosten folgen der aktiven Zahl — deshalb unterbietet die API Claude Opus 5 (5 $/25 $) und Fable 5 (10 $/50 $).

reasoning_effort (low / medium / xhigh) ist über enable_thinking oder Anthropic-kompatibles reasoning.effort steuerbar — Standard-Kostendrehknopf für Agent-Modelle.

Langfrist-Autonomie ist das Marketing-Highlight: 16-tägiges unbeaufsichtigtes Coding-Projekt, 500+-Schritt-Chip-Design-Aufgabe und RecreationBench (App-Nachbau nur aus Black-Box-Interaktion). Teilspuren existieren auf GitHub (qwen-code-dev-bot/oh-my-cli), Benchmarks sind jedoch in-house.

Distribution: Anbindung an „Qianwen Office“ und Drop-in für Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw per Base-URL-Tausch.

05

Entscheidungsmatrix: Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4

ModellGesamt / aktivKontextPreis (in/out pro M)Open Weights?Unabhängiger Bench
Qwen3.8-Max2,4T / 95B1M2 $ / 6 $VersprochenNoch keine
Kimi K32,8T / ~50B~1,05M3 $ / 15 $27. Juli geliefertAA Index ≈57,11
DeepSeek V4-Pro1,6T / 49B1MNicht voll publiziertGeliefertSWE-bench Verified 80,6 %
DeepSeek V4-FlashWie V4-Pro1MNicht voll publiziertGeliefertSchlägt V4-Pro auf 9 Benches
Claude Fable 5Nicht offengelegt1M10 $ / 50 $GeschlossenArena Text #1

Der einzige vergleichbare unabhängige Blindtest (269-Dateien-Architekturaufgabe): Kimi K3 83/100, Qwen3.8-Max Preview 80/100gleiches Niveau, kein klarer Sieger. K3 hat öffentliche Gewichte und Drittanbieter-Daten; Qwen bietet günstigere API und breiteres natives Multimodal. Details: Kimi K3 Open Weight erklärt.

06

Streitpunkt: Open-Source-Label vor den Gewichten

  1. 01

    Open-Source-Tag auf qwen.ai vs. fehlendes Hugging-Face-/ModelScope-Repo, Lizenz und festes Datum

  2. 02

    Alle veröffentlichten Benchmarks stammen aus Alibabas eigenem Framework; keine unabhängige GA-Reproduktion durch Artificial Analysis oder Arena

  3. 03

    Fußnote in Vergleichstabellen erwähnt „Fallback-Möglichkeit“ bei Fable-5-Ergebnissen, ohne gleichwertige Methodenoffenlegung für eigene Tests

  4. 04

    Preview-ToS untersagte automatisierte Produktionsaufrufe; kein Model Card, keine Sicherheitsbewertung — mehrere Labs rieten von sofortiger Produktionsmigration ab

Hinweis: Das bedeutet nicht, dass das Modell schwach ist — der eine unabhängige Blindtest deutet auf Frontier-Niveau hin. Launch-Day-Leaderboard-Zahlen jedoch als Herstellerangaben behandeln, bis Gewichte landen und Dritte nachziehen.

07

Fünf-Schritte-Adoption: API bis OpenClaw

  1. 01

    API über QwenCloud / Alibaba Cloud Model Studio aktivieren; OpenAI- und Anthropic-kompatible Endpoints sowie reasoning.effort-Stufen testen

  2. 02

    Workload gegen SWE-bench Pro und Arena-Vorläufrang abgleichen — Stärken (Langzeit-Agenten, Multimodal) vs. Schwächen (HLE 43,6)

  3. 03

    In OpenClaw / Qoder Base-URL und API-Key umstellen; Probe-Tasks gegen Kimi K3 / DeepSeek für Latenz und Kosten

  4. 04

    Qwen3.8-27B auf Hugging Face verfolgen — für On-Prem ist 27B realistischer als 2,4T Vollversion

  5. 05

    OAuth, Browser-DevTools und macOS-Berechtigungen in einer echten GUI-macOS-Session abschließen (VNCMac unten)

json
{
  "model": "qwen3.8-max",
  "reasoning": { "effort": "xhigh" },
  "enable_thinking": true,
  "max_tokens": 8192
}
08

Branchenkontext

  • Skalierung um jeden Preis? DeepSeek V4-Flash verbesserte agentische Scores ohne zusätzliche Parameter
  • Alibabas seltene Openness-Wende: erstes Max-Klassen-Open-Weight-Versprechen neben Kimi K3 und DeepSeek
  • Consumer-Winkel: komprimiertes Qwen on-device für Apple Intelligence in China (iPhone 15+)
  • Regulatorischer Kontrast: Weißes Haus tagte am 4. Aug. mit Labs zu Agent-Sicherheit, während chinesische Anbieter Frontier-Gewichte öffnen
09

FAQ

Nein. Die API ist live, Gewichte fehlen auf Hugging Face und ModelScope. Das Open-Source-Label beschreibt derzeit Absicht, kein ausgeliefertes Artefakt. Gewichte für Qwen3.8-Max und Qwen3.8-27B werden für ~10. August erwartet.

Kein autoritativer Head-to-Head. Unabhängiger Blindtest: K3 83/100, Qwen Preview 80/100 — gleiches Niveau. K3 hat Gewichte und Drittanbieter-Benchmarks; Qwen günstigere API und breiteres Multimodal.

Für den vollen Checkpoint ja. Die API umgeht das. Qwen3.8-27B ist das realistische On-Prem-Ziel, sobald Gewichte landen.

Als Herstellerangaben behandeln. Auf Drittanbieter-Reproduktion oder eigenen A/B-Test warten. Arena führt mit Preliminary.

Qwen treibt generative Apple-Intelligence-Features in China on-device — eingebettete Infrastruktur unabhängig von direkter API-Nutzung.

Abschluss

Qwen3.8-Max bringt Arena Text auf #5, aggressive API-Preise und OpenClaw-kompatible Endpoints — aber Gewichte fehlen und Benchmarks sind nicht unabhängig verifiziert. Wenn Ihr Hauptrechner Windows oder Linux ist und Sie eine echte macOS-GUI für Qianwen Office, OpenClaw-Routing oder parallele iOS-Builds brauchen: Hardware kaufen ist teuer, SSH allein klickt keine OAuth- oder Berechtigungsdialoge.

Mieten Sie einen VNCMac Remote-Mac stundenweise, validieren Sie Qwen3.8-Max-Agent-Workflows per VNC in isolierten Nodes. Siehe Mac-Mietpläne, Kimi K3 Open Weight und OpenClaw VNC-Grafik-Deployment.

Quellen: Alibaba Cloud, Arena.ai, TechNode, Apple Intelligence China-Berichterstattung. Preise und Open-Weight-Status vor Produktionsmigration offiziell prüfen.