GA 3 août · 2,4T / 95B actifs · Arena Text #5 · poids promis la semaine prochaine · benchmarks éditeur
Réponse courte : pas encore. Le 3 août 2026, Alibaba a mis Qwen3.8-Max en disponibilité générale via son API cloud et l'a étiqueté « Open-Source » sur qwen.ai. À la rédaction de cet article, aucun dépôt Hugging Face ou ModelScope, aucune licence, aucune date ferme — seulement la promesse que les poids de Qwen3.8-Max et Qwen3.8-27B arriveront « la semaine prochaine ». Cet article couvre la chronologie, les specs publiées, la comparaison inter-éditeurs, la controverse du label open source, un parcours d'adoption en cinq étapes et une FAQ — plus la validation de workflows Agent sur un Mac distant quand OAuth et les dialogues de permission macOS entrent en jeu.
Le tag Open-Source est arrivé avant les poids : qwen.ai étiquette le modèle open, mais aucun dépôt ni licence n'existe encore
Tous les benchmarks sont éditeur-run : PaperBench, QwenSWEBench, RecreationBench et d'autres utilisent le harness interne d'Alibaba ; Arena le classe « Preliminary »
La divulgation des paramètres actifs a pris du retard : la preview de juillet ne disait rien ; la GA révèle enfin 95B actifs
Le déploiement local complet est irréaliste : un checkpoint 2,4T est un artefact datacenter multi-nœuds même avec la sparsité MoE
La validation Agent exige une GUI : OpenClaw, Claude Code et Qoder CLI déclenchent souvent des prompts de permission macOS que le SSH seul ne peut pas résoudre
| Date | Événement |
|---|---|
| 16 juillet | Moonshot AI publie Kimi K3 (MoE 2,8T) avec benchmarks indépendants et rapport technique |
| 19 juillet | Preview Qwen3.8-Max à 10 % du tarif final ; pas de paramètres actifs, pas de tableau de benchmarks, ToS interdit l'usage production automatisé |
| 27 juillet | Les poids open de Kimi K3 arrivent sur Hugging Face comme prévu |
| 31 juillet | DeepSeek V4-Flash bat V4-Pro sur neuf benchmarks agent/coding sans ajouter de paramètres |
| 3 août | GA Qwen3.8-Max avec tableau de benchmarks complet ; lancement du produit agent « Qwen Office » ; actions Alibaba +7 % HK / +4,5 % US |
| ~10 août (attendu) | Poids open pour Qwen3.8-Max et Qwen3.8-27B promis ; non disponibles à la publication |
| Spécification | Qwen3.8-Max |
|---|---|
| Date GA | 3 août 2026 |
| Paramètres totaux / actifs | 2,4T / 95B |
| Architecture | MoE sparse + attention hybride sur base Qwen3.5 |
| Fenêtre de contexte | 1M tokens (≈983K en mode thinking ; 131K max en sortie) |
| Modalités | Texte, image, vidéo |
| Tarif API | 2 $ / 6 $ par million tokens entrée/sortie |
| Arena Text (1 août) | #5, 1 496 pts (Preliminary) — seul non-Anthropic dans le top 8 |
| Arena Vision | #2, derrière Claude Fable 5 |
| PaperBench (Alibaba-run) | 93,0 (+28,2 vs génération précédente) |
| SWE-bench Pro (Alibaba-run) | 67,7 — derrière les 80,0 de Fable 5 |
| Poids open | Promis la semaine prochaine ; non disponibles |
À retenir : 2,4T/95B · 2 $/6 $ par M · Arena Text #5 (Preliminary) · API compatible OpenAI + Anthropic.
Le MoE sparse pousse le total à 2,4 billions de paramètres tout en n'activant que 95 milliards par token. Le coût d'inférence suit le nombre actif, d'où un tarif API inférieur à Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).
reasoning_effort (low / medium / xhigh) est exposé via enable_thinking ou le paramètre Anthropic-compatible reasoning.effort — un levier de coût standard pour les modèles agent.
L'autonomie longue durée est le message clé : un projet de code non supervisé sur 16 jours, une tâche de conception de puce en 500+ étapes, et RecreationBench (reconstruire une app à partir d'interactions boîte noire uniquement). Des traces partielles existent sur GitHub (qwen-code-dev-bot/oh-my-cli), mais les benchmarks sont internes.
Stratégie de distribution : intégration à « Qwen Office » et compatibilité directe avec Claude Code, Codex, Qoder CLI, Qwen Code et OpenClaw via un simple changement de base URL.
| Modèle | Total / actifs | Contexte | Prix (in/out par M) | Poids open ? | Bench indépendant |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 1M | 2 $ / 6 $ | Promis | Aucun pour l'instant |
| Kimi K3 | 2,8T / ~50B | ~1,05M | 3 $ / 15 $ | Livré 27 juil. | AA Index ≈57,11 |
| DeepSeek V4-Pro | 1,6T / 49B | 1M | Non entièrement publié | Livré | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | Identique V4-Pro | 1M | Non entièrement publié | Livré | Bat V4-Pro sur 9 benches |
| Claude Fable 5 | Non divulgué | 1M | 10 $ / 50 $ | Fermé | Arena Text #1 |
Le seul test indépendant comparable (tâche d'architecture sur 269 fichiers, revue aveugle) : Kimi K3 a obtenu 83/100, la preview Qwen3.8-Max 80/100 — des pairs qui s'affrontent, pas une victoire nette.
Le tag Open-Source est en ligne avant tout poids — une décision marketing tant qu'aucun dépôt n'existe
Chaque benchmark est éditeur-run ; aucune plateforme neutre n'a reproduit les chiffres GA
Une note de bas de page suggère que les scores Fable 5 « peuvent impliquer des fallbacks » sans divulgation méthodologique équivalente
La preview de juillet interdisait l'usage production automatisé et était livrée sans model card ni évaluation de sécurité
Note : Cela ne signifie pas que le modèle est faible — le seul test aveugle indépendant suggère des performances de classe frontier. Traitez les affirmations de leaderboard au lancement comme des claims éditeur jusqu'à la publication des poids et la reproduction tierce.
Activer l'API via Alibaba Cloud Model Studio ; valider les endpoints compatibles OpenAI et Anthropic et les niveaux reasoning.effort
Mapper votre charge aux scores publiés — agents longue durée vs faiblesse HLE (43,6)
Pointer OpenClaw ou Qoder vers la nouvelle base URL ; lancer des tâches sonde contre Kimi K3 / DeepSeek pour latence et coût
Surveiller Qwen3.8-27B sur Hugging Face si le déploiement on-prem est l'objectif
Finaliser OAuth, DevTools navigateur et vérifications de permission macOS dans une vraie session GUI macOS (voir VNCMac ci-dessous)
Non. L'API est en ligne, mais les poids ne sont pas sur Hugging Face ni ModelScope. Le label Open-Source décrit pour l'instant une intention, pas un artefact livré.
Un test aveugle indépendant : Kimi K3 83/100 vs Qwen3.8-Max 80/100. K3 a des poids publics et des scores tiers ; Qwen offre une API moins chère et un multimodal plus large.
Pour le checkpoint complet, oui. L'API contourne ce problème. Qwen3.8-27B est la cible on-prem réaliste quand les poids arriveront.
Traitez-les comme des affirmations éditeur. Attendez des reproductions tierces ou un A/B test sur votre propre charge. Arena classe l'entrée Preliminary.
Qwen alimente les fonctionnalités génératives d'Apple Intelligence en Chine sur les iPhone récents — une infrastructure embarquée indépendante de l'usage direct de l'API.
Qwen3.8-Max atterrit à Arena Text #5 avec un tarif API agressif et des endpoints compatibles OpenClaw — mais les poids ne sont pas en ligne et les benchmarks ne sont pas vérifiés indépendamment. Si votre machine principale est Windows ou Linux et que vous avez besoin d'une vraie GUI macOS pour Qwen Office, le routage OpenClaw ou des builds iOS parallèles, acheter du matériel coûte cher et le SSH seul ne peut pas cliquer OAuth ou les dialogues de permission.
Louer un Mac distant VNCMac vous donne un bureau VNC à l'heure pour valider les workflows Agent Qwen3.8-Max en isolation. Voir les forfaits Mac mini M4 et notre décryptage Kimi K3 open weight pour le contexte.
Sources : annonces Alibaba Cloud, Arena.ai, TechNode, couverture Apple Intelligence Chine. Vérifiez tarifs et statut open-weight avant migration production.