LLM 4 août 2026 ~18 min Qwen3.8-Max Open Source

Qwen3.8-Max est-il open source ?
Ce qu'Alibaba a réellement livré

GA 3 août · 2,4T / 95B actifs · Arena Text #5 · poids promis la semaine prochaine · benchmarks éditeur

Lancement du modèle flagship Alibaba Qwen3.8-Max

Réponse courte : pas encore. Le 3 août 2026, Alibaba a mis Qwen3.8-Max en disponibilité générale via son API cloud et l'a étiqueté « Open-Source » sur qwen.ai. À la rédaction de cet article, aucun dépôt Hugging Face ou ModelScope, aucune licence, aucune date ferme — seulement la promesse que les poids de Qwen3.8-Max et Qwen3.8-27B arriveront « la semaine prochaine ». Cet article couvre la chronologie, les specs publiées, la comparaison inter-éditeurs, la controverse du label open source, un parcours d'adoption en cinq étapes et une FAQ — plus la validation de workflows Agent sur un Mac distant quand OAuth et les dialogues de permission macOS entrent en jeu.

01

Points de friction avant de migrer la production

  1. 01

    Le tag Open-Source est arrivé avant les poids : qwen.ai étiquette le modèle open, mais aucun dépôt ni licence n'existe encore

  2. 02

    Tous les benchmarks sont éditeur-run : PaperBench, QwenSWEBench, RecreationBench et d'autres utilisent le harness interne d'Alibaba ; Arena le classe « Preliminary »

  3. 03

    La divulgation des paramètres actifs a pris du retard : la preview de juillet ne disait rien ; la GA révèle enfin 95B actifs

  4. 04

    Le déploiement local complet est irréaliste : un checkpoint 2,4T est un artefact datacenter multi-nœuds même avec la sparsité MoE

  5. 05

    La validation Agent exige une GUI : OpenClaw, Claude Code et Qoder CLI déclenchent souvent des prompts de permission macOS que le SSH seul ne peut pas résoudre

02

Chronologie : ce qui a été livré, et ce qui ne l'est pas

DateÉvénement
16 juilletMoonshot AI publie Kimi K3 (MoE 2,8T) avec benchmarks indépendants et rapport technique
19 juilletPreview Qwen3.8-Max à 10 % du tarif final ; pas de paramètres actifs, pas de tableau de benchmarks, ToS interdit l'usage production automatisé
27 juilletLes poids open de Kimi K3 arrivent sur Hugging Face comme prévu
31 juilletDeepSeek V4-Flash bat V4-Pro sur neuf benchmarks agent/coding sans ajouter de paramètres
3 aoûtGA Qwen3.8-Max avec tableau de benchmarks complet ; lancement du produit agent « Qwen Office » ; actions Alibaba +7 % HK / +4,5 % US
~10 août (attendu)Poids open pour Qwen3.8-Max et Qwen3.8-27B promis ; non disponibles à la publication
03

Specs publiées

SpécificationQwen3.8-Max
Date GA3 août 2026
Paramètres totaux / actifs2,4T / 95B
ArchitectureMoE sparse + attention hybride sur base Qwen3.5
Fenêtre de contexte1M tokens (≈983K en mode thinking ; 131K max en sortie)
ModalitésTexte, image, vidéo
Tarif API2 $ / 6 $ par million tokens entrée/sortie
Arena Text (1 août)#5, 1 496 pts (Preliminary) — seul non-Anthropic dans le top 8
Arena Vision#2, derrière Claude Fable 5
PaperBench (Alibaba-run)93,0 (+28,2 vs génération précédente)
SWE-bench Pro (Alibaba-run)67,7 — derrière les 80,0 de Fable 5
Poids openPromis la semaine prochaine ; non disponibles

À retenir : 2,4T/95B · 2 $/6 $ par M · Arena Text #5 (Preliminary) · API compatible OpenAI + Anthropic.

04

Architecture : gros total, faible activation

Le MoE sparse pousse le total à 2,4 billions de paramètres tout en n'activant que 95 milliards par token. Le coût d'inférence suit le nombre actif, d'où un tarif API inférieur à Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).

reasoning_effort (low / medium / xhigh) est exposé via enable_thinking ou le paramètre Anthropic-compatible reasoning.effort — un levier de coût standard pour les modèles agent.

L'autonomie longue durée est le message clé : un projet de code non supervisé sur 16 jours, une tâche de conception de puce en 500+ étapes, et RecreationBench (reconstruire une app à partir d'interactions boîte noire uniquement). Des traces partielles existent sur GitHub (qwen-code-dev-bot/oh-my-cli), mais les benchmarks sont internes.

Stratégie de distribution : intégration à « Qwen Office » et compatibilité directe avec Claude Code, Codex, Qoder CLI, Qwen Code et OpenClaw via un simple changement de base URL.

05

Matrice de décision : Qwen3.8-Max vs pairs

ModèleTotal / actifsContextePrix (in/out par M)Poids open ?Bench indépendant
Qwen3.8-Max2,4T / 95B1M2 $ / 6 $PromisAucun pour l'instant
Kimi K32,8T / ~50B~1,05M3 $ / 15 $Livré 27 juil.AA Index ≈57,11
DeepSeek V4-Pro1,6T / 49B1MNon entièrement publiéLivréSWE-bench Verified 80,6 %
DeepSeek V4-FlashIdentique V4-Pro1MNon entièrement publiéLivréBat V4-Pro sur 9 benches
Claude Fable 5Non divulgué1M10 $ / 50 $FerméArena Text #1

Le seul test indépendant comparable (tâche d'architecture sur 269 fichiers, revue aveugle) : Kimi K3 a obtenu 83/100, la preview Qwen3.8-Max 80/100 — des pairs qui s'affrontent, pas une victoire nette.

06

Le problème du label open source

  1. 01

    Le tag Open-Source est en ligne avant tout poids — une décision marketing tant qu'aucun dépôt n'existe

  2. 02

    Chaque benchmark est éditeur-run ; aucune plateforme neutre n'a reproduit les chiffres GA

  3. 03

    Une note de bas de page suggère que les scores Fable 5 « peuvent impliquer des fallbacks » sans divulgation méthodologique équivalente

  4. 04

    La preview de juillet interdisait l'usage production automatisé et était livrée sans model card ni évaluation de sécurité

Note : Cela ne signifie pas que le modèle est faible — le seul test aveugle indépendant suggère des performances de classe frontier. Traitez les affirmations de leaderboard au lancement comme des claims éditeur jusqu'à la publication des poids et la reproduction tierce.

07

Parcours d'adoption en cinq étapes

  1. 01

    Activer l'API via Alibaba Cloud Model Studio ; valider les endpoints compatibles OpenAI et Anthropic et les niveaux reasoning.effort

  2. 02

    Mapper votre charge aux scores publiés — agents longue durée vs faiblesse HLE (43,6)

  3. 03

    Pointer OpenClaw ou Qoder vers la nouvelle base URL ; lancer des tâches sonde contre Kimi K3 / DeepSeek pour latence et coût

  4. 04

    Surveiller Qwen3.8-27B sur Hugging Face si le déploiement on-prem est l'objectif

  5. 05

    Finaliser OAuth, DevTools navigateur et vérifications de permission macOS dans une vraie session GUI macOS (voir VNCMac ci-dessous)

08

Contexte élargi

  • La course aux paramètres pourrait ralentir : DeepSeek V4-Flash améliore les scores agentiques sans ajouter de paramètres
  • Alibaba revient sur l'ouverture : premier engagement open-weight de classe Max aux côtés de Kimi K3 et DeepSeek
  • Angle consommateur : Qwen compressé tourne on-device pour Apple Intelligence en Chine (iPhone 15+)
  • Contraste réglementaire : la Maison-Blanche a convoqué les labs le 4 août après des incidents de sécurité agent tandis que les labs chinois courent vers l'ouverture des poids frontier
09

FAQ

Non. L'API est en ligne, mais les poids ne sont pas sur Hugging Face ni ModelScope. Le label Open-Source décrit pour l'instant une intention, pas un artefact livré.

Un test aveugle indépendant : Kimi K3 83/100 vs Qwen3.8-Max 80/100. K3 a des poids publics et des scores tiers ; Qwen offre une API moins chère et un multimodal plus large.

Pour le checkpoint complet, oui. L'API contourne ce problème. Qwen3.8-27B est la cible on-prem réaliste quand les poids arriveront.

Traitez-les comme des affirmations éditeur. Attendez des reproductions tierces ou un A/B test sur votre propre charge. Arena classe l'entrée Preliminary.

Qwen alimente les fonctionnalités génératives d'Apple Intelligence en Chine sur les iPhone récents — une infrastructure embarquée indépendante de l'usage direct de l'API.

Conclusion

Qwen3.8-Max atterrit à Arena Text #5 avec un tarif API agressif et des endpoints compatibles OpenClaw — mais les poids ne sont pas en ligne et les benchmarks ne sont pas vérifiés indépendamment. Si votre machine principale est Windows ou Linux et que vous avez besoin d'une vraie GUI macOS pour Qwen Office, le routage OpenClaw ou des builds iOS parallèles, acheter du matériel coûte cher et le SSH seul ne peut pas cliquer OAuth ou les dialogues de permission.

Louer un Mac distant VNCMac vous donne un bureau VNC à l'heure pour valider les workflows Agent Qwen3.8-Max en isolation. Voir les forfaits Mac mini M4 et notre décryptage Kimi K3 open weight pour le contexte.

Sources : annonces Alibaba Cloud, Arena.ai, TechNode, couverture Apple Intelligence Chine. Vérifiez tarifs et statut open-weight avant migration production.