TL;DR L’équipe Qwen d’Alibaba a officiellement lancé Qwen3.8-Max le 3 août 2026 — un modèle Mixture-of-Experts parcimonieux totalisant 2.4 trillions de paramètres (95 milliards actifs), une fenêtre de contexte de 1 million de jetons et une prise en charge multimodale native (texte + image + vidéo).
Il s’agit du premier modèle Qwen de classe Max dont les poids doivent être ouverts (attendus la semaine suivante). Proposé à un tarif agressif de 2 $ par million de jetons en entrée et 6 $ par million de jetons en sortie, il offre de solides résultats sur les tâches agentiques à long horizon, l’ingénierie logicielle autonome (y compris un projet de codage auto-évolutif documenté de 16 jours), la reproduction de recherches et les benchmarks multimodaux. Il rivalise étroitement avec des modèles tels que Kimi K3 et se place au-dessus d’options plus légères comme DeepSeek V4 Flash en termes de capacités, tout en restant bien plus rentable que les modèles occidentaux de pointe pour les charges de travail riches en sortie. Les développeurs peuvent y accéder dès aujourd’hui via QwenCloud / Alibaba Cloud Model Studio et via des plateformes unifiées telles que CometAPI.
Points clés
- Échelle et efficacité : Architecture MoE 2.4T au total / 95B actifs bâtie sur les fondations de Qwen 3.5, offrant des performances de niveau frontière à un coût d’inférence pratique.
- Force sur le long horizon : démonstration d’un codage autonome multi-jours (265 commits, 127 PRs sur ~16 jours sans intervention humaine), reproduction et amélioration d’articles de recherche, et opérations e-commerce simulées sur un an.
- Faits saillants des benchmarks : PaperBench 93.0 (en tête), Terminal Bench 2.1 86.6, scores multimodaux et documentaires solides ; compétitif mais pas dominant sur tous les classements d’agents purement orientés code face à Claude Fable 5 ou GPT-5.6 Sol.
- Avantage prix : 2 $ / 6 $ par 1M de jetons sur l’intégralité du contexte 1M (entrée mise en cache ~0,25 $), devançant Kimi K3 sur la sortie et de nombreux modèles occidentaux.
- Disponibilité : Disponible sur QwenCloud et Alibaba Cloud Model Studio (APIs compatibles OpenAI et Anthropic) ; poids ouverts prévus ; déjà référencé sur CometAPI comme
qwen3.8-maxpour un accès unifié aux côtés de 500+ autres modèles. Poids ouverts imminents ; une variante plus petite Qwen3.8-27B est également prévue pour un déploiement local/périphérie pratique. - Avantage pratique : excelle dans la production de livrables de bout en bout plutôt que les réponses en un seul tour — idéal pour les agents de codage, les pipelines de recherche, les workflows bureautiques et les boucles agentiques prolongées.
Qu'est-ce que Qwen3.8-Max ?
Qwen3.8-Max est le dernier modèle phare et le plus performant d’Alibaba dans la série Qwen, officiellement publié le 3 août 2026 (après une préversion mi-juillet à la World AI Conference de Shanghai). Il marque un virage délibéré vers des modèles capables d’achever des tâches complexes, multi-jours, de bout en bout avec une supervision minimale et de produire des livrables prêts pour la mise en production.
Architecturalement, c’est un modèle Mixture-of-Experts (MoE) parcimonieux atteignant 2.4 trillions de paramètres au total, dont environ 95 milliards sont activés par jeton. Cette conception, fondée sur Qwen 3.5, équilibre une capacité massive avec une efficacité d’inférence. Le modèle prend en charge une fenêtre de contexte de 1 million de jetons (entrée max documentée autour de 991K jetons et sortie max autour de 131K jetons), des entrées multimodales natives (texte, images et vidéo) et une sortie texte. Il inclut des contrôles d’effort de raisonnement (xhigh / medium / low) et prend en charge à la fois les protocoles compatibles OpenAI Chat Completions et Anthropic, ce qui le rend remplaçable à l’identique dans des frameworks d’agents populaires tels que Claude Code, Codex, Qoder CLI, Qwen Code et OpenClaw.
Contrairement aux modèles de classe Max antérieurs qui sont restés fermés, Alibaba s’est engagé à publier les poids de Qwen3.8-Max (et d’une variante plus petite Qwen3.8-27B) la semaine suivant le lancement via Hugging Face et ModelScope — c’est la première fois qu’un modèle Qwen de niveau Max sera disponible ouvertement.
Le modèle est positionné pour les agents de codage, le travail professionnel réel (« cowork »), la recherche, la planification à long horizon et les boucles d’agents multimodales. Les démonstrations officielles mettent l’accent sur un comportement auto-évolutif : le modèle crée des issues, se les assigne, écrit et teste du code, itère sur les retours et améliore ses propres outils sur de longues périodes.
Sources : Blog officiel de Qwen et annonces Alibaba Cloud (août 2026) ; fiche du modèle Artificial Analysis ; avis indépendants résumant la sortie GA.
Quelles sont les nouveautés de Qwen3.8-Max ?
Par rapport à son prédécesseur Qwen3.7-Max, la génération 3.8 apporte des gains substantiels en codage agentique, fiabilité sur le long horizon, raisonnement multimodal et performances document/bureautique. Les innovations clés incluent :
Véritable autonomie sur le long terme :
Le modèle peut maintenir un apprentissage adaptatif en boucle fermée sur des centaines de tours ou plusieurs jours. Exemples documentés : un projet d’ingénierie logicielle autonome de 16 jours ayant produit un outil CLI auto-évolutif (oh-my-cli) avec 265 commits, 127 pull requests et 151 issues entièrement sans intervention humaine ; reproduction et amélioration de la méthodologie d’un article de recherche (y compris des boucles d’entraînement GPU et des gains mesurables aux benchmarks) ; et une année complète d’opérations e-commerce simulées surpassant significativement les bases.
Multimodal comme boucle de rétroaction continue :
La vision n’est pas seulement une modalité d’entrée. Le modèle utilise la compréhension visuelle pour la planification, le suivi d’exécution et l’auto-correction — permettant des tâches telles que la recréation de capture d’écran en code, la génération interactive de jeux/animations et la visualisation 2D-vers-3D.
Le modèle se classe bien sur Text Arena (cinquième rapporté) et Vision Arena (deuxième rapporté) dans les premières données post-sortie.


Focalisation sur les livrables de bout en bout :
Accent sur la production de résultats de qualité production dans des centaines de métiers plutôt que des réponses isolées.
Modes réflexion et inférence rapide
Deux modes : un mode réflexion et un mode d’inférence rapide. Le mode réflexion est destiné au raisonnement plus profond et à la planification complexe. Le mode rapide vise des réponses à plus faible latence lorsque la tâche est simple. La documentation d’Alibaba Cloud’s OpenCode indique que thinking est activé pour les routes Qwen3.8 et liste des contrôles de raisonnement pour la route de préversion, notamment xhigh, medium et low.
Cette séparation est précieuse pour la conception produit. Les équipes ne devraient pas utiliser le mode de raisonnement le plus lourd pour chaque requête. Un bot de support peut classer un ticket simple à moindre coût, résumer avec un modèle plus rapide, puis basculer vers le mode réflexion de Qwen3.8-Max uniquement lorsque l’utilisateur demande une décision de politique compliquée, une analyse de cause racine, une revue de contrat ou un plan de migration de code.
Ces capacités ont été validées via des expériences internes de longue durée et une suite complète de benchmarks couvrant agents de codage, agents généraux, raisonnement multimodal, compréhension de documents et tâches de perception/ancrage.
Benchmarking : performances de quantisation des données
Alibaba a publié une vaste suite de benchmarks internes lors de la GA. La vérification indépendante (Artificial Analysis Intelligence Index, LMArena, etc.) était encore en cours dans les jours suivant la sortie ; les premières données d’Artificial Analysis plaçaient Qwen3.8-Max à un Intelligence Index de 53 (rang ~16/186 dans l’ensemble suivi), avec une verbosité élevée et une vitesse relativement plus faible.
Scores officiels/rapportés sélectionnés (Qwen3.8-Max vs pairs sélectionnés) :
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
Qwen3.8-Max est souvent en tête ou proche du sommet sur le raisonnement multimodal, les tâches document/bureautique et certains indicateurs de codage/recherche agentiques, tout en étant derrière les modèles fermés les plus forts sur certaines suites d’agents d’ingénierie logicielle pure. Le saut générationnel sur FrontierSWE et DeepSWE est particulièrement notable. Considérez les chiffres des fournisseurs comme indicatifs ; des exécutions indépendantes et des évaluations spécifiques aux charges de travail restent essentielles.
Tarification API de Qwen3.8-Max
Tarifs officiels Alibaba Cloud Model Studio / QwenCloud pour Qwen3.8-Max (tarifs GA début août 2026) :
- Entrée : 2,00 $ par 1 million de jetons
- Sortie : 6,00 $ par 1 million de jetons (inclut les jetons de réflexion/raisonnement)
- Entrée mise en cache : environ 0,25 $ par 1 million de jetons (économies significatives pour des contextes longs répétés)
Tarification uniforme sur toute la fenêtre de contexte de 1M de jetons — un avantage notable par rapport à de nombreux concurrents qui appliquent des surtaxes long contexte. Des remises de volume et autres peuvent s’appliquer selon la région de déploiement et l’offre.
Contexte de comparaison (prix catalogue approximatifs à la même période) :
- Kimi K3 : ~3 $ / 15 $
- Modèles Claude / GPT de frontière haut de gamme : souvent 5 $+ / 15–25 $+
- Variantes DeepSeek V4 Flash : nettement plus bas (souvent sous 0,50 $ au total pour de nombreux cas d’usage)
Pour les équipes utilisant déjà plusieurs fournisseurs, des passerelles agrégées comme CometAPI offrent généralement ~20 % de réduction par rapport aux tarifs officiels, un point de terminaison compatible OpenAI unique, une facturation unifiée et un basculement/changement de modèle facilité. Cela simplifie et rend souvent moins coûteuse l’expérimentation avec Qwen3.8-Max (et la comparaison simultanée avec DeepSeek V4 Flash, les modèles Kimi ou d’autres). Consultez les pages de tarification actuelles de CometAPI et les offres de crédits gratuits pour les derniers tarifs effectifs.
Comment Qwen3.8-Max se compare à Kimi K3 et DeepSeek V4 Flash
| Dimension | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Paramètres totaux / actifs | 2.4T / ~95B | ~2.8T / ~104B | 284B / 13B |
| Contexte | 1M | 1M | 1M |
| Multimodal | Texte + Image + Vidéo | Texte + Image + Vidéo | Texte uniquement |
| Tarification (entrée/sortie) | 2 $ / 6 $ | 3 $ / 15 $ | ~0,14 $ / 0,28 $ (beaucoup moins cher) |
| Poids ouverts | Prévu (la semaine suivante) | Déjà publiés | MIT, disponible |
| Atouts | Autonomie long horizon, multimodal, PaperBench, tarification sur la sortie | Scores indépendants solides, leadership sur le codage front-end | Efficacité-coût extrême, codage agentique solide pour sa taille |
| Position relative | Compétitif / leader sur plusieurs benchmarks agents et multimodaux | Léger avantage sur certains indices d’intelligence audités | Excellent rapport qualité-prix ; capacité absolue inférieure |
Qwen3.8-Max surpasse généralement Kimi K3 en efficience-coût pour les travaux riches en sortie et les tâches multimodales, tandis que DeepSeek V4 Flash reste le roi du budget pour les charges de texte à grand volume où la capacité maximale est secondaire. Beaucoup d’équipes utiliseront les trois via une passerelle unifiée, en routant le trafic simple vers des modèles de la classe Flash et les sessions agentiques complexes vers Qwen3.8-Max ou Kimi K3.
Qwen3.8-Max est-il au niveau de Kimi K3 ?
À certains égards, oui. Il égalise le palier de contexte 1M, affiche un fort positionnement multimodal et est moins cher sur les tarifs officiels standard entrée/sortie. Il n’égale pas le nombre total de paramètres 2.8T de Kimi K3, et la documentation publique de Kimi fournit actuellement des indications particulièrement détaillées sur les outils, la mise en cache de contexte, la sortie structurée et la vision.
Qwen3.8-Max est-il au niveau de DeepSeek V4 Flash ?
Il concurrence sur le contexte 1M et l’architecture MoE, mais les produits visent des usages différents. DeepSeek V4 Flash est la voie économique et rapide. Qwen3.8-Max est la voie plus grande et plus capable pour les travaux où la compréhension multimodale, le raisonnement avancé et la productivité d’entreprise priment sur le prix au jeton le plus bas.
Que peut faire Qwen3.8-Max ?
Codage et ingénierie logicielle
Qwen3.8-Max est un candidat solide pour le développement full-stack, la revue de code, la compréhension de dépôts, la planification de migration, la conception d’API, le débogage, le raisonnement sur les tests et l’architecture logicielle. Son long contexte aide lorsque le modèle doit garder en vue de nombreux fichiers, journaux et exigences. Utilisez-le pour les tâches de code difficiles, pas pour chaque complétion automatique ou simple explication de lint.
Bureautique et travail de la connaissance
Le positionnement « Cowork » du modèle compte. Les employés d’entreprise ne posent pas seulement des questions en chat. Ils comparent des PDF, résument des réunions, examinent des présentations, interprètent des feuilles de calcul, vérifient des contrats, rédigent des rapports et préparent des décisions à partir d’éléments hétérogènes. La conception multimodale et long contexte de Qwen3.8-Max le rend adapté aux workflows bureautiques où texte, documents, captures d’écran et données structurées doivent être raisonnés ensemble.
Flux de travail agentiques
Qwen3.8-Max est utile pour la planification d’agents : décomposer un objectif en étapes, décider quel outil appeler, évaluer les résultats et réviser le plan. Sur CometAPI, cela devient plus pratique car la même application peut router les étapes simples vers des modèles moins chers et réserver Qwen3.8-Max pour la planification ou la vérification.
Prise en main et conseils d'intégration CometAPI
- Accès direct : utilisez QwenCloud ou Alibaba Cloud Model Studio avec l’ID de modèle
qwen3.8-max. Les points de terminaison compatibles OpenAI et Anthropic sont pris en charge. - Accès unifié via CometAPI : inscrivez-vous sur CometAPI.com, obtenez une clé API, définissez
base_urlsurhttps://api.cometapi.com/v1, et appelezmodel="qwen3.8-max". La même clé fonctionne pour DeepSeek V4 Flash, Kimi K3, Claude, GPT et des centaines d’autres modèles — idéal pour l’expérimentation, le contrôle des coûts et le routage en production. CometAPI met l’accent sur des prix compétitifs, une faible latence et l’ajout rapide de nouveaux modèles (Qwen3.8-Max a été listé peu après son lancement). - Frameworks d’agents : branchez-vous directement dans Claude Code, OpenClaw ou des harnais personnalisés. Activez un effort de raisonnement plus élevé pour les tâches complexes de long horizon.
- Poids ouverts : surveillez Hugging Face / ModelScope pour la prochaine publication si vous avez besoin de déploiements on-premise ou de fine-tuning.
