TL;DR : Qwen3.8-Max d’Alibaba (aperçu, 2,4 billions de paramètres, multimodal avec entrée image/vidéo/document) se mesure à Kimi K3 de Moonshot AI (2,8T de paramètres, poids ouverts bientôt, contexte 1M). Qwen3.8-Max excelle sur les tâches multimodales et de productivité avec un tarif en aperçu à ~10 % des prix standard, tandis que Kimi K3 mène sur certains benchmarks ouverts et en matière d’ouverture brute.
Les deux sont des modèles de pointe accessibles aujourd’hui via des API. Pour une intégration fiable et rentable, CometAPI offre un accès fluide à Qwen avec des endpoints compatibles OpenAI, des prix compétitifs et une mise à l’échelle simple pour les développeurs et les entreprises.
Principaux enseignements :
- Échelle et capacités : D’après la publication sur X, Qwen3.8-Max apporte le multimodal natif (images, vidéos, documents) à un modèle de 2,4T de paramètres ; Qwen3.7-Max brille en codage piloté par agents et sur les tâches à long horizon.
- Tarification et accès : Qwen3.8-Max propose des tarifs API compétitifs (~$2.50/$7.50 par 1M entrée/sortie, souvent remisés) ; aperçu de Qwen 3.8 à des tarifs réduits via Token Plan/Qoder.
- Vs. Kimi K3 : Kimi K3 (2,8T, poids ouverts le 27 juillet 2026) devance sur certains benchmarks mais Qwen offre une intégration multimodale et écosystème plus solides ; Qwen est moins cher dans de nombreux scénarios API.
- Accès aujourd’hui : Aperçu sur Alibaba Cloud/Token Plan/Qoder à tarifs réduits ; compatible API OpenAI/Anthropic.
- Gains pratiques : Supérieur pour le développement full-stack, l’automatisation bureautique, l’analyse vidéo et les workflows d’agents.
Qu’est-ce que Qwen 3.8 Max ?
Qwen 3.8 Max, officiellement présenté en aperçu sous Qwen3.8-Max-Preview, est le dernier modèle phare de l’équipe Qwen d’Alibaba. Annoncé au World AI Conference à Shanghai autour du 19 juillet 2026, il représente un bond massif d’échelle par rapport à la série Qwen 3.7.
Spécifications clés
- Paramètres : 2,4 billions au total — en faisant l’un des plus grands modèles publiquement évoqués, seulement devancé par Kimi K3 de Moonshot AI à ~2,8T.
- Architecture : Sparse Mixture-of-Experts (MoE). Seul un sous-ensemble de paramètres s’active par token, équilibrant puissance et efficacité (nombre exact de paramètres actifs non divulgué — détail clé pour le coût d’inférence).
- Capacités multimodales : Traite nativement texte, images, vidéos et documents. C’est le premier modèle de Qwen dépassant 1 billion de paramètres avec un support multimodal robuste.
- Fenêtre de contexte : Jusqu’à 1 million de tokens, héritée et améliorée depuis Qwen 3.7 Max.
- Variantes : Le modèle phare 2,4T Max plus une variante plus petite ~27B pour des cas d’usage légers.
Comment Qwen 3.8 Max fonctionne : innovations et avantage technique
Qwen3.8-Max tire parti de décennies d’expertise de mise à l’échelle d’Alibaba :
- Échelle massive et efficacité : 2,4T de paramètres via MoE — seul un sous-ensemble s’active par token, équilibrant puissance et coût d’inférence (similaire aux MoE Qwen précédents comme 235B-A22B).
- Raisonnement hybride : Hérite des modes “Thinking/Non-Thinking” pour un contrôle flexible de la profondeur, de la vitesse et du coût. Parfait pour les tâches pilotées par agents nécessitant une planification multi-étapes.
- Intégration multimodale : Traitement unifié texte + vision + vidéo. Permet des applications plus riches comme l’analyse de documents avec images ou le raisonnement basé sur vidéo.
- Contexte long et focus agentique : Optimisé pour les tâches à long horizon (p. ex., clonage d’applications complètes, workflows complexes). Prend en charge l’usage avancé d’outils, RAG et l’appel de fonctions.
- Avancées d’entraînement : Construit sur d’immenses données multilingues (119+ langues), embeddings positionnels améliorés, et techniques réduisant les hallucinations tout en renforçant STEM/codage.
Concrètement :
- Entrée → Tokenizer + embeddings → le routeur MoE sélectionne les experts → les couches Transformer traitent → génération de la sortie.
- Prend en charge le codage piloté par agents (p. ex., projets full-stack), les pipelines d’analyse de données et l’automatisation bureautique.
Des tests communautaires sur Reddit montrent une puissance brute prometteuse en codage et sur des requêtes complexes, même si certains notent des boucles de réflexion occasionnelles dans l’aperçu initial.
Pour les développeurs : associez-le à des outils comme CometAPI pour un accès fiable et unifié entre fournisseurs, réduisant latence et coûts tout en testant Qwen aux côtés de Claude, GPT, etc.
Tarification et accès : ce que vous pouvez réellement utiliser aujourd’hui
Disponibilité en aperçu (en juillet 2026) :
- Alibaba Token Plan : Abonnement à crédits.
- Lite : $6 pour 2 500 crédits/semaine.
- Pro : $68 pour 40 000 crédits/semaine (prend en charge 6–8 agents simultanés).
- Remise : 10 % du tarif standard durant l’aperçu.
- Plateformes : Qwen Chat, Alibaba Cloud, Qoder (codage), QoderWork (productivité).
- API : Compatible OpenAI/Anthropic. Pas de tarifs par token autonomes publiés pour 3.8-Max pour l’instant (prédécesseur : ~$1.25/M entrée, $3.75/M sortie).
Poids ouverts : Annoncés “bientôt” — un atout majeur pour l’auto-hébergement/l’ajustement fin, bien que les exigences matérielles soient extrêmes (~1,2 To en 4-bit).
Recommandation CometAPI : Pour la production, évitez la gestion directe des fournisseurs. CometAPI fournit une clé API pour 500+ modèles, y compris la série Qwen. Facturation unifiée, endpoints unifiés et fiabilité — idéal pour faire de l’A/B testing de Qwen 3.8 Max vs. d’autres sans réécrire le code. Parfait pour les utilisateurs de Cometapi.com construisant des applications IA. Inscrivez-vous sur cometapi.com pour une intégration sans couture.
Cela rend Qwen accessible sans engagement Alibaba Cloud, idéal pour les startups et les développeurs à l’échelle mondiale.
Qwen3.8 Max bat-il Kimi K3 ?
Sur le nombre de paramètres : non
Si la question est « Qwen3.8 Max a-t-il plus de paramètres que Kimi K3 ? », la réponse est simple : non. Qwen3.8-Max-Preview est annoncé par Qoder comme un modèle à 2,4T de paramètres. Kimi K3 est documenté par Moonshot comme un modèle à 2,8T de paramètres. Sur le total de paramètres, Kimi K3 est plus grand de 400 milliards.
Cela ne fait pas automatiquement de Kimi K3 un meilleur modèle pour toutes les tâches. Le nombre de paramètres n’est pas, à lui seul, un classement. Les données d’entraînement, l’architecture, le routage des experts, les paramètres actifs par token, le post-entrainement, la pile d’inférence, les harnais d’outils et la gestion du contexte influencent tous la performance réelle. Un modèle plus petit peut battre un plus grand sur certaines tâches s’il dispose de meilleures données, d’un meilleur post-entrainement, de meilleurs outils, ou d’un meilleur raisonnement à l’inférence.
Sur les preuves publiques : Kimi K3 est devant pour l’instant
Kimi K3 dispose actuellement d’un meilleur ensemble de preuves publiques. Le guide et le blog technique de Kimi K3 de Moonshot divulguent l’architecture, le contexte, la vision, l’activation des experts, les limites API et les plans de publication. La page Kimi K3 d’OpenLM reflète un tableau de benchmarks détaillé couvrant le codage, le travail piloté par agents, le raisonnement, le travail de connaissance et la vision. Le résultat de “Frontend Code Arena” à 1 679 points et le résumé du contexte 1M du modèle, de l’activation 16/896 des experts et des signaux de tarification y figurent.
Qwen3.8-Max-Preview est très important, mais l’aperçu est moins documenté. Les sources les plus solides à ce jour sont la page de lancement de Qoder et la configuration OpenCode de Model Studio sur Alibaba Cloud. Elles sont précieuses, mais ne fournissent pas encore le même niveau de détail de benchmarks, de divulgation des paramètres actifs, d’explication d’architecture, de conditions de licence, ou de détails de mise en production via CometAPI que Kimi K3.
| Aspect | Qwen3.8-Max (Aperçu) | Qwen3.7-Max | Kimi K3 (Moonshot) |
|---|---|---|---|
| Paramètres | 2,4T | ~1T+ (antérieur) | 2,8T |
| Multimodal | Oui (img/vidéo/docs) | Limité/centré texte | Oui (vision/3D native) |
| Fenêtre de contexte | Grande (multimodal) | 262K+ | 1M tokens |
| Points forts | Agents, codage, productivité, multimodal | Agents long-horizon, raisonnement | Poids ouverts, arènes de code, raisonnement |
| Benchmarks (exemples) | Fort sur KingBench (~2e), top interne | GPQA 92,4, SWE-Pro 60,6 | En tête sur plusieurs (Frontend Arena), compétitif globalement |
| Tarifs (API approx.) | Aperçu ~10 % du standard | Compétitifs (~$1–5/M mixte) | $3 in / $15 out par 1M |
| Accès | Aperçu Alibaba + CometAPI | Alibaba + CometAPI | API maintenant, poids ouverts bientôt |
| Idéal pour | Workflows multimodaux d’entreprise | Échafaudages agents, dev | Auto-hébergement, personnalisation |
Différences clés :
- Ouverture : Kimi K3 l’emporte avec des poids pleinement ouverts imminents pour l’auto-hébergement/l’ajustement fin. Qwen3.8-Max en aperçu maintenant, ouverture bientôt.
- Multimodal : Les deux sont solides ; Qwen3.8 met l’accent sur l’intégration vidéo/doc.
- Performance : Kimi K3 mène souvent sur les benchmarks bruts (p. ex., GPQA, arènes de code) ; Qwen est compétitif ou supérieur dans les échafaudages agents/productivité et des tâches spécifiques comme les feuilles de calcul/optimisation kernel. Qwen est moins cher en usage API (p. ex., 3× dans certaines comparaisons).
- Contexte et vitesse : Kimi 1M de contexte ; Qwen très fort en long-contexte (262K+ auparavant). Qwen produit souvent plus vite.
- Cas d’usage : Qwen pour l’écosystème Alibaba intégré, l’automatisation bureautique, l’entreprise multimodale. Kimi pour les passionnés d’open-source et la personnalisation maximale.
Conclusion : devez-vous adopter Qwen 3.8 Max ?
Oui pour l’expérimentation et les besoins en codage/multimodal — surtout via des plateformes accessibles comme CometAPI. Ce n’est pas encore un remplacement complet des modèles fermés de pointe, mais c’est une option puissante et abordable qui fait avancer l’écosystème. Restez à l’écoute pour les benchmarks et la sortie complète.
