Qwen3.8-Flash expliqué : contexte 1M, conception MoE à 6B actifs, benchmarks de code et multimodaux, rapport qualité-prix, comparaisons et accès via CometAPI.
TL;DR Le Qwen3.8-Flash d’Alibaba est un modèle de production pour le code à grand volume, les agents, le long contexte et les tâches multimodales. Il prend en charge un contexte hébergé de 1M de tokens et combine de solides résultats de benchmark avec un faible prix d’API. Un pendant à poids ouverts, Qwen3.8-Flash-Next, est disponible pour l’évaluation et le déploiement locaux.
Points clés
- Nommage production vs poids ouverts : Qwen3.8-Flash est le modèle de production hébergé ; Qwen3.8-Flash-Next est la publication de l’architecture à poids ouverts utilisée pour communiquer les détails du modèle et les benchmarks.
- Activation extrêmement clairsemée : 125B de paramètres principaux + 51B pour les embeddings N-gram, avec seulement 6B de paramètres actifs par jeton.
- Contexte long : 262K de contexte natif pour le modèle ouvert, extensible à 1M avec YaRN ; la route de production QwenCloud expose par défaut un contexte 1M.
- Codage agentique solide : Qwen annonce 62.5 sur SWE-bench Pro, 73.9 sur CoWorkBench, 73.5 sur Toolathlon Verified, et 91.9 sur LiveCodeBench v6.
- Performances multimodales : Qwen annonce 84.5 sur AndroidWorld, 88.5 sur RealWorldQA, et 90.6 sur MathVision sans interpréteur de code.
- Efficacité : QSA atteint jusqu’à 7,6x en prériemplissage et 4,9x en décodage pour le noyau à 1M de tokens, et Qwen rapporte un débit de prériemplissage 8,6x plus élevé à 1M de tokens que Qwen3.7-Plus dans une configuration de service avec fort taux de hit du cache de préfixe.
- Tarification : Alibaba Cloud indique actuellement 0,15 $/M en entrée et 0,47 $/M en sortie pour le déploiement international ; CometAPI indique 0,12 $/M en entrée et 0,376 $/M en sortie.
Image de lancement officielle Qwen3.8-Flash — source Alibaba/Qwen
Qu’est-ce que Qwen3.8-Flash ?
Qwen3.8-Flash est le modèle de production orienté efficacité de Qwen (Alibaba) pour le codage, les agents, le travail de connaissance à long contexte et les tâches multimodales. Le modèle a été annoncé avec un pendant à poids ouverts, Qwen3.8-Flash-Next. Alibaba le décrit comme un modèle MoE multimodal à poids ouverts optimisé pour la capacité, la latence et le coût, et précise que l’architecture est un aperçu précoce d’idées destinées à Qwen4.
Le label “Flash” est important. Qwen3.8-Max est le palier phare plus grand pour la capacité maximale, tandis que Qwen3.8-Flash vise à offrir l’essentiel des performances utiles en codage et pour les agents avec beaucoup moins de calcul actif. La version active 6B de paramètres par jeton, comparé à des empreintes actives bien plus élevées dans les MoE phares.
Le modèle de production est servi sous l’ID de modèle qwen3.8-flash. QwenCloud prend en charge les APIs Chat Completions compatibles OpenAI et Responses, plus une interface compatible Anthropic, ce qui facilite l’intégration du modèle dans des stacks agents et de codage existantes.
Qwen3.8-Flash vs. Qwen3.8-Flash-Next : quelle est la différence ?
Qwen3.8-Flash-Next est la publication du modèle à poids ouverts. Elle expose l’architecture, les poids, des conseils de déploiement et une suite de benchmarks. Les poids sont disponibles sur Hugging Face et ModelScope. Le modèle ouvert prend en charge un contexte natif de 262 144 tokens et peut être étendu à 1M avec YaRN.
Qwen3.8-Flash est la version API de production. Dans la version officielle, Alibaba indique que la version de production utilise par défaut un contexte de 1M et inclut des outils intégrés officiels. En pratique, les développeurs évaluant le modèle hébergé devraient s’aligner sur le comportement et la tarification API de Qwen3.8-Flash, tandis que la version Flash-Next est la meilleure source publique pour les détails d’architecture et de benchmarks.
Spécifications de Qwen3.8-Flash
| Spécification | Qwen3.8-Flash / Flash-Next |
|---|---|
| Fournisseur | Alibaba Qwen |
| ID du modèle de production | qwen3.8-flash |
| Modèle à poids ouverts | Qwen3.8-Flash-Next |
| Architecture | MoE multimodal ; attention hybride GDN + QSA |
| Paramètres principaux | 125B |
| Paramètres activés | 6B par jeton |
| Paramètres d’embeddings N-gram | 51B |
| Contexte natif (modèle ouvert) | 262 144 tokens |
| Contexte étendu / hébergé | Jusqu’à 1 000 000 de tokens |
| Modalités d’entrée en production | Texte + image documentées dans les exemples officiels |
| Modalités (poids ouverts) | Texte + vision ; publié en multimodal |
| Contrôles de raisonnement | low / medium / xhigh dans les exemples QwenCloud |
| Appels d’outils parallèles | Pris en charge dans la configuration officielle du modèle Codex |
| Poids ouverts | Oui, pour Qwen3.8-Flash-Next |
| Date de lancement | Fenêtre de sortie des 26–27 août 2026 |
Le chiffre d’efficacité clé est 6B de paramètres activés par jeton. Les 51B supplémentaires pour les embeddings N-gram sont une capacité basée sur des recherches ; Qwen note qu’ils n’entrent pas dans le budget de multiplication de matrices par jeton de la même façon que les poids du transformeur.
Quoi de neuf dans l’architecture de Qwen3.8-Flash ?
Schéma officiel de l’architecture Qwen — Qwen3.8-Flash-Next
1. GDN + Qwen Sparse Attention (QSA)
Le modèle mélange deux mécanismes. Trois couches sur quatre utilisent Gated DeltaNet (GDN) pour compresser l’historique dans un état de taille fixe, tandis que la couche restante utilise une attention globale pour une récupération précise. La couche à attention globale utilise ensuite Qwen Sparse Attention pour réduire la quantité de contexte à traiter directement.
L’objectif pratique est simple : GDN gère une mémoire peu coûteuse, tandis que QSA n’investit une attention complète que là où la récupération compte. C’est particulièrement utile pour les applications à long contexte où l’attention pleine classique devient coûteuse en calcul et en trafic de cache KV.
2. Résidu à portes avec quatre chemins d’information
Gated Residual élargit le flux résiduel en quatre branches parallèles. Une porte dynamique élément par élément contrôle la quantité d’information lue et écrite dans chaque branche. Cela donne aux informations précoces plus de moyens de survivre dans des réseaux profonds, au lieu d’être sans cesse mélangées dans un seul flux. Qwen indique aussi que l’état résiduel peut être stocké en FP8 pour réduire le trafic mémoire.
3. Les embeddings N-gram ajoutent de la capacité sans calcul proportionnel
Qwen ajoute 51B de paramètres d’embeddings N-gram adressés via le contexte local des tokens. Contrairement aux poids habituels d’un transformeur, ces paramètres sont récupérés par opérations de recherche et peuvent être déportés en mémoire hôte avec prélecture asynchrone. La conception augmente la capacité du modèle tout en gardant l’arithmétique par jeton faible.
4. Optimiseur Muon et co-conception de l’entraînement
Qwen entraîne le modèle avec l’optimiseur Muon pour les poids centraux de cartes linéaires 2D, tout en conservant AdamW pour les embeddings, les routeurs et certains paramètres bas rang. L’équipe a aussi réajusté la loi d’échelle pour la nouvelle architecture et indique que l’échauffement de la taille de lot était inutile, évitant 18,8 % d’étapes d’optimisation supplémentaires dans ses expériences.
5. MoE ultra clairsemé et prédiction multi-jetons
Le modèle conserve un vaste pool d’experts mais n’achemine qu’un petit nombre d’experts par jeton. Il utilise également la prédiction multi-jetons, qui aide le décodage spéculatif en augmentant les taux d’acceptation tout en améliorant le backbone pendant l’entraînement. Ensemble, ces choix renforcent le même objectif de conception : plus de capacité et de débit sans payer le coût de calcul d’un modèle phare à chaque jeton.
Performances de Qwen3.8-Flash aux benchmarks
Benchmarks de programmation
Alibaba publie la suite de benchmarks sous Qwen3.8-Flash-Next, le pendant à poids ouverts du Qwen3.8-Flash de production. Les tableaux suivants reprennent les scores annoncés par Qwen et se concentrent sur des pairs également disponibles via CometAPI.

Graphique officiel des benchmarks linguistiques de Qwen
| Benchmark | Qwen3.8-Flash | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 54.4 | — |
| SWE-bench Pro | 62.5 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | — | 77.5 |
| NL2Repo-Bench | 48.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 45.1 | 68.2 |
| JobBench | 55.7 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 70.3 | — |
| IFBench | 81.3 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 90.8 | 91.3 |
| HLE | 35.9 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.6 | 88.8 |
Résultats en programmation : Qwen3.8-Flash devance les pairs sélectionnés sur SWE-bench Pro (62.5), SWE-bench Multilingual (81.0) et LiveCodeBench v6 (91.9). La principale exception est NL2Repo-Bench, où DeepSeek V4 Flash obtient 54.2 contre 48.1.
Résultats pour agents : Qwen3.8-Flash affiche 73.9 sur CoWorkBench et 55.7 sur JobBench, nettement au-dessus des pairs sélectionnés dans le tableau de Qwen. Il devance également de peu DeepSeek V4 Flash sur Toolathlon Verified, 73.5 contre 70.3.
Résultats en raisonnement : l’écart est plus serré. Qwen3.8-Flash marque 91.7 sur GPQA Diamond, proche de Claude Opus 4.6 à 91.3 et de DeepSeek V4 Flash à 90.8. Sur HLE, Claude Opus 4.6 mène avec 40.0 contre 35.9 pour Qwen.
Benchmarks multimodaux

Graphique officiel des benchmarks vision-langage de Qwen
| Benchmark | Qwen3.8-Flash | Claude Opus 4.6 |
|---|---|---|
| ClawEval-MM (Pass@3 / Moy.) | 64.4 / 60.4 | 52.5 / 54.7 |
| AndroidWorld | 84.5 | 62.0 |
| ERQA | 72.3 | 40.8 |
| LVBench | 76.6 | 63.0 |
| RealWorldQA | 88.5 | 73.9 |
| MathVision (sans CI / avec CI) | 90.6 / 95.7 | 65.5 / — |
| CharXiv RQ (sans CI / avec CI) | 84.6 / 90.6 | 66.0 / — |
Les résultats multimodaux publiés sont l’un des arguments les plus solides en faveur de Qwen3.8-Flash. Qwen annonce 84.5 sur AndroidWorld, 88.5 sur RealWorldQA et 90.6 sur MathVision sans interpréteur de code. Ces scores suggèrent que le modèle est prévu pour des agents capables de lire des écrans, comprendre l’état visuel et poursuivre l’action plutôt que de simplement répondre à des questions d’images.
Remarque sur les benchmarks : il s’agit de résultats de sortie de version rapportés par le fournisseur, et non d’un test comparatif indépendant. Plusieurs benchmarks utilisent des harnais ou des configurations d’outils différents, et certains sont internes. Considérez ces chiffres comme des indications, puis validez le modèle sur vos propres invites, outils, objectifs de latence et critères d’acceptation.
Pourquoi Qwen3.8-Flash est rapide et économique

Graphique officiel d’efficacité en long contexte de Qwen
À un contexte de 1M de tokens, Qwen rapporte jusqu’à 7,6x plus rapide en prériemplissage et 4,9x plus rapide en décodage pour le noyau d’attention QSA. Dans une expérience de service avec 90 % de taux de hit du cache de préfixe, Qwen3.8-Flash-Next a atteint 8,6x le débit de prériemplissage de Qwen3.7-Plus.
Le point clé au niveau système est le calcul actif. Un modèle principal de 125B semble normalement grand, mais seulement 6B de paramètres sont activés par jeton. Cette empreinte active est inférieure à la moitié des 13B de paramètres activés annoncés pour DeepSeek V4 Flash, et bien en dessous des environ 95B de paramètres actifs annoncés pour Qwen3.8-Max. Le nombre de paramètres ne se traduit pas linéairement en vitesse, mais la conception donne à Qwen3.8-Flash une cible d’efficacité claire.
Alibaba indique également que l’entraînement a requis environ un neuvième des ressources de Qwen3.7-Plus tout en améliorant les performances en codage et tâches bureautiques. Par ailleurs, le mode QwenWork Standard propulsé par le modèle réduirait la consommation de tokens par tâche de 75 % et environ doublerait la vitesse de génération par rapport au mode précédent. Ces chiffres au niveau produit ne doivent pas être considérés comme des garanties universelles de latence de l’API, mais ils illustrent l’usage attendu du modèle par Alibaba.
Tarification de Qwen3.8-Flash
L’annonce de lancement d’Alibaba liste une tarification QwenCloud à 0,16 $ par million de tokens en entrée et 0,47 $ par million en sortie. Les prix peuvent varier selon la région, la surface produit, le caching ou des mises à jour ultérieures, donc les équipes de production devraient toujours vérifier la page fournisseur en direct avant d’estimer une grosse charge.
Au moment de la préparation de cet article, CometAPI liste Qwen3.8-Flash à 0,12 $ par million de tokens en entrée et environ 0,376 $ par million en sortie. La page modèle CometAPI indique qu’il s’agit d’une remise de 20 % par rapport au prix de référence indiqué.
| Route | Entrée / 1M tokens | Sortie / 1M tokens | Exemple : 10 M d’entrée + 2 M de sortie |
|---|---|---|---|
| Tarif de lancement QwenCloud | 0,16 $ | 0,47 $ | 2,54 $ |
| Tarif listé CometAPI | 0,12 $ | ~0,376 $ | ~1,95 $ |
Pour une charge avec 10 millions de tokens en entrée et 2 millions en sortie, l’arithmétique au tarif de lancement donne environ 2,54 $ sur QwenCloud contre environ 1,95 $ au tarif CometAPI actuel. Les factures réelles d’agents peuvent être plus élevées car les appels d’outils, les réessais, le raisonnement prolongé, le contexte répété et les services externes ajoutent du coût. Comparez le coût par résultat accepté plutôt que le seul prix par token.
Qwen3.8-Flash vs. Qwen3.8-Max vs DeepSeek V4 Flash
| Dimension | Qwen3.8-Flash | Qwen3.8-Max | Gemini 3.7 Flash | DeepSeek V4 Flash |
|---|---|---|---|---|
| Positionnement | Modèle Qwen de production, priorité à l’efficacité | Modèle phare Qwen | Modèle Flash polyvalent de Google | MoE texte priorisant l’efficacité |
| Paramètres totaux / actifs | 125B + 51B (lookup) / 6B | 2,4T / ~95B | Non divulgué | 284B / 13B |
| Contexte | 1M hébergé | 1M | 1 048 576 | 1M |
| Multimodal | Texte + vision documentés | Texte + image + vidéo | Texte + image + vidéo + audio + PDF | Focalisé texte |
| Contrôles de raisonnement | low / medium / xhigh | Raisonnement avancé / modes rapides | low / medium / high | Non-think / Think / Think Max |
| Prix d’entrée CometAPI | 0,12 $/M | 1,60 $/M | 0,60 $/M | 0,176 $/M |
| Prix officiel fournisseur (entrée / sortie) | 0,15 $ / 0,47 $ (Alibaba Cloud international) | 2 $ / 6 $ (Alibaba Cloud international) | 0,75 $ / 3,75 $ jusqu’au 31 déc. 2026 | Heures pleines : 0,44 $ / 1,32 $ ; heures creuses : 0,22 $ / 0,66 $ |
| Meilleure adéquation | Codage à grand volume, agents, cowork | Tâches Qwen les plus difficiles, autonomie long terme | Écosystème d’outils Google, agents multimodaux étendus | Raisonnement et code texte à haut débit |
Atouts de Qwen3.8-Flash
- Efficacité en calcul actif : 6B de paramètres activés est exceptionnellement faible pour un modèle qui affiche de bons scores en codage agentique et en multimodal.
- Valeur de l’écosystème Qwen : Qwen3.8-Flash est nettement moins cher que Qwen3.8-Max pour les charges qui n’ont pas besoin du palier phare.
- Équilibre agents + bureautique : la sortie est particulièrement forte sur CoWorkBench, JobBench, Toolathlon, SWE-bench Pro et les tâches d’agent multimodal plutôt que la seule QA académique.
- Voie à poids ouverts : Qwen3.8-Flash-Next fournit des poids pour les équipes qui ont besoin de déploiement local, d’évaluation indépendante ou de fine-tuning.
Quand un autre modèle peut être préférable
- Utilisez Qwen3.8-Max pour la capacité Qwen maximale. Le palier Max dispose d’un budget de calcul actif bien plus grand et vise les travaux les plus difficiles à long horizon.
- Utilisez Gemini 3.7 Flash quand l’ampleur des modalités d’entrée compte. Le modèle Flash de Google couvre explicitement l’audio, la vidéo, le PDF et de profondes intégrations d’outils Google.
- Utilisez DeepSeek V4 Flash quand l’efficacité texte-first est la priorité. Il gagne NL2Repo-Bench dans la comparaison de Qwen et reste une alternative de codage axée coût solide.
- Utilisez Claude Opus 4.6 lorsque le raisonnement premium et la maturité des workflows d’entreprise justifient le prix. Dans le tableau de Qwen, il demeure en tête sur HLE et très compétitif sur GPQA.
Meilleurs cas d’usage pour Qwen3.8-Flash
Agents de codage et travail sur dépôts
Qwen3.8-Flash convient bien à la résolution d’issues, au refactoring, à la revue de code, à la navigation dans les dépôts, à la génération de tests, au débogage et aux boucles de codage pilotées par des outils. Ses résultats élevés sur LiveCodeBench et SWE-bench Pro suggèrent qu’il n’est pas seulement un modèle de chat à faible latence ; il est conçu pour du travail logiciel multi-étapes.
Travail de connaissance en entreprise à long contexte
Un contexte de 1M en production peut contenir de larges collections de documents, des bases de code, des logs, des transcriptions de réunions, ou l’historique d’un agent de longue durée. Les résultats CoWorkBench et JobBench rendent le modèle particulièrement intéressant pour la synthèse documentaire, les workflows tableur/diapos, l’aide à la recherche, la revue de conformité et l’analyse opérationnelle.
Agents multimodaux
Les scores sur AndroidWorld, RealWorldQA, ERQA et MathVision orientent vers des agents qui doivent comprendre des captures d’écran, des documents visuels, des interfaces, des diagrammes et des images du monde réel dans un workflow. Cela rend le modèle pertinent pour les agents navigateur, les tests d’UI, la QA visuelle, les agents documentaires et l’automatisation sensible à l’écran.
Routage à grand volume
Comme Qwen3.8-Flash est bien moins cher que les modèles phares, une architecture pratique consiste à router la majorité du trafic de production vers Flash et à n’escalader que les requêtes ambiguës, à haut risque ou exceptionnellement difficiles vers Qwen3.8-Max ou un autre modèle premium. Des passerelles unifiées comme CometAPI facilitent ce schéma, car l’application peut changer de fournisseur derrière un contrat d’API unique.
Limites et mises en garde
- Les benchmarks sont auto-rapportés. Certains utilisent des harnais choisis par Qwen, des tâches internes ou des configurations avec outils. Une vérification indépendante reste importante.
- Tous les benchmarks ne sont pas gagnés. DeepSeek V4 Flash mène NL2Repo-Bench dans la comparaison officielle, et Claude Opus 4.6 mène HLE.
- L’utilisation de l’ordinateur reste difficile en termes absolus. La sortie annonce un score binaire OSWorld 2.0 de 19.4, même si la performance à crédit partiel est bien plus élevée.
- Le comportement hébergé et à poids ouverts peut différer. Les invites système, les outils, la gestion du contexte, la quantification, la pile de service et les mises à jour du fournisseur peuvent éloigner les résultats réels du setup de benchmark Flash-Next publié.
- La tarification est dynamique. L’annonce de lancement et les pages d’agrégateurs actuelles peuvent montrer des prix de référence légèrement différents. Utilisez le prix de l’endpoint en direct pour budgéter.
Comment utiliser l’API Qwen3.8-Flash avec CometAPI
CometAPI expose Qwen3.8-Flash via un endpoint compatible OpenAI, donc les intégrations existantes du SDK OpenAI peuvent généralement basculer en changeant la clé API, l’URL de base et l’ID de modèle.
Pourquoi utiliser CometAPI pour Qwen3.8-Flash ?
CometAPI fournit aux développeurs un endpoint API unifié pour tester Qwen3.8-Flash aux côtés d’autres modèles sans maintenir des intégrations fournisseurs séparées. C’est particulièrement utile pour les comparaisons de benchmarks, le routage en repli et la sélection de modèles basée sur le coût.
- Créez une clé API CometAPI. Générez une clé dans le dashboard CometAPI et stockez-la dans une variable d’environnement plutôt que dans le code source.
- Utilisez l’URL de base unifiée. Définissez l’URL de base du SDK sur
https://api.cometapi.com/v1. - Sélectionnez le modèle. Utilisez qwen3.8-flash comme ID de modèle.
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
)
response = client.chat.completions.create(
model="qwen3.8-flash",
messages=[
{"role": "system", "content": "You are a precise coding assistant."},
{"role": "user", "content": "Review this API design and identify reliability risks."},
],
)
print(response.choices[0].message.content)
cURL
curl "https://api.cometapi.com/v1/chat/completions" \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash",
"messages": [
{"role": "user", "content": "Summarize the main risks in this migration plan."}
]
}'
For production, add timeout handling, retry policy, token limits, structured output validation, and model-routing telemetry. If your workflow is agentic, track tool-call failures and accepted-task rate in addition to raw model latency.
FAQ
Qwen3.8-Flash est-il open source ?
La route Qwen3.8-Flash de production est une API hébergée. Son pendant à poids ouverts, Qwen3.8-Flash-Next, dispose de poids publiés sur Hugging Face et ModelScope. “Poids ouverts” est le terme le plus précis, car les droits d’usage dépendent de la licence du modèle.
Quelle est la fenêtre de contexte de Qwen3.8-Flash ?
Le modèle ouvert prend en charge 262 144 tokens nativement et peut être étendu à 1 000 000 de tokens avec YaRN. Alibaba indique que le service Qwen3.8-Flash de production utilise par défaut un contexte de 1M de tokens.
Combien de paramètres Qwen3.8-Flash possède-t-il ?
La sortie comporte un modèle principal de 125B paramètres, 51B de paramètres d’embeddings N-gram, et 6B de paramètres activés par jeton. Le faible nombre activé est central dans sa conception d’efficacité.
Qwen3.8-Flash prend-il en charge les images ?
Oui. La sortie est multimodale, la pile de déploiement à poids ouverts prend en charge le texte et la vision, et les exemples d’intégration officiels listent des entrées texte et image pour le modèle hébergé. Les surfaces spécifiques au fournisseur peuvent exposer des combinaisons de modalités différentes ; vérifiez la page de capacités API à jour avant le déploiement.
Qwen3.8-Flash est-il meilleur que Qwen3.8-Max ?
Pas universellement. Qwen3.8-Flash est un meilleur choix lorsque la latence, le calcul actif et le prix comptent. Qwen3.8-Max est le choix phare pour les tâches les plus difficiles à long horizon et à forte valeur. Un système de routage peut utiliser les deux.
Combien coûte Qwen3.8-Flash ?
Alibaba a annoncé 0,16 $/M en entrée et 0,47 $/M en sortie pour QwenCloud au lancement. CometAPI liste actuellement environ 0,12 $/M en entrée et 0,376 $/M en sortie. Vérifiez les prix en direct, car les tarifs des fournisseurs et agrégateurs peuvent changer.
Conclusion
Qwen3.8-Flash illustre clairement le passage d’un “modèle plus grand” à de “meilleures économies système”. Son backbone principal de 125B peut paraître grand sur le papier, mais le modèle n’active que 6B de paramètres par jeton et ajoute de la capacité via des embeddings N-gram de type recherche. QSA, le résidu à portes, un routage MoE ultra clairsemé et une conception de service orientée long contexte poussent tous dans la même direction : offrir des capacités de codage agentique et multimodales sans le coût d’inférence d’un modèle phare.
Les résultats de sortie sont particulièrement convaincants pour l’ingénierie logicielle, les agents bureautiques, l’usage d’outils et les workflows visuels. En même temps, le modèle n’est pas uniformément supérieur : DeepSeek V4 Flash gagne au moins un benchmark de génération de dépôt dans le tableau de Qwen, Claude Opus 4.6 reste plus fort sur HLE, et Qwen3.8-Max demeure le palier Qwen à plus haute capacité.
Pour les développeurs, l’étape la plus pratique est d’évaluer Qwen3.8-Flash sur des tâches réelles et de comparer le coût par résultat accepté face à Gemini 3.7 Flash, DeepSeek V4 Flash et les modèles premium de votre stack de routage. CometAPI fournit une interface compatible OpenAI pour ce type de tests et de déploiements multi-modèles.
