TL;DR Qwen 3.8 Max coûte 2 $ par 1 million de jetons d’entrée et 6 $ par 1 million de jetons de sortie sur QwenCloud. Les tarifs de cache spécifiques au modèle sont de 0,25 $/M pour les entrées mises en cache implicitement, 2,50 $/M pour la création explicite de cache, et 0,17 $/M pour les lectures explicites de cache.
Les mêmes tarifs standard par jeton s’appliquent sur toute la fenêtre de contexte de 1M de jetons prise en charge par le modèle. Les invites plus volumineuses coûtent davantage parce qu’elles contiennent plus de jetons, et non parce qu’elles entrent dans un palier de tarification long contexte supérieur.
Au prix catalogue, Qwen 3.8 Max est 20 % moins cher que Qwen 3.7 Max. Toutefois, Qwen 3.7 Max est moins cher tant que sa promotion actuelle à 50 % reste active. Le meilleur choix en production dépend du coût par tâche acceptée, incluant le raisonnement, les taux de cache, les outils, les retentatives, la latence et la relecture humaine.
Aperçu des tarifs de l’API Qwen 3.8 Max
| Élément | Valeur officielle actuelle |
|---|---|
| ID du modèle de production | qwen3.8-max |
| Date de sortie officielle | August 3, 2026 |
| Architecture | 2.4T total parameters; 95B active parameters |
| Prix standard d’entrée | $2 / 1M tokens |
| Prix standard de sortie | $6 / 1M tokens |
| Entrée mise en cache implicite | $0.25 / 1M tokens |
| Création explicite de cache | $2.50 / 1M tokens |
| Lecture explicite de cache | $0.17 / 1M tokens |
| Fenêtre de contexte | 1M tokens |
| Entrée maximale | 991K without thinking; 983K with thinking |
| Sortie maximale | 131K |
| Raisonnement maximal | 262K |
| Modalités d’entrée | Text, image, and video |
| Modalité de sortie | Text |
| Limites de référence QwenCloud | 2M TPM and 15K RPM |
La page modèle QwenCloud est la source la plus directe pour l’ID de modèle actuel, les prix, les tarifs de cache, les limites de contexte et les modalités. Les quotas spécifiques au compte et à la région peuvent différer ; utilisez donc les limites affichées dans votre propre console lors de la définition de la concurrence en production.
La version de production remplace également l’identifiant de préversion par qwen3.8-max et ajoute une grille tarifaire complète spécifique au modèle. La documentation de lancement de Qwen décrit des réglages d’effort de raisonnement low, medium et xhigh, mais le comportement en production doit être vérifié par rapport à l’endpoint et à la référence API que vous utilisez réellement.
Note sensible au temps : Qwen a annoncé que des poids ouverts suivraient la mise à disposition via l’API. Au 4 août 2026, ne décrivez pas Qwen 3.8 Max comme téléchargeable ou auto‑hébergeable tant qu’un checkpoint officiel et sa licence ne sont pas publiés.
Fonctionnement des tarifs de Qwen 3.8 Max
QwenCloud indique actuellement un tarif standard unique de 2 $ par 1 M de jetons d’entrée et 6 $ par 1 M de jetons de sortie sur l’ensemble de la fenêtre de contexte de 1M de jetons de Qwen 3.8 Max. La capture officielle ci-dessous a été réalisée le 4 août 2026 ; consultez toujours la page modèle en ligne avant de prendre des décisions budgétaires de production.

Source : QwenCloud, « Qwen3.8-Max » official
| Élément de facturation | Prix par 1M de jetons | Quand il s’applique |
|---|---|---|
| Entrée standard | $2.00 | Nouveau contenu de prompt, définitions d’outils et contexte non mis en cache |
| Sortie standard | $6.00 | Sortie générée et usage de raisonnement facturé |
| Frappe de cache implicite | $0.25 | Préfixes d’invite réutilisés automatiquement ; non garanti |
| Création de cache explicite | $2.50 | Création d’un préfixe d’invite réutilisable marqué |
| Lecture de cache explicite | $0.17 | Réutilisation d’un bloc de cache explicite valide |
Une requête de 900K jetons coûte donc plus qu’une requête de 100K jetons parce qu’elle traite neuf fois plus de jetons d’entrée — et non parce qu’elle franchit un palier de prix supérieur.
Le raisonnement peut augmenter le coût de sortie
Une réponse visible courte n’est pas toujours une réponse à faible coût. Les appels avec raisonnement peuvent générer des jetons de raisonnement supplémentaires ; les estimations de production doivent donc utiliser les champs d’usage renvoyés par l’API plutôt que la longueur visible de la réponse.
Lorsque votre endpoint prend en charge des contrôles de raisonnement pour qwen3.8-max, comparez les réglages disponibles sur le même jeu d’évaluation. N’assumez pas que les valeurs par défaut de la préversion sont reconduites dans le modèle GA.
Les économies liées au cache dépendent de la stabilité des invites
La page du modèle Qwen 3.8 Max publie des tarifs de cache spécifiques au modèle. Utilisez ces tarifs — et non des ratios de cache génériques — lors de l’estimation des dépenses.
Les entrées de cache explicite ont une période de validité de cinq minutes, et une frappe réussie réinitialise cette période. La mise en cache est automatique en implicite, mais une frappe n’est pas garantie. Le cache est surtout utile lorsque les invites système, définitions d’outils, contexte de dépôt ou documents volumineux restent stables au fil d’appels fréquents.
Les outils intégrés génèrent des frais distincts
QwenCloud indique actuellement les frais d’outils suivants en plus de l’usage de jetons :
| Outil intégré | Frais actuels |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | Free for a limited time |
| Code Interpreter | Free for a limited time |
Le Function calling et MCP n’ont pas de frais d’outils séparés, mais les descriptions d’outils comptent toujours comme des jetons d’entrée. Les promotions d’outils gratuits peuvent évoluer ; consultez le guide des tarifs QwenCloud avant de finaliser un budget de production.
Par exemple, une requête avec 20K jetons d’entrée, 2K jetons de sortie et deux appels Web Search coûte approximativement :
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Dans cet exemple, les deux appels de recherche représentent environ 27,8 % du coût total de la requête.
Exemples de coûts réels pour Qwen 3.8 Max
Ces exemples utilisent les tarifs spécifiques au modèle actuellement publiés sur QwenCloud. Ils excluent les taxes, retentatives, bascules et majorations spécifiques aux fournisseurs.
Exemple 1 : Requête d’agent moyenne
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Une première tentative réussie coûte environ 0,13 $. Une retentative complète porterait le coût du modèle à environ 0,26 $.
Exemple 2 : Analyse de long document
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Le modèle n’applique pas de surtaxe distincte pour long contexte sur sa grille tarifaire actuelle, mais des invites volumineuses engendrent tout de même un coût absolu important.
Exemple 3 : Session d’agent mise en cache
Supposez un préfixe réutilisable de 100K jetons, 10K nouveaux jetons d’entrée, 5K jetons de sortie, et 50 appels pendant que le cache explicite reste valide :
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Économie estimée = $8.917, soit 71,3 %
L’économie estimée dépend des frappes de cache réussies et d’un préfixe stable. De longs intervalles ou des modifications fréquentes des invites système et des schémas d’outils réduiront l’avantage.
Qwen 3.8 Max vs Qwen 3.7 Max:Comparaison des tarifs
Qwen 3.8 Max est 20 % moins cher que Qwen 3.7 Max au prix catalogue, mais Qwen 3.7 Max est 37,5 % moins cher tant que sa promotion actuelle à 50 % est active.
| Modèle et statut tarifaire | Entrée / 1M | Sortie / 1M | Contexte |
|---|---|---|---|
| qwen3.8-max standard price | $2.00 | $6.00 | 1M |
| qwen3.7-max list price | $2.50 | $7.50 | 1M |
| qwen3.7-max current promotion | $1.25 | $3.75 | 1M |
Gardez la page modèle CometAPI Qwen3.7 Max à portée comme solution de repli pendant les tests du nouveau modèle.
Le prix par jeton n’est qu’une partie de la décision. Qwen 3.8 Max peut rester plus économique s’il améliore le taux de réussite au premier essai, utilise mieux les outils, réduit les retentatives ou nécessite moins de corrections humaines.
Utilisez cette métrique de production :
Coût par tâche acceptée =
(jetons du modèle + appels d’outils + retentatives + dépenses de bascule + coût de relecture)
÷ sorties acceptées
Les gains de benchmarks rapportés par le fournisseur sont une raison de retester les flux de travail exigeants en codage et professionnels, pas une preuve que toutes les charges Qwen 3.7 doivent migrer.
Comment migrer vers Qwen 3.8 Max
Changer la chaîne de modèle est nécessaire, mais ce n’est pas une migration de production complète.
1. Tester l’ID du modèle de production
Remplacez l’identifiant de préversion par qwen3.8-max dans un environnement de test. N’assumez pas que les alias de préversion, les valeurs par défaut, la latence ou le comportement de réponse resteront inchangés.
Une requête minimale compatible OpenAI peut ressembler à ceci :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Commencez avec la requête minimale documentée. Ajoutez des contrôles de raisonnement uniquement lorsque la référence API actuelle de votre endpoint les prend explicitement en charge.
2. Réétalonner la télémétrie de coût et de performance
Enregistrez au moins :
- jetons d’entrée, de sortie et de raisonnement
- frappes de cache et jetons de création de cache
- temps jusqu’au premier jeton et latence totale
- appels d’outils, retentatives et bascules
- sorties acceptées versus rejetées
- temps de correction humaine
3. Retester l’interface utilisée par votre application
Validez les événements de streaming, les charges utiles multimodales, les schémas d’outils, la sortie structurée, les motifs de fin, les champs d’usage, la gestion des erreurs et le comportement multi‑tours. La page modèle de production documente l’accès DashScope et compatible OpenAI ; vérifiez toute couche de compatibilité additionnelle avant de vous y fier.
4. Respecter les limites de contexte pratiques
Une fenêtre de contexte de 1M n’est pas la même chose qu’une invite utilisateur de 1M jetons. QwenCloud indique un maximum d’entrée de 991K sans raisonnement et 983K avec raisonnement. Ajoutez une marge de sécurité pour que la requête dispose encore d’espace pour la sortie et le raisonnement.
5. Exécuter Qwen 3.7 et Qwen 3.8 en parallèle
Utilisez des invites, outils, validateurs, règles de retentative et jeux de données identiques. Comparez le coût par tâche acceptée et la latence plutôt que de juger des réponses isolées à l’œil.
Comment évaluer et router Qwen 3.8 Max
Utilisez des charges réelles plutôt que des moyennes de benchmarks générales.
| Charge de travail | Tâches suggérées | Signal principal d’acceptation |
|---|---|---|
| Codage de dépôt | 4 | Les tests passent sans correctif humain |
| Analyse de long document | 3 | Les affirmations sont étayées par les preuves fournies |
| Analyse multimodale | 2 | Les détails d’image ou de vidéo pertinents sont utilisés correctement |
| Agents utilisant des outils | 3 | Bonne sélection d’outil et arguments valides |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Utilisez Qwen 3.8 Max pour les travaux de dépôt difficiles, les agents à long horizon, l’analyse multimodale et les flux où Qwen 3.7 échoue aux tests d’acceptation. Conservez Qwen 3.7 Max lorsque la promotion réduit sensiblement le coût et que le modèle existant atteint déjà votre cible qualité.
Consultez la page des tarifs CometAPI et les informations de routage en direct avant de figer des seuils, car la disponibilité fournisseur et la tarification routée peuvent évoluer indépendamment du prix affiché directement par QwenCloud. Le CometAPI Cookbook peut vous aider à bâtir des requêtes reproductibles et un harnais d’évaluation cohérent.
FAQ
Combien coûte l’API Qwen 3.8 Max ?
QwenCloud indique actuellement Qwen 3.8 Max à 2 $ par 1 million de jetons d’entrée et 6 $ par 1 million de jetons de sortie. L’usage du cache et les outils intégrés ont des tarifs distincts.
Qwen 3.8 Max coûte‑t‑il plus cher au‑delà de 128K jetons ?
Aucun palier long contexte séparé n’apparaît sur la grille tarifaire spécifique au modèle actuelle. Les requêtes longues coûtent plus cher parce qu’elles contiennent plus de jetons, pas parce qu’elles franchissent un palier de prix unitaire supérieur.
Les jetons de raisonnement de Qwen 3.8 Max sont‑ils facturés ?
Le raisonnement peut augmenter l’usage généré et le coût total. Utilisez les champs de jetons de raisonnement et de sortie renvoyés par l’endpoint plutôt que d’estimer à partir de la réponse visible.
Qwen 3.8 Max est‑il open source ?
Qwen a annoncé que des poids ouverts suivraient la mise à disposition via l’API. Ne décrivez pas le modèle comme téléchargeable ou auto‑hébergeable tant qu’un checkpoint officiel et sa licence ne sont pas disponibles.
Les utilisateurs de Qwen 3.7 Max doivent‑ils migrer immédiatement ?
Pas automatiquement. Qwen 3.8 Max a un prix catalogue inférieur, tandis que Qwen 3.7 Max est moins cher durant sa promotion actuelle. Migrez lorsque vos propres données de qualité, latence, comportement du cache et coût par tâche acceptée appuient le changement.
Tester Qwen 3.8 Max avec CometAPI
Utilisez le Quickstart CometAPI pour configurer un client compatible OpenAI. Avant d’envoyer du trafic de production, confirmez que qwen3.8-max est actif dans votre compte et vérifiez le prix routé affiché à cet endroit.
Comparez‑le à votre référence Qwen 3.7 avec des invites, validateurs, politiques de retentative et télémétrie identiques. Cela garde l’évaluation centrée sur le modèle plutôt que sur des changements dans le harnais de test.
