GPT-5.6 Luna price down 80%, Terra down 20% →

Tarification de l'API Qwen 3.8 Max: $2 Entrée, $6 Sortie, 1M Contexte

CometAPI
Mia MarenAug 4, 2026
Tarification de l'API Qwen 3.8 Max: $2 Entrée, $6 Sortie, 1M Contexte

Tarification de l’API Qwen 3.8 Max : 2 $ en entrée, 6 $ en sortie, contexte 1M

TL;DR

Qwen 3.8 Max coûte 2 $ par 1 million de jetons d’entrée et 6 $ par 1 million de jetons de sortie sur QwenCloud. Les tarifs de cache spécifiques au modèle sont de 0,25 $/M pour l’entrée mise en cache implicitement, 2,50 $/M pour la création explicite de cache et 0,17 $/M pour les lectures explicites de cache.

Les mêmes tarifs standard s’appliquent sur la fenêtre de contexte de 1M de jetons prise en charge par le modèle. Les invites plus volumineuses coûtent davantage parce qu’elles contiennent plus de jetons, et non parce qu’elles entrent dans un palier de tarification long-contexte supérieur.

Au prix catalogue, Qwen 3.8 Max est 20 % moins cher que Qwen 3.7 Max. Cependant, Qwen 3.7 Max reste moins cher tant que sa promotion actuelle de 50 % est active. Le meilleur choix en production dépend du coût par tâche acceptée, incluant le raisonnement, les hits de cache, les outils, les retries, la latence et la relecture humaine.

Tarification de l’API Qwen 3.8 Max en un coup d’œil

ÉlémentValeur officielle actuelle
ID du modèle de productionqwen3.8-max
Date de sortie officielleAugust 3, 2026
Architecture2.4T total parameters; 95B active parameters
Prix standard en entrée$2 / 1M tokens
Prix standard en sortie$6 / 1M tokens
Entrée mise en cache implicite$0.25 / 1M tokens
Création de cache explicite$2.50 / 1M tokens
Lecture de cache explicite$0.17 / 1M tokens
Fenêtre de contexte1M tokens
Entrée maximale991K sans raisonnement ; 983K avec raisonnement
Sortie maximale131K
Raisonnement maximal262K
Modalités d’entréeText, image, and video
Modalité de sortieText
Limites de référence QwenCloud2M TPM and 15K RPM

La page du modèle sur QwenCloud est la source la plus directe pour l’ID de modèle, la tarification, les taux de cache, les limites de contexte et les modalités actuels. Les quotas peuvent varier selon le compte et la région ; utilisez les limites affichées dans votre propre console pour définir la concurrence en production.

La version de production remplace également l’identifiant de préversion par qwen3.8-max et ajoute une grille tarifaire spécifique au modèle. Les documents de lancement de Qwen décrivent des réglages d’effort de raisonnement low, medium et xhigh, mais le comportement en production doit être vérifié par rapport au point de terminaison et à la référence API que vous utilisez réellement.

Note liée au calendrier : Qwen a annoncé que des poids ouverts suivraient la mise à disposition de l’API. Au 4 août 2026, ne décrivez pas Qwen 3.8 Max comme téléchargeable ou auto‑hébergeable tant qu’un checkpoint officiel et sa licence ne sont pas publiés.

Comment fonctionne la tarification de Qwen 3.8 Max

QwenCloud indique actuellement un tarif standard forfaitaire de 2 $ par 1M de jetons d’entrée et 6 $ par 1M de jetons de sortie sur l’ensemble de la fenêtre de contexte de 1M de jetons prise en charge par Qwen 3.8 Max. L’instantané tarifaire officiel ci-dessous a été capturé le 4 août 2026 ; vérifiez toujours la page du modèle en direct avant de prendre des décisions budgétaires pour la production.

Tarification de l'API Qwen 3.8 Max: $2 Entrée, $6 Sortie, 1M Contexte

Source*** :*** QwenCloud, « Qwen3.8-Max » officiel

Élément de facturationPrix par 1M de jetonsQuand il s’applique
Entrée standard$2.00Nouveau contenu d’invite, définitions d’outils et contexte non mis en cache
Sortie standard$6.00Sortie générée et usage de raisonnement facturé
Cache implicite (hit)$0.25Préfixes d’invite réutilisés automatiquement ; les hits ne sont pas garantis
Création de cache explicite$2.50Création d’un préfixe d’invite réutilisable marqué
Lecture de cache explicite$0.17Réutilisation d’un bloc de cache explicite valide

Une requête de 900K jetons coûte donc davantage qu’une requête de 100K jetons parce qu’elle traite neuf fois plus de jetons d’entrée — et non parce qu’elle franchit un palier tarifaire plus élevé.

Le raisonnement peut augmenter le coût de sortie

Une réponse visible courte n’est pas toujours une réponse à faible coût. Les appels avec raisonnement peuvent générer des jetons de raisonnement supplémentaires ; les estimations de production doivent donc utiliser les champs d’usage renvoyés par l’API plutôt que la longueur de la réponse visible.

Lorsque votre point de terminaison prend en charge des contrôles de raisonnement pour qwen3.8-max, comparez les réglages disponibles sur le même jeu d’évaluation. N’assumez pas que les valeurs par défaut de préversion s’appliquent au modèle GA.

Les économies de cache dépendent de la stabilité de l’invite

La page du modèle Qwen 3.8 Max publie des taux de cache spécifiques au modèle. Utilisez ces taux — et non des ratios de cache génériques — pour estimer la dépense.

Les entrées explicites de cache ont une période de validité de cinq minutes, et un hit réussi réinitialise cette période. Le cache implicite est automatique, mais un hit n’est pas garanti. Le cache est le plus utile lorsque les invites système, définitions d’outils, contexte de référentiel ou documents volumineux restent stables sur des appels fréquents.

Les outils intégrés entraînent des frais distincts

QwenCloud indique actuellement les frais d’outils suivants en plus de l’usage de jetons :

Outil intégréFrais actuels
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web ExtractorGratuit pour une durée limitée
Code InterpreterGratuit pour une durée limitée

Les appels de fonctions et MCP n’ont pas de frais d’outil séparés, mais les descriptions d’outils comptent toujours comme des jetons d’entrée. Les promotions gratuites d’outils peuvent évoluer ; vérifiez le guide tarifaire QwenCloud avant de finaliser un budget de production.

Par exemple, une requête avec 20K jetons d’entrée, 2K jetons de sortie et deux appels Web Search coûte approximativement :

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Dans cet exemple, les deux appels de recherche représentent environ 27,8 % du coût total de la requête.

Exemples de coûts réels pour Qwen 3.8 Max

Ces exemples utilisent les tarifs spécifiques au modèle actuels de QwenCloud. Ils excluent les taxes, retries, bascules et marges spécifiques aux fournisseurs.

Exemple 1 : Requête d’agent de taille moyenne

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Une première tentative réussie coûte environ 0,13 $. Un retry complet porterait le coût du modèle à environ 0,26 $.

Exemple 2 : Analyse de document long

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Le modèle n’applique pas de surcharge séparée pour long contexte sur sa grille tarifaire actuelle, mais les invites volumineuses entraînent tout de même un coût absolu substantiel.

Exemple 3 : Session d’agent avec cache

Supposons un préfixe réutilisable de 100K jetons, 10K nouveaux jetons d’entrée, 5K jetons de sortie, et 50 appels pendant que le cache explicite reste valide :

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Économie estimée = 8,917 $, soit 71,3 %

L’économie estimée dépend de hits de cache réussis et d’un préfixe stable. De longs intervalles ou des changements fréquents aux invites système et schémas d’outils réduiront le bénéfice.

Qwen 3.8 Max vs Qwen 3.7 Max : comparaison des prix

Qwen 3.8 Max est 20 % moins cher que Qwen 3.7 Max au prix catalogue, mais Qwen 3.7 Max est 37,5 % moins cher tant que sa promotion actuelle de 50 % est active.

Modèle et statut de tarificationEntrée / 1MSortie / 1MContexte
qwen3.8-max prix standard$2.00$6.001M
qwen3.7-max prix catalogue$2.50$7.501M
qwen3.7-max promotion en cours$1.25$3.751M

Conservez la page du modèle Qwen3.7 Max sur CometAPI comme solution de repli pendant vos tests du nouveau modèle.

Le prix par jeton n’est qu’une partie de la décision. Qwen 3.8 Max peut rester plus économique s’il améliore la réussite au premier essai, utilise les outils plus de manière fiable, réduit les retries ou nécessite moins de corrections humaines.

Utilisez cette métrique de production :

Coût par tâche acceptée =

(jetons du modèle + appels d’outils + retries + dépenses de bascule + coût de relecture)

÷ sorties acceptées

Les gains de benchmarks rapportés par le fournisseur sont une raison de retester les tâches exigeantes de codage et de workflows professionnels, pas une preuve que toutes les charges Qwen 3.7 doivent migrer.

Comment migrer vers Qwen 3.8 Max

Changer la chaîne du modèle est nécessaire, mais ce n’est pas une migration de production complète.

1. Tester l’ID du modèle de production

Remplacez l’identifiant de préversion par qwen3.8-max dans un environnement de test. N’assumez pas que les alias, valeurs par défaut, latences ou comportements de réponse de préversion resteront inchangés.

Une requête minimale compatible OpenAI peut ressembler à ceci :

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Commencez avec la requête minimale documentée. Ajoutez des contrôles de raisonnement uniquement lorsque la référence API actuelle de votre point de terminaison les prend explicitement en charge.

2. Recalibrer la télémétrie de coût et de performance

Enregistrez au moins :

  • jetons d’entrée, de sortie et de raisonnement
  • hits de cache et jetons de création de cache
  • temps jusqu’au premier jeton et latence totale
  • appels d’outils, retries et bascules
  • sorties acceptées versus rejetées
  • temps de correction humaine

3. Retester l’interface utilisée par votre application

Validez les événements de streaming, les charges utiles multimodales, les schémas d’outils, la sortie structurée, les motifs de fin, les champs d’usage, la gestion des erreurs et le comportement multi‑tours. La page du modèle de production documente les accès DashScope et compatibles OpenAI ; vérifiez toute couche de compatibilité supplémentaire avant de vous y fier.

4. Respecter les limites pratiques de contexte

Une fenêtre de contexte de 1M n’est pas la même chose qu’une invite utilisateur de 1M de jetons. QwenCloud indique une entrée maximale de 991K sans raisonnement et de 983K avec raisonnement. Ajoutez une marge de sécurité afin que la requête conserve de la place pour la sortie et le raisonnement.

5. Exécuter Qwen 3.7 et Qwen 3.8 en parallèle

Utilisez des invites, outils, validateurs, règles de retry et jeux de données identiques. Comparez le coût par tâche acceptée et la latence plutôt que de juger des réponses isolées à l’œil nu.

Comment évaluer et router Qwen 3.8 Max

Utilisez des charges réelles plutôt que des moyennes de benchmarks générales.

Charge de travailTâches suggéréesSignal d’acceptation principal
Codage de référentiel4Les tests passent sans correctif humain
Analyse de documents longs3Les affirmations sont étayées par les preuves fournies
Analyse multimodale2Détails d’image ou de vidéo utilisés correctement
Agents utilisant des outils3Sélection d’outil correcte et arguments valides
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Utilisez Qwen 3.8 Max pour le travail de référentiel difficile, les agents à long horizon, l’analyse multimodale et les workflows où Qwen 3.7 échoue aux tests d’acceptation. Conservez Qwen 3.7 Max lorsque la promotion réduit sensiblement le coût et que le modèle existant atteint déjà votre cible de qualité.

Consultez la page de tarification CometAPI et les informations de routage en direct avant de figer des seuils, car la disponibilité du fournisseur et la tarification routée peuvent évoluer indépendamment du prix direct de QwenCloud. Le CometAPI Cookbook peut vous aider à construire des requêtes reproductibles et un harnais d’évaluation cohérent.

FAQ

Combien coûte l’API Qwen 3.8 Max ?

QwenCloud indique actuellement Qwen 3.8 Max à 2 $ par 1 million de jetons d’entrée et 6 $ par 1 million de jetons de sortie. L’usage du cache et les outils intégrés ont des tarifs distincts.

Qwen 3.8 Max coûte‑t‑il plus cher au‑delà de 128K jetons ?

Aucun palier long‑contexte séparé n’apparaît sur la grille tarifaire spécifique au modèle actuelle. Les requêtes longues coûtent davantage parce qu’elles contiennent plus de jetons, et non parce qu’elles franchissent un palier de prix unitaire supérieur.

Les jetons de raisonnement de Qwen 3.8 Max sont‑ils facturés ?

Le raisonnement peut augmenter l’usage généré et le coût total. Utilisez les champs de jetons de raisonnement et de sortie renvoyés par le point de terminaison plutôt que d’estimer à partir de la réponse visible.

Qwen 3.8 Max est‑il open source ?

Qwen a annoncé que des poids ouverts suivraient la mise à disposition de l’API. Ne décrivez pas le modèle comme téléchargeable ou auto‑hébergeable tant qu’un checkpoint officiel et sa licence ne sont pas disponibles.

Les utilisateurs de Qwen 3.7 Max doivent‑ils migrer immédiatement ?

Pas automatiquement. Qwen 3.8 Max a un prix catalogue plus bas, tandis que Qwen 3.7 Max est moins cher pendant sa promotion actuelle. Migrez lorsque vos propres données de qualité, latence, comportement du cache et coût par tâche acceptée soutiennent le changement.

Tester Qwen 3.8 Max avec CometAPI

Utilisez le Quickstart CometAPI pour configurer un client compatible OpenAI. Avant d’envoyer du trafic de production, confirmez que qwen3.8-max est actif dans votre compte et vérifiez le prix routé affiché à cet endroit.

Comparez‑le à votre base Qwen 3.7 avec des invites, validateurs, politiques de retry et télémétrie identiques. Cela permet de concentrer l’évaluation sur le modèle plutôt que sur des changements dans le banc d’essai.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus