TL;DR Qwen 3.8 Max kost op QwenCloud $2 per 1 million input tokens en $6 per 1 million output tokens. Modelspecifieke cacherates zijn $0.25/M voor impliciet gecachte input, $2.50/M voor expliciete cachecreatie, en $0.17/M voor expliciete cache-uitlezing.
Dezelfde standaard tokenprijzen gelden voor het volledige, door het model ondersteunde 1M-token contextvenster. Grotere prompts kosten meer omdat ze meer tokens bevatten, niet omdat ze in een hogere prijstier voor lange context vallen.
Tegen lijstprijs is Qwen 3.8 Max 20% goedkoper dan Qwen 3.7 Max. Qwen 3.7 Max is echter goedkoper zolang de huidige promotie van 50% actief blijft. De betere productie-keuze hangt af van de kosten per geaccepteerde taak, inclusief redeneren, cachehits, tools, retries, latency en menselijke review.
Qwen 3.8 Max API-prijzen in één oogopslag
| Onderdeel | Huidige officiële waarde |
|---|---|
| Productiemodel-ID | qwen3.8-max |
| Officiële releasedatum | August 3, 2026 |
| Architectuur | 2.4T totale parameters; 95B actieve parameters |
| Standaardprijs input | $2 / 1M tokens |
| Standaardprijs output | $6 / 1M tokens |
| Impliciet gecachte input | $0.25 / 1M tokens |
| Expliciete cachecreatie | $2.50 / 1M tokens |
| Expliciete cache-uitlezing | $0.17 / 1M tokens |
| Contextvenster | 1M tokens |
| Maximale input | 991K zonder redeneren; 983K met redeneren |
| Maximale output | 131K |
| Maximale redenering | 262K |
| Invoermodi | Tekst, afbeelding en video |
| Uitvoermodus | Tekst |
| QwenCloud-referentielimieten | 2M TPM and 15K RPM |
De QwenCloud-modelpagina is de meest directe bron voor de huidige model-ID, prijzen, cacherates, contextlimieten en modaliteiten. Account- en regiogebonden quota kunnen verschillen; gebruik de limieten in je eigen console bij het instellen van productieconcurrentie.
De productierelease vervangt ook de previewidentifier door qwen3.8-max en voegt een volledige modelspecifieke prijslijst toe. Qwen’s lanceringmateriaal beschrijft instellingen voor redeneringsinspanning low, medium en xhigh, maar productiegedrag moet worden geverifieerd tegen het endpoint en de API-referentie die je daadwerkelijk gebruikt.
Tijdkritische opmerking: Qwen kondigde aan dat open weights zouden volgen op de API-release. Per August 4, 2026: beschrijf Qwen 3.8 Max niet als downloadbaar of zelf te hosten totdat er een officiële checkpoint en licentie zijn gepubliceerd.
Hoe de prijzen van Qwen 3.8 Max werken
QwenCloud hanteert momenteel een vlak standaardtarief van $2 per 1M input tokens en $6 per 1M output tokens over het door Qwen 3.8 Max ondersteunde contextvenster van 1M tokens. De onderstaande officiële prijssnapshot is vastgelegd op August 4, 2026; controleer altijd de live modelpagina voordat je productiebeslissingen over budget neemt.

Bron***:*** QwenCloud, “Qwen3.8-Max” official
| Factureringsitem | Prijs per 1M tokens | Wanneer van toepassing |
|---|---|---|
| Standaardinput | $2.00 | Nieuwe promptinhoud, tooldefinities en niet-gecachete context |
| Standaardoutput | $6.00 | Gegenereerde output en gefactureerd redeneringsgebruik |
| Impliciete cache-hit | $0.25 | Automatisch hergebruikte promptprefixen; hits niet gegarandeerd |
| Expliciete cachecreatie | $2.50 | Aanmaken van een gemarkeerde herbruikbare promptprefix |
| Expliciete cache-uitlezing | $0.17 | Hergebruiken van een geldige expliciete cacheblok |
Een aanvraag van 900K tokens kost dus meer dan een aanvraag van 100K tokens omdat er negen keer zoveel inputtokens worden verwerkt—niet omdat er een hogere prijstier wordt overschreden.
Redeneren kan de outputkosten verhogen
Een kort zichtbaar antwoord is niet altijd een goedkoop antwoord. Aanroepen met redeneren kunnen extra redeneringstokens genereren, dus productie-inschattingen moeten de gebruiksvelden gebruiken die door de API worden geretourneerd in plaats van de zichtbare responslengte.
Waar je endpoint regelaars voor redeneren ondersteunt voor qwen3.8-max, vergelijk je de beschikbare instellingen op dezelfde evaluatieset. Ga er niet van uit dat previewdefaults doorlopen naar het GA-model.
Cachebesparingen hangen af van promptstabiliteit
De modelpagina van Qwen 3.8 Max publiceert modelspecifieke cacherates. Gebruik die tarieven—niet generieke cacheratio’s—bij het schatten van uitgaven.
Expliciete cache-items hebben een geldigheidsperiode van vijf minuten, en een succesvolle hit reset deze periode. Impliciete caching is automatisch, maar een hit is niet gegarandeerd. Caching is het nuttigst wanneer systeemprompts, tooldefinities, repositorycontext of grote documenten stabiel blijven over frequente aanroepen.
Ingebouwde tools brengen afzonderlijke kosten met zich mee
QwenCloud vermeldt momenteel de volgende toolkosten bovenop tokengebruik:
| Ingebouwde tool | Huidige vergoeding |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | Tijdelijk gratis |
| Code Interpreter | Tijdelijk gratis |
Function calling en MCP hebben geen aparte toolkosten, maar toombeschrijvingen tellen nog steeds mee als inputtokens. Gratis toolpromoties kunnen wijzigen, dus controleer de QwenCloud-prijsgids voordat je een productiebudget vastlegt.
Bijvoorbeeld: een verzoek met 20K inputtokens, 2K outputtokens en twee Web Search-aanroepen kost ongeveer:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
In dit voorbeeld zijn de twee zoekaanroepen goed voor ongeveer 27,8% van de totale verzoekkosten.
Qwen 3.8 Max praktijkvoorbeelden van kosten
Deze voorbeelden gebruiken de huidige modelspecifieke tarieven van QwenCloud. Belastingen, retries, fallbacks en provider-specifieke opslag worden niet meegerekend.
Voorbeeld 1: Gemiddelde agentaanvraag
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Een succesvolle eerste poging kost ongeveer $0.13. Eén volledige retry zou de modelkosten verhogen tot ongeveer $0.26.
Voorbeeld 2: Analyse van lang document
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Het model past geen afzonderlijke toeslag voor lange context toe op de huidige prijslijst, maar grote prompts zorgen wel voor aanzienlijke absolute kosten.
Voorbeeld 3: Gecachte agentsessie
Ga uit van een herbruikbare prefix van 100K tokens, 10K nieuwe inputtokens, 5K outputtokens en 50 aanroepen terwijl de expliciete cache geldig blijft:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Geschatte besparing = $8.917, of 71.3%
De geschatte besparing hangt af van succesvolle cachehits en een stabiele prefix. Lange pauzes of frequente wijzigingen in systeemprompts en toolschema’s zullen het voordeel verminderen.
Qwen 3.8 Max vs Qwen 3.7 Max: prijsvergelijking
Qwen 3.8 Max is 20% goedkoper dan Qwen 3.7 Max tegen lijstprijs, maar Qwen 3.7 Max is 37,5% goedkoper zolang de huidige promotie van 50% actief is.
| Model en prijsstatus | Input / 1M | Output / 1M | Context |
|---|---|---|---|
| qwen3.8-max standaardprijs | $2.00 | $6.00 | 1M |
| qwen3.7-max lijstprijs | $2.50 | $7.50 | 1M |
| qwen3.7-max huidige promotie | $1.25 | $3.75 | 1M |
Houd de CometAPI Qwen3.7 Max-modelpagina beschikbaar als fallback tijdens het testen van het nieuwe model.
Prijs per token is slechts één onderdeel van de beslissing. Qwen 3.8 Max kan nog steeds voordeliger zijn als het de first-pass-succesratio verbetert, tools betrouwbaarder inzet, retries vermindert of minder menselijke correctie vereist.
Gebruik deze productiemetriek:
Kosten per geaccepteerde taak =
(modeltokens + toolaanroepen + retries + fallbackuitgaven + reviewkosten)
÷ geaccepteerde outputs
Door leveranciers gerapporteerde benchmarkwinsten zijn een reden om veeleisende codeer- en professionele workflows opnieuw te testen, geen bewijs dat elke Qwen 3.7-werklast zou moeten migreren.
Hoe migreren naar Qwen 3.8 Max
Het wijzigen van de modelstring is noodzakelijk, maar geen volledige productiemigratie.
1. Test de productiemodel-ID
Vervang de previewidentifier door qwen3.8-max in een testomgeving. Ga er niet van uit dat previewaliassen, defaults, latency of responsgedrag ongewijzigd blijven.
Een minimale OpenAI-compatibele aanvraag kan er zo uitzien:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Begin met de minimaal gedocumenteerde aanvraag. Voeg pas regelaars voor redeneren toe wanneer de huidige API-referentie voor jouw endpoint deze expliciet ondersteunt.
2. Herkalibreer kosten- en prestatietelemetrie
Leg in ieder geval vast:
- input-, output- en redeneringstokens
- cachehits en tokens voor cachecreatie
- time to first token en totale latency
- toolaanroepen, retries en fallbacks
- geaccepteerde versus afgewezen outputs
- tijd voor menselijke correctie
3. Test de interface die jouw applicatie gebruikt opnieuw
Valideer streamingevents, multimodale payloads, toolschema’s, gestructureerde output, finish reasons, gebruiksvelden, foutafhandeling en gedrag over meerdere rondes. De productiemodelpagina documenteert toegang via DashScope en OpenAI-compatibiliteit; verifieer elke extra compatibiliteitslaag voordat je erop vertrouwt.
4. Respecteer de praktische contextlimieten
Een contextvenster van 1M betekent niet hetzelfde als een gebruikersprompt van 1M tokens. QwenCloud vermeldt een maximale input van 991K zonder redeneren en 983K met redeneren. Voeg een veiligheidsmarge toe zodat de aanvraag nog ruimte heeft voor output en redenering.
5. Draai Qwen 3.7 en Qwen 3.8 naast elkaar
Gebruik identieke prompts, tools, validators, retryregels en datasets. Vergelijk kosten per geaccepteerde taak en latency in plaats van geïsoleerde reacties op het oog te beoordelen.
Hoe Qwen 3.8 Max te evalueren en routeren
Gebruik echte werklasten in plaats van brede benchmarkgemiddelden.
| Werklast | Voorgestelde taken | Primair acceptatiesignaal |
|---|---|---|
| Repository-codering | 4 | Tests slagen zonder menselijke patches |
| Analyse van lange documenten | 3 | Claims worden ondersteund door aangeleverd bewijs |
| Multimodale analyse | 2 | Relevante beeld- of videogetails correct gebruikt |
| Agenten die tools gebruiken | 3 | Juiste toolselectie en geldige argumenten |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Gebruik Qwen 3.8 Max voor moeilijke repositorytaken, agents met lange horizon, multimodale analyse en workflows waar Qwen 3.7 niet slaagt voor acceptatietests. Houd Qwen 3.7 Max wanneer de promotie de kosten materieel verlaagt en het bestaande model je kwaliteitstarget al haalt.
Controleer de CometAPI-prijzenpagina en live routeringsinformatie voordat je drempels vastlegt, omdat providerbeschikbaarheid en gerouteerde prijzen onafhankelijk van QwenCloud’s directe lijstprijs kunnen veranderen. De CometAPI Cookbook kan je helpen om reproduceerbare aanvragen en een consistente evaluatieharness te bouwen.
FAQ
Hoeveel kost de Qwen 3.8 Max API?
QwenCloud vermeldt Qwen 3.8 Max momenteel op $2 per 1 miljoen inputtokens en $6 per 1 miljoen outputtokens. Cachegebruik en ingebouwde tools hebben aparte tarieven.
Kost Qwen 3.8 Max meer boven 128K tokens?
Er is geen aparte prijstier voor lange context op de huidige modelspecifieke prijslijst. Lange aanvragen kosten meer omdat ze meer tokens bevatten, niet omdat ze een hogere eenheidsprijstier overschrijden.
Worden redeneringstokens van Qwen 3.8 Max gefactureerd?
Redeneren kan het gegenereerde gebruik en de totale kosten verhogen. Gebruik de velden voor redenerings- en outputtokens die door het endpoint worden geretourneerd in plaats van te schatten op basis van het zichtbare antwoord.
Is Qwen 3.8 Max open source?
Qwen kondigde aan dat open weights zouden volgen op de API-release. Beschrijf het model niet als downloadbaar of zelf te hosten totdat er een officiële checkpoint en licentie beschikbaar zijn.
Moeten gebruikers van Qwen 3.7 Max onmiddellijk migreren?
Niet automatisch. Qwen 3.8 Max heeft een lagere standaardlijstprijs, terwijl Qwen 3.7 Max goedkoper is tijdens de huidige promotie. Migreer wanneer je eigen gegevens over kwaliteit, latency, cachegedrag en kosten per geaccepteerde taak de verandering ondersteunen.
Test Qwen 3.8 Max met CometAPI
Gebruik de CometAPI Quickstart om een OpenAI-compatibele client te configureren. Bevestig voordat je productieverkeer stuurt dat qwen3.8-max live is in je account en verifieer de gerouteerde prijs die daar wordt weergegeven.
Vergelijk het met je Qwen 3.7-baseline met identieke prompts, validators, retrybeleid en telemetrie. Zo blijft de evaluatie gericht op het model in plaats van wijzigingen in de testharnas.
