DeepSeek Vision and Grok Imagine models are now live on CometAPI →
new/CometAPI-forskning

Qwen 3.8 Max API-priser: $2 inndata, $6 utdata, 1M kontekst

Qwen 3.8 Max koster $2/M for inndata og $6/M for utdata. Sammenlign cache-gebyrer, verktøykostnader, konkrete eksempler, begrensninger og råd for migrering fra Qwen 3.7.

CometAPI
Mia MarenForskerteam for AI-modeller og API
Oppdatert Aug 24, 2026 9 min lesetid
Qwen 3.8 Max API-priser: $2 inndata, $6 utdata, 1M kontekst
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max koster $2 per 1 million inndatatokener og $6 per 1 million utdatotokener på QwenCloud. Modellspecifikke cache-satser er $0.25/M for implisitt bufret inndata, $2.50/M for eksplisitt cache-opprettelse, og $0.17/M for eksplisitt cache-lesing.

De samme standardsatsene per token gjelder på tvers av modellens støttede 1M-token kontekstvindu. Større forespørsler koster mer fordi de inneholder flere tokener, ikke fordi de går over i et høyere pristrinn for lang kontekst.

Til listepris er Qwen 3.8 Max 20% billigere enn Qwen 3.7 Max. Men Qwen 3.7 Max er billigere så lenge dens nåværende 50%‑kampanje er aktiv. Det beste valget i produksjon avhenger av kostnad per godkjent oppgave, inkludert resonnering, cache‑treff, verktøy, nye forsøk, ventetid og menneskelig gjennomgang.

Qwen 3.8 Max API‑priser i kortform

ElementGjeldende offisiell verdi
Produksjons‑model‑IDqwen3.8-max
Offisiell lanseringsdatoAugust 3, 2026
Arkitektur2.4T totale parametere; 95B aktive parametere
Standard pris inndata$2 / 1M tokens
Standard pris utdata$6 / 1M tokens
Implisitt bufret inndata$0.25 / 1M tokens
Eksplisitt cache‑opprettelse$2.50 / 1M tokens
Eksplisitt cache‑lesing$0.17 / 1M tokens
Kontekstvindu1M tokens
Maksimal inndata991K uten tenking; 983K med tenking
Maksimal utdata131K
Maksimal resonnering262K
InndatamodaliteterTekst, bilde og video
UtdatamodalitetTekst
QwenCloud referansegrenser2M TPM og 15K RPM

QwenCloud‑modellsiden er den mest direkte kilden for gjeldende model‑ID, priser, cache‑satser, kontekstgrenser og modaliteter. Konto‑ og regionsspesifikke kvoter kan avvike, så bruk grensene som vises i din egen konsoll når du setter produksjonskonkurrens.

Produksjonslanseringen erstatter også forhåndsvisningsidentifikatoren med qwen3.8-max og legger til et komplett modellspesifikt prisark. Qwens lanseringsmateriale beskriver innstillingene low, medium og xhigh for resonneringsinnsats, men produksjonsatferd bør verifiseres mot endepunktet og API‑referansen du faktisk bruker.

Tidskritisk merknad: Qwen annonserte at åpne vekter vil følge API‑utgivelsen. Per 4. august 2026, ikke beskriv Qwen 3.8 Max som nedlastbar eller selv‑hostbar før en offisiell sjekkpunkt‑fil og lisens er publisert.

Hvordan prisingen for Qwen 3.8 Max fungerer

QwenCloud viser for tiden en flat standardpris på $2 per 1M inndatatokener og $6 per 1M utdatotokener på tvers av Qwen 3.8 Max’ støttede 1M‑token kontekstvindu. Det offisielle prisbildet nedenfor ble tatt 4. august 2026; sjekk alltid den levende modellsiden før du tar budsjettbeslutninger for produksjon.

Qwen 3.8 Max API-priser: $2 inndata, $6 utdata, 1M kontekst

Kilde***:*** QwenCloud, “Qwen3.8-Max” offisiell

FaktureringspostPris per 1M tokensNår den gjelder
Standard inndata$2.00Nytt prompt‑innhold, verktøydefinisjoner og ikke‑bufret kontekst
Standard utdata$6.00Generert utdata og fakturert resonneringsbruk
Implisitt cache‑treff$0.25Automatisk gjenbrukte prompt‑prefikser; treff er ikke garantert
Eksplisitt cache‑opprettelse$2.50Opprettelse av et markert gjenbrukbart prompt‑prefiks
Eksplisitt cache‑lesing$0.17Gjenbruk av en gyldig eksplisitt cache‑blokk

En forespørsel på 900K tokener koster derfor mer enn en forespørsel på 100K tokener fordi den behandler ni ganger så mange inndatatokener—ikke fordi den passerer inn i et høyere pristrinn.

Resonnering kan øke utdatakostnaden

Et kort synlig svar er ikke alltid et lavkostsvar. Kall med resonnering kan generere ekstra resonneringstokener, så produksjonsestimater bør bruke bruksfeltene som returneres av API‑et fremfor lengden på det synlige svaret.

Der endepunktet ditt støtter resonneringskontroller for qwen3.8-max, sammenlign tilgjengelige innstillinger på samme evalueringssett. Ikke anta at forhåndsvisningsstandarder videreføres til GA‑modellen.

Cache‑besparelser avhenger av prompt‑stabilitet

Qwen 3.8 Max’ modellsiden publiserer modellspesifikke cache‑satser. Bruk disse satsene—ikke generiske cache‑forhold—når du estimerer forbruk.

Eksplisitte cache‑oppføringer har fem minutters gyldighetsperiode, og et vellykket treff tilbakestiller perioden. Implisitt cache er automatisk, men et treff er ikke garantert. Caching er mest nyttig når systemprompter, verktøydefinisjoner, repository‑kontekst eller store dokumenter forblir stabile på tvers av hyppige kall.

Innebygde verktøy medfører separate kostnader

QwenCloud viser for tiden følgende verktøygebyrer i tillegg til tokenbruk:

Innebygd verktøyGjeldende gebyr
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web ExtractorGratis i en begrenset periode
Code InterpreterGratis i en begrenset periode

Funksjonskall og MCP har ikke egne verktøygebyrer, men verktøybeskrivelser teller fortsatt som inndatatokener. Gratis kampanjer for verktøy kan endres, så sjekk QwenClouds prisveiledning før du ferdigstiller et produksjonsbudsjett.

For eksempel koster en forespørsel med 20K inndatatokener, 2K utdatatokener og to Web Search‑kall omtrent:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

I dette eksempelet står de to søkekallene for omtrent 27,8% av den totale forespørselkostnaden.

Qwen 3.8 Max: Kostnadseksempler fra virkeligheten

Disse eksemplene bruker gjeldende modellspesifikke satser på QwenCloud. De ekskluderer skatter, nye forsøk, fallbacks og leverandørspesifikke påslag.

Eksempel 1: Middels agentforespørsel

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Et vellykket første forsøk koster omtrent $0.13. Ett fullt nytt forsøk vil øke modellkostnaden til omtrent $0.26.

Eksempel 2: Langdokument‑analyse

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Modellen har ingen separat tilleggsavgift for lang kontekst på sin nåværende prisliste, men store prompter skaper likevel betydelige absolutte kostnader.

Eksempel 3: Bufret agentsesjon

Anta et gjenbrukbart prefiks på 100K tokener, 10K nye inndatatokener, 5K utdatatokener og 50 kall mens den eksplisitte cachen forblir gyldig:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Estimert besparelse = $8.917, eller 71,3%

Den estimerte besparelsen avhenger av vellykkede cache‑treff og et stabilt prefiks. Lange pauser eller hyppige endringer i systemprompter og verktøyskjemaer vil redusere nytten.

Qwen 3.8 Max vs Qwen 3.7 Max: pris‑sammenligning

Qwen 3.8 Max er 20% billigere enn Qwen 3.7 Max til listepris, men Qwen 3.7 Max er 37,5% billigere mens dens nåværende 50%‑kampanje er aktiv.

Modell og prisstatusInndata / 1MUtdata / 1MKontekst
qwen3.8-max standardpris$2.00$6.001M
qwen3.7-max listepris$2.50$7.501M
qwen3.7-max gjeldende kampanje$1.25$3.751M

Hold CometAPI‑siden for Qwen3.7 Max‑modellen tilgjengelig som fallback mens du tester den nye modellen.

Pris per token er bare én del av beslutningen. Qwen 3.8 Max kan likevel være mer økonomisk hvis den forbedrer suksess på første forsøk, bruker verktøy mer pålitelig, reduserer nye forsøk eller krever mindre menneskelig korrigering.

Bruk denne produksjonsmetrikk‑formelen:

Kostnad per godkjent oppgave =

(modelltokener + verktøykall + nye forsøk + fallback‑forbruk + gjennomgangskostnad)

÷ godkjente utdata

Leverandørrapporterte benchmark‑gevinster er en grunn til å reteste krevende kode‑ og profesjonelle arbeidsflyter, ikke bevis på at hver Qwen 3.7‑arbeidslast bør migrere.

Slik migrerer du til Qwen 3.8 Max

Å endre modellstrengen er nødvendig, men det er ikke en fullstendig produksjonsmigrering.

1. Test produksjons‑model‑ID‑en

Bytt ut forhåndsvisningsidentifikatoren med qwen3.8-max i et testmiljø. Ikke anta at forhåndsvisningsaliaser, standarder, ventetid eller responsatferd forblir uendret.

En minimal OpenAI‑kompatibel forespørsel kan se slik ut:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Start med den minimumsdokumenterte forespørselen. Legg til resonneringskontroller bare når den gjeldende API‑referansen for ditt endepunkt eksplisitt støtter dem.

2. Re‑baseline kostnads‑ og ytelsestelemetri

Registrer minst:

  • inndata‑, utdata‑ og resonneringstokener
  • cache‑treff og cache‑opprettelses‑tokener
  • tid til første token og total ventetid
  • verktøykall, nye forsøk og fallbacks
  • godkjente versus avviste utdata
  • tid brukt på menneskelig korrigering

3. Retest grensesnittet applikasjonen din bruker

Valider strømming‑hendelser, multimodale payloads, verktøyskjemaer, strukturert utdata, sluttårsaker, bruksfelter, feilhåndtering og fleromgangs‑atferd. Produksjonsmodellsiden dokumenterer DashScope‑ og OpenAI‑kompatibel tilgang; verifiser eventuell ekstra kompatibilitetslag før du stoler på det.

4. Respekter praktiske kontekstgrenser

Et 1M kontekstvindu er ikke det samme som en 1M‑token brukerprompt. QwenCloud viser maksimal inndata på 991K uten tenking og 983K med tenking. Legg til en sikkerhetsmargin slik at forespørselen fortsatt har plass til utdata og resonnering.

5. Kjør Qwen 3.7 og Qwen 3.8 side om side

Bruk identiske prompter, verktøy, validatorer, regler for nye forsøk og datasett. Sammenlign kostnad per godkjent oppgave og ventetid i stedet for å bedømme isolerte svar på øyemål.

Slik evaluerer og ruter du Qwen 3.8 Max

Bruk reelle arbeidslaster i stedet for brede benchmark‑gjennomsnitt.

ArbeidslastForeslåtte oppgaverPrimært akseptkriterium
Repository‑koding4Tester består uten menneskelig patching
Langdokument‑analyse3Påstander er støttet av oppgitt evidens
Multimodal analyse2Relevante bilde‑ eller videodetaljer brukes korrekt
Verktøy‑brukende agenter3Riktig verktøyvalg og gyldige argumenter
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Bruk Qwen 3.8 Max for vanskelig repository‑arbeid, langhorisont‑agenter, multimodal analyse og arbeidsflyter der Qwen 3.7 feiler aksepttester. Behold Qwen 3.7 Max når kampanjen reduserer kostnaden vesentlig og den eksisterende modellen allerede møter kvalitetsmålet.

Sjekk CometAPI‑prissiden og live ruteinformasjon før du låser terskler, fordi leverandørtilgjengelighet og ruterte priser kan endre seg uavhengig av QwenClouds direkte listepris. CometAPI Cookbook kan hjelpe deg med å bygge repeterbare forespørsler og et konsistent evalueringsrammeverk.

FAQ

Hvor mye koster Qwen 3.8 Max API‑et?

QwenCloud viser for tiden Qwen 3.8 Max til $2 per 1 million inndatatokener og $6 per 1 million utdatatokener. Cache‑bruk og innebygde verktøy har egne satser.

Koster Qwen 3.8 Max mer over 128K tokener?

Ingen separat pristrinn for lang kontekst vises på den gjeldende modellspesifikke prislisten. Lange forespørsler koster mer fordi de inneholder flere tokener, ikke fordi de går inn i et høyere enhetsprisnivå.

Blir resonneringstokener for Qwen 3.8 Max fakturert?

Resonnering kan øke generert bruk og totalkostnad. Bruk feltene for resonneringstokener og utdatatokener som returneres av endepunktet i stedet for å estimere fra det synlige svaret.

Er Qwen 3.8 Max åpen kildekode?

Qwen annonserte at åpne vekter vil følge API‑utgivelsen. Ikke beskriv modellen som nedlastbar eller selv‑hostbar før en offisiell sjekkpunkt‑fil og lisens er tilgjengelig.

Bør Qwen 3.7 Max‑brukere migrere umiddelbart?

Ikke automatisk. Qwen 3.8 Max har lavere standard listepris, mens Qwen 3.7 Max er billigere under sin nåværende kampanje. Migrer når dine egne data for kvalitet, ventetid, cache‑atferd og kostnad per godkjent oppgave støtter endringen.

Test Qwen 3.8 Max med CometAPI

Bruk CometAPI Quickstart for å konfigurere en OpenAI‑kompatibel klient. Før du sender produksjonstrafikk, bekreft at qwen3.8-max er live i kontoen din og verifiser den ruterte prisen som vises der.

Sammenlign den med din Qwen 3.7‑baseline ved å bruke identiske prompter, validatorer, regler for nye forsøk og telemetri. Dette holder evalueringen fokusert på modellen i stedet for endringer i testriggen.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Aug 4, 2026
Sist oppdatert Aug 24, 2026
130 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Klar til å redusere AI-utviklingskostnadene med 20 %?

Kom i gang gratis på minutter. Gratis prøvekreditter inkludert. Ingen kredittkort nødvendig.

Les mer