DeepSeek Vision and Grok Imagine models are now live on CometAPI →
new/CometAPI research

Qwen 3.8 Max API-prissætning: $2 input, $6 output, 1M kontekst

Qwen 3.8 Max koster $2/M input og $6/M output. Sammenlign cachegebyrer, værktøjsomkostninger, konkrete eksempler, begrænsninger og råd om migrering fra Qwen 3.7.

CometAPI
Mia MarenForskningshold for AI-modeller og API
Opdateret Aug 24, 2026 10 min. læsning
Qwen 3.8 Max API-prissætning: $2 input, $6 output, 1M kontekst
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max koster $2 pr. 1 million input-tokens og $6 pr. 1 million output-tokens på QwenCloud. Modelspecifikke cache-satser er $0.25/M for implicit cachet input, $2.50/M for eksplicit cacheoprettelse og $0.17/M for eksplicit cachelæsninger.

De samme standardtokensatser gælder i hele modellens understøttede 1M-token kontekstvindue. Større prompts koster mere, fordi de indeholder flere tokens, ikke fordi de går ind i et højere pristrin for lang kontekst.

Til listepris er Qwen 3.8 Max 20% billigere end Qwen 3.7 Max. Dog er Qwen 3.7 Max billigere, så længe den aktuelle 50%-kampagne er aktiv. Det bedste valg i produktion afhænger af omkostning pr. accepteret opgave, inklusive ræsonnering, cache-træffere, værktøjer, genforsøg, latenstid og menneskelig gennemgang.

Qwen 3.8 Max API-priser i overblik

ElementAktuel officiel værdi
Produktionsmodel-IDqwen3.8-max
Officiel udgivelsesdatoAugust 3, 2026
Arkitektur2.4T samlede parametre; 95B aktive parametre
Standardpris for input$2 / 1M tokens
Standardpris for output$6 / 1M tokens
Implicit cachet input$0.25 / 1M tokens
Eksplicit cacheoprettelse$2.50 / 1M tokens
Eksplicit cachelæsning$0.17 / 1M tokens
Kontekstvindue1M tokens
Maksimalt input991K uden ræsonnering; 983K med ræsonnering
Maksimalt output131K
Maksimal ræsonnering262K
InputmodaliteterTekst, billede og video
OutputmodalitetTekst
QwenCloud-referencegrænser2M TPM og 15K RPM

Siden QwenCloud model page er den mest direkte kilde til det aktuelle model-ID, prissætning, cache-satser, kontekstgrænser og modaliteter. Konto- og regionsspecifikke kvoter kan variere, så brug de grænser, der vises i din egen konsol, når du sætter produktionskonkurrence.

Produktionsudgivelsen erstatter også preview-identifikatoren med qwen3.8-max og tilføjer et komplet modelspecifikt priskort. Qwens lancemateriale beskriver indstillinger for ræsonneringsindsats low, medium og xhigh, men produktionsadfærd bør verificeres mod det endpoint og den API-reference, du faktisk bruger.

Tidsfølsom note: Qwen annoncerede, at åbne vægte ville følge API-udgivelsen. Pr. August 4, 2026 må Qwen 3.8 Max ikke beskrives som downloadbar eller selvhostbar, før et officielt checkpoint og licens er publiceret.

Sådan fungerer prissætningen for Qwen 3.8 Max

QwenCloud viser i øjeblikket en flad standardsats på $2 pr. 1M input-tokens og $6 pr. 1M output-tokens på tværs af Qwen 3.8 Max’ understøttede 1M-token kontekstvindue. Det officielle prissætningssnapshot nedenfor blev taget den August 4, 2026; tjek altid den live modelside, før du træffer produktionsbudgetbeslutninger.

Qwen 3.8 Max API-prissætning: $2 input, $6 output, 1M kontekst

Kilde***:*** QwenCloud, “Qwen3.8-Max” official

FaktureringselementPris pr. 1M tokensHvornår den gælder
Standardinput$2.00Nyt promptindhold, værktøjsdefinitioner og ikke-cachet kontekst
Standardoutput$6.00Genereret output og faktureret ræsonneringsforbrug
Implicit cache-hit$0.25Automatisk genbrugte promptpræfikser; træffere er ikke garanteret
Eksplicit cacheoprettelse$2.50Oprettelse af et markeret, genbrugeligt promptpræfiks
Eksplicit cachelæsning$0.17Genbrug af en gyldig eksplicit cacheblok

En 900K-token anmodning koster derfor mere end en 100K-token anmodning, fordi den behandler ni gange så mange input-tokens—ikke fordi den krydser ind i et højere pristrin.

Ræsonnering kan øge outputomkostningen

Et kort synligt svar er ikke altid et lavomkostningssvar. Anmodninger med aktiveret ræsonnering kan generere ekstra ræsonnerings-tokens, så produktionsestimater bør bruge forbrugsfelterne, som returneres af API’et, frem for den synlige svarelængde.

Hvor dit endpoint understøtter ræsonneringskontroller for qwen3.8-max, bør du sammenligne de tilgængelige indstillinger på det samme evalueringssæt. Antag ikke, at preview-standarder overføres til GA-modellen.

Cachebesparelser afhænger af promptstabilitet

Qwen 3.8 Max’ modelside offentliggør modelspecifikke cache-satser. Brug disse satser—ikke generiske cache-forhold—når du estimerer forbrug.

Eksplicit cacheposter har en gyldighedsperiode på fem minutter, og et succesfuldt træf nulstiller perioden. Implicit caching er automatisk, men en træffer er ikke garanteret. Caching er mest nyttig, når systemprompter, værktøjsdefinitioner, repository-kontekst eller store dokumenter er stabile på tværs af hyppige kald.

Indbyggede værktøjer medfører separate gebyrer

QwenCloud viser i øjeblikket følgende værktøjsgebyrer udover tokenforbrug:

Indbygget værktøjAktuelt gebyr
Websøgning$10 / 1K opkald
Billedsøgning$8 / 1K opkald
WebudtrækkerGratis i en begrænset periode
KodefortolkerGratis i en begrænset periode

Funktionskald og MCP har ikke separate værktøjsgebyrer, men værktøjsbeskrivelser tæller stadig som input-tokens. Gratis værktøjskampagner kan ændre sig, så tjek QwenCloud pricing guide, før du fastlægger et produktionsbudget.

For eksempel koster en anmodning med 20K input-tokens, 2K output-tokens og to Websøgning-opkald cirka:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

I dette eksempel udgør de to søgeopkald cirka 27.8% af den samlede anmodningsomkostning.

Qwen 3.8 Max: Virkelige omkostningseksempler

Disse eksempler bruger de aktuelle modelspecifikke satser på QwenCloud. De udelader skatter, genforsøg, fallbacks og udbyderspecifik mark-up.

Eksempel 1: Mellemstor agentanmodning

Antag 50K input-tokens og 5K output-tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Et succesfuldt første forsøg koster omkring $0.13. Ét fuldt genforsøg vil øge modelomkostningen til cirka $0.26.

Eksempel 2: Langedokument-analyse

Antag 800K input-tokens og 20K output-tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Modellen anvender ikke et separat lang-kontekst-tillæg på sit nuværende priskort, men store prompts skaber stadig betydelige absolutte omkostninger.

Eksempel 3: Cachet agentsession

Antag et genbrugeligt 100K-token præfiks, 10K nye input-tokens, 5K output-tokens og 50 opkald, mens den eksplicitte cache forbliver gyldig:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Anslået besparelse = $8.917, eller 71.3%

Den anslåede besparelse afhænger af succesfulde cache-træffere og et stabilt præfiks. Lange pauser eller hyppige ændringer i systemprompter og værktøjsskemaer vil reducere fordelen.

Qwen 3.8 Max vs Qwen 3.7 Max: Pris-sammenligning

Qwen 3.8 Max er 20% billigere end Qwen 3.7 Max til listepris, men Qwen 3.7 Max er 37.5% billigere, mens den aktuelle 50%-kampagne er aktiv.

Model og prisstatusInput / 1MOutput / 1MKontekst
qwen3.8-max standardpris$2.00$6.001M
qwen3.7-max listepris$2.50$7.501M
qwen3.7-max aktuel kampagne$1.25$3.751M

Hold CometAPI Qwen3.7 Max model page tilgængelig som fallback, mens du tester den nye model.

Pris pr. token er kun én del af beslutningen. Qwen 3.8 Max kan stadig være mere økonomisk, hvis den forbedrer succes ved første forsøg, bruger værktøjer mere pålideligt, reducerer genforsøg eller kræver mindre menneskelig korrektion.

Brug denne produktionsmetrik:

Omkostning pr. accepteret opgave =

(modeltokens + værktøjsopkald + genforsøg + fallback-udgift + gennemgangsomkostning)

÷ accepterede outputs

Udbyder-rapporterede benchmark-gevinster er en grund til at reteste krævende kode- og professionelle workflows, ikke et bevis for, at hver Qwen 3.7-arbejdsbyrde bør migrere.

Sådan migrerer du til Qwen 3.8 Max

At ændre modelstrengen er nødvendigt, men det er ikke en fuld produktionsmigration.

1. Test produktionsmodel-ID’et

Erstat preview-identifikatoren med qwen3.8-max i et testmiljø. Antag ikke, at preview-aliasser, standarder, latenstid eller responsadfærd forbliver uændret.

En minimal OpenAI-kompatibel anmodning kan se sådan ud:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Start med den minimalt dokumenterede anmodning. Tilføj først ræsonneringskontroller, når den aktuelle API-reference for dit endpoint eksplicit understøtter dem.

2. Etabler nye baseline-telemetrier for omkostninger og ydeevne

Registrer som minimum:

  • input-, output- og ræsonnerings-tokens
  • cache-træffere og cacheoprettelses-tokens
  • tid til første token og total latenstid
  • værktøjsopkald, genforsøg og fallbacks
  • accepterede versus afviste outputs
  • tid til menneskelig korrektion

3. Retest det interface, din applikation bruger

Validér streaminghændelser, multimodale payloads, værktøjsskemaer, struktureret output, afslutningsårsager, forbrugsfelter, fejlhåndtering og multi-turn adfærd. Produktionsmodelsiden dokumenterer adgang via DashScope og OpenAI-kompatibilitet; verificér enhver yderligere kompatibilitetslag, før du stoler på det.

4. Respektér de praktiske kontekstgrænser

Et 1M kontekstvindue er ikke det samme som en 1M-token brugerprompt. QwenCloud angiver maksimalt input på 991K uden ræsonnering og 983K med ræsonnering. Tilføj en sikkerhedsmargin, så anmodningen stadig har plads til output og ræsonnering.

5. Kør Qwen 3.7 og Qwen 3.8 side om side

Brug identiske prompts, værktøjer, validatorer, genforsøgsregler og datasæt. Sammenlign omkostning pr. accepteret opgave og latenstid i stedet for at bedømme isolerede svar med øjemål.

Sådan evaluerer og router du Qwen 3.8 Max

Brug reelle arbejdsbyrder frem for brede benchmark-gennemsnit.

ArbejdslastForeslåede opgaverPrimært acceptsignal
Repository-kodning4Tests består uden menneskelige rettelser
Analyse af lange dokumenter3Påstande understøttes af medfølgende beviser
Multimodal analyse2Relevante billede- eller videodetaljer bruges korrekt
Agenter der bruger værktøjer3Korrekt værktøjsvalg og gyldige argumenter
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Brug Qwen 3.8 Max til vanskelige repository-opgaver, langhorisont-agenter, multimodal analyse og workflows, hvor Qwen 3.7 fejler accepttest. Behold Qwen 3.7 Max, når kampagnen sænker prisen væsentligt, og den eksisterende model allerede opfylder dit kvalitetmål.

Tjek CometAPI pricing page og live routing-information, før du låser tærskler, da udbydertilgængelighed og routed prissætning kan ændre sig uafhængigt af QwenClouds direkte listepris. CometAPI Cookbook kan hjælpe dig med at bygge reproducerbare anmodninger og et konsistent evaluerings-setup.

FAQ

Hvad koster Qwen 3.8 Max API’et?

QwenCloud viser i øjeblikket Qwen 3.8 Max til $2 pr. 1 million input-tokens og $6 pr. 1 million output-tokens. Cacheforbrug og indbyggede værktøjer har separate satser.

Koster Qwen 3.8 Max mere over 128K tokens?

Der vises ikke et separat lang-kontekst-pristrin på det aktuelle modelspecifikke priskort. Lange anmodninger koster mere, fordi de indeholder flere tokens, ikke fordi de krydser ind i et højere enhedspristrin.

Bliver Qwen 3.8 Max-ræsonneringstokens faktureret?

Ræsonnering kan øge genereret forbrug og samlet pris. Brug ræsonnerings- og output-tokenfelterne, som returneres af endpointet, i stedet for at estimere ud fra det synlige svar.

Er Qwen 3.8 Max open source?

Qwen annoncerede, at åbne vægte ville følge API-udgivelsen. Beskriv ikke modellen som downloadbar eller selvhostbar, før et officielt checkpoint og en licens er tilgængelige.

Bør Qwen 3.7 Max-brugere migrere med det samme?

Ikke automatisk. Qwen 3.8 Max har en lavere standardlistepris, mens Qwen 3.7 Max er billigere under den aktuelle kampagne. Migrér, når dine egne data om kvalitet, latenstid, cacheadfærd og omkostning pr. accepteret opgave understøtter ændringen.

Test Qwen 3.8 Max med CometAPI

Brug CometAPI Quickstart til at konfigurere en OpenAI-kompatibel klient. Før du sender produktions trafik, bekræft, at qwen3.8-max er live på din konto, og verificér den routed pris, der vises dér.

Sammenlign den med din Qwen 3.7-baseline ved hjælp af identiske prompts, validatorer, genforsøgspolitikker og telemetri. Det holder evalueringen fokuseret på modellen frem for ændringer i test-harnesset.

Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Aug 4, 2026
Sidst opdateret Aug 24, 2026
130 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Klar til at skære AI-udviklingsomkostninger med 20%?

Kom gratis i gang på få minutter. Gratis prøvekreditter inkluderet. Intet kreditkort påkrævet.

Læs mere