Qwen 3.8 Max API-Preise: $2 Input, $6 Output, 1M Kontext
TL;DR
Qwen 3.8 Max kostet $2 pro 1 Million Eingabetokens und $6 pro 1 Million Ausgabetokens auf QwenCloud. Modellspezifische Cache-Raten sind $0.25/M für implizit zwischengespeicherte Eingaben, $2.50/M für explizite Cache-Erstellung und $0.17/M für explizite Cache-Lesevorgänge.
Die gleichen Standard-Tokenpreise gelten über das unterstützte 1M-Token-Kontextfenster des Modells hinweg. Größere Prompts kosten mehr, weil sie mehr Tokens enthalten, nicht wegen eines höheren Preistarifs für langen Kontext.
Zum Listenpreis ist Qwen 3.8 Max 20% günstiger als Qwen 3.7 Max. Allerdings ist Qwen 3.7 Max günstiger, solange die aktuelle 50%-Promotion aktiv ist. Die bessere Produktionswahl hängt von den Kosten pro akzeptierter Aufgabe ab, einschließlich Reasoning, Cache-Treffern, Tools, Retries, Latenz und manueller Prüfung.
Qwen 3.8 Max API-Preise auf einen Blick
| Item | Current official value |
|---|---|
| Production model ID | qwen3.8-max |
| Official release date | August 3, 2026 |
| Architecture | 2.4T total parameters; 95B active parameters |
| Standard input price | $2 / 1M tokens |
| Standard output price | $6 / 1M tokens |
| Implicit cached input | $0.25 / 1M tokens |
| Explicit cache creation | $2.50 / 1M tokens |
| Explicit cache read | $0.17 / 1M tokens |
| Context window | 1M tokens |
| Maximum input | 991K without thinking; 983K with thinking |
| Maximum output | 131K |
| Maximum reasoning | 262K |
| Input modalities | Text, image, and video |
| Output modality | Text |
| QwenCloud reference limits | 2M TPM and 15K RPM |
Die QwenCloud-Modellseite ist die direkteste Quelle für die aktuellen Modell-IDs, Preise, Cache-Raten, Kontextgrenzen und Modalitäten. Konten- und regionsspezifische Quoten können abweichen; verwenden Sie die in Ihrer eigenen Konsole angezeigten Limits, wenn Sie die Produktionskonkurrenz festlegen.
Das Produktionsrelease ersetzt außerdem den Preview-Bezeichner durch qwen3.8-max und ergänzt eine vollständige modellspezifische Preisliste. Qwens Launch-Materialien beschreiben low, medium und xhigh Reasoning-Aufwandseinstellungen, aber das Produktionsverhalten sollte gegenüber dem Endpunkt und der API-Referenz überprüft werden, die Sie tatsächlich verwenden.
Zeitkritischer Hinweis: Qwen kündigte an, dass offene Gewichte auf die API-Veröffentlichung folgen würden. Stand 4. August 2026 sollten Sie Qwen 3.8 Max nicht als herunterladbar oder selbst hostbar bezeichnen, bis ein offizieller Checkpoint und eine Lizenz veröffentlicht sind.
So funktioniert die Preisgestaltung von Qwen 3.8 Max
QwenCloud führt derzeit einen einheitlichen Standardtarif von $2 pro 1M Eingabetokens und $6 pro 1M Ausgabetokens über das unterstützte 1M-Token-Kontextfenster von Qwen 3.8 Max auf. Die folgende offizielle Preisschnappschuss wurde am 4. August 2026 erfasst; prüfen Sie stets die Live-Modellseite, bevor Sie Produktionsbudgets festlegen.

Quelle***:*** QwenCloud, “Qwen3.8-Max” official
| Billing item | Price per 1M tokens | When it applies |
|---|---|---|
| Standard input | $2.00 | New prompt content, tool definitions, and uncached context |
| Standard output | $6.00 | Generated output and billed reasoning usage |
| Implicit cache hit | $0.25 | Automatically reused prompt prefixes; hits are not guaranteed |
| Explicit cache creation | $2.50 | Creating a marked reusable prompt prefix |
| Explicit cache read | $0.17 | Reusing a valid explicit cache block |
Eine Anfrage mit 900K Tokens kostet daher mehr als eine mit 100K Tokens, weil sie neunmal so viele Eingabetokens verarbeitet – nicht, weil sie in eine höhere Preisklasse fällt.
Reasoning kann die Ausgabekosten erhöhen
Eine kurze sichtbare Antwort ist nicht immer eine günstige Antwort. Reasoning-aktivierte Aufrufe können zusätzliche Reasoning-Tokens erzeugen; Produktionsschätzungen sollten daher die vom API-Endpunkt zurückgegebenen Nutzungsfelder verwenden und nicht die sichtbare Antwortlänge.
Wo Ihr Endpunkt Reasoning-Kontrollen für qwen3.8-max unterstützt, vergleichen Sie die verfügbaren Einstellungen auf demselben Evaluationsset. Gehen Sie nicht davon aus, dass Preview-Defaults in das GA-Modell übernommen werden.
Cache-Einsparungen hängen von der Prompt-Stabilität ab
Die Modellseite von Qwen 3.8 Max veröffentlicht modellspezifische Cache-Raten. Verwenden Sie diese Raten – nicht generische Cache-Verhältnisse – bei der Ausgabenschätzung.
Explizite Cache-Einträge haben eine Gültigkeit von fünf Minuten, und ein erfolgreicher Treffer setzt diese Frist zurück. Implizites Caching erfolgt automatisch, aber ein Treffer ist nicht garantiert. Caching ist besonders nützlich, wenn Systemprompts, Tooldefinitionen, Repository-Kontext oder große Dokumente über häufige Aufrufe hinweg stabil bleiben.
Integrierte Tools verursachen separate Gebühren
QwenCloud führt derzeit die folgenden Tool-Gebühren zusätzlich zur Token-Nutzung auf:
| Built-in tool | Current fee |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | Free for a limited time |
| Code Interpreter | Free for a limited time |
Function Calling und MCP haben keine separaten Tool-Gebühren, aber Toolbeschreibungen zählen weiterhin als Eingabetokens. Kostenlose Tool-Promotions können sich ändern; prüfen Sie den QwenCloud-Preisleitfaden, bevor Sie ein Produktionsbudget finalisieren.
Zum Beispiel kostet eine Anfrage mit 20K Eingabetokens, 2K Ausgabetokens und zwei Websuche-Aufrufen ungefähr:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
In diesem Beispiel entfallen etwa 27.8% der Gesamtkosten der Anfrage auf die zwei Suchaufrufe.
Qwen 3.8 Max Praxisbeispiele zu Kosten
Diese Beispiele verwenden die aktuellen modellspezifischen Raten von QwenCloud. Steuern, Retries, Fallbacks und anbieterabhängige Aufschläge sind ausgeschlossen.
Beispiel 1: Mittlere Agenten-Anfrage
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Ein erfolgreicher erster Versuch kostet etwa $0.13. Ein vollständiger Retry würde die Modellkosten auf ungefähr $0.26 erhöhen.
Beispiel 2: Analyse eines langen Dokuments
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Das Modell erhebt in seiner aktuellen Preisliste keinen separaten Aufschlag für langen Kontext, aber große Prompts verursachen dennoch erhebliche absolute Kosten.
Beispiel 3: Zwischengespeicherte Agenten-Sitzung
Angenommen, ein wiederverwendbares 100K-Token-Präfix, 10K neue Eingabetokens, 5K Ausgabetokens und 50 Aufrufe, während der explizite Cache gültig bleibt:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Geschätzte Einsparung = $8.917 bzw. 71.3%
Die geschätzte Einsparung hängt von erfolgreichen Cache-Treffern und einem stabilen Präfix ab. Lange Pausen oder häufige Änderungen an Systemprompts und Tool-Schemata verringern den Nutzen.
Qwen 3.8 Max vs. Qwen 3.7 Max: Preisvergleich
Qwen 3.8 Max ist zum Listenpreis 20% günstiger als Qwen 3.7 Max, aber Qwen 3.7 Max ist während seiner aktuellen 50%-Promotion 37.5% günstiger.
| Model and pricing status | Input / 1M | Output / 1M | Context |
|---|---|---|---|
| qwen3.8-max standard price | $2.00 | $6.00 | 1M |
| qwen3.7-max list price | $2.50 | $7.50 | 1M |
| qwen3.7-max current promotion | $1.25 | $3.75 | 1M |
Behalten Sie die CometAPI Qwen3.7 Max Modellseite als Fallback verfügbar, während Sie das neue Modell testen.
Der Preis pro Token ist nur ein Teil der Entscheidung. Qwen 3.8 Max kann dennoch wirtschaftlicher sein, wenn es die Erfolgsquote beim ersten Versuch verbessert, Tools zuverlässiger nutzt, Retries reduziert oder weniger manuelle Korrektur erfordert.
Verwenden Sie diese Produktionskennzahl:
Kosten pro akzeptierter Aufgabe =
(Modell-Tokens + Tool-Aufrufe + Retries + Fallback-Kosten + Prüfkosten)
÷ akzeptierte Ausgaben
Vom Anbieter gemeldete Benchmark-Gewinne sind ein Grund, anspruchsvolle Coding- und professionelle Workflows neu zu testen – kein Beweis dafür, dass jede Qwen 3.7-Workload migrieren sollte.
So migrieren Sie zu Qwen 3.8 Max
Das Ändern der Modellzeichenfolge ist notwendig, aber keine vollständige Produktionsmigration.
1. Testen Sie die Produktionsmodell-ID
Ersetzen Sie den Preview-Bezeichner in einer Testumgebung durch qwen3.8-max. Gehen Sie nicht davon aus, dass Preview-Aliasse, Defaults, Latenz oder das Antwortverhalten unverändert bleiben.
Eine minimale OpenAI-kompatible Anfrage kann so aussehen:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Beginnen Sie mit der minimal dokumentierten Anfrage. Fügen Sie Reasoning-Kontrollen nur hinzu, wenn die aktuelle API-Referenz für Ihren Endpunkt sie ausdrücklich unterstützt.
2. Kosten- und Leistungs-Telemetrie neu baselinen
Erfassen Sie mindestens:
- Eingabe-, Ausgabe- und Reasoning-Tokens
- Cache-Treffer und Cache-Erstellungs-Tokens
- Time to first token und Gesamtlatenz
- Tool-Aufrufe, Retries und Fallbacks
- Akzeptierte versus abgelehnte Ausgaben
- Zeit für manuelle Korrekturen
3. Testen Sie die von Ihrer Anwendung verwendete Schnittstelle erneut
Validieren Sie Streaming-Ereignisse, multimodale Nutzlasten, Tool-Schemata, strukturierte Ausgabe, Abschlussgründe, Nutzungsfelder, Fehlerbehandlung und Mehrturn-Verhalten. Die Produktionsmodellseite dokumentiert DashScope- und OpenAI-kompatiblen Zugriff; prüfen Sie jede zusätzliche Kompatibilitätsschicht, bevor Sie sich darauf verlassen.
4. Beachten Sie die praktischen Kontextgrenzen
Ein 1M-Kontextfenster ist nicht dasselbe wie ein 1M-Token-Nutzerprompt. QwenCloud listet eine maximale Eingabe von 991K ohne Reasoning und 983K mit Reasoning. Fügen Sie eine Sicherheitsmarge hinzu, damit die Anfrage noch Platz für Ausgabe und Reasoning hat.
5. Betreiben Sie Qwen 3.7 und Qwen 3.8 parallel
Verwenden Sie identische Prompts, Tools, Validatoren, Retry-Regeln und Datensätze. Vergleichen Sie Kosten pro akzeptierter Aufgabe und Latenz, anstatt einzelne Antworten nach Augenmaß zu beurteilen.
So evaluieren und routen Sie Qwen 3.8 Max
Verwenden Sie reale Workloads statt breiter Benchmark-Durchschnitte.
| Workload | Suggested tasks | Primary acceptance signal |
|---|---|---|
| Repository coding | 4 | Tests bestehen ohne manuelle Nachbesserung |
| Long-document analysis | 3 | Aussagen sind durch gelieferte Belege gestützt |
| Multimodal analysis | 2 | Relevante Bild- oder Videodetails korrekt genutzt |
| Tool-using agents | 3 | Korrekte Tool-Auswahl und gültige Argumente |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Verwenden Sie Qwen 3.8 Max für schwierige Repository-Arbeiten, langlaufende Agenten, multimodale Analysen und Workflows, bei denen Qwen 3.7 Akzeptanztests nicht besteht. Bleiben Sie bei Qwen 3.7 Max, wenn die Promotion die Kosten wesentlich senkt und das bestehende Modell Ihr Qualitätsziel bereits erfüllt.
Prüfen Sie die CometAPI-Preisseite und Live-Routing-Informationen, bevor Sie Schwellenwerte festlegen, da Anbieter-Verfügbarkeit und geroutete Preise unabhängig von den Direktlistenpreisen von QwenCloud variieren können. Das CometAPI Cookbook kann Ihnen helfen, reproduzierbare Anfragen und ein konsistentes Evaluations-Framework aufzubauen.
FAQ
Wie viel kostet die Qwen 3.8 Max API?
QwenCloud listet Qwen 3.8 Max derzeit mit $2 pro 1 Million Eingabetokens und $6 pro 1 Million Ausgabetokens. Cache-Nutzung und integrierte Tools haben separate Tarife.
Kostet Qwen 3.8 Max mehr oberhalb von 128K Tokens?
Auf der aktuellen modellspezifischen Preisliste ist kein separater Tarif für langen Kontext ausgewiesen. Lange Anfragen kosten mehr, weil sie mehr Tokens enthalten, nicht wegen eines höheren Einheitspreises.
Werden Reasoning-Tokens bei Qwen 3.8 Max abgerechnet?
Reasoning kann die erzeugte Nutzung und die Gesamtkosten erhöhen. Verwenden Sie die vom Endpunkt zurückgegebenen Felder für Reasoning- und Ausgabetokens, statt aus der sichtbaren Antwort zu schätzen.
Ist Qwen 3.8 Max Open Source?
Qwen kündigte an, dass offene Gewichte auf die API-Veröffentlichung folgen würden. Bezeichnen Sie das Modell nicht als herunterladbar oder selbst hostbar, bis ein offizieller Checkpoint und eine Lizenz verfügbar sind.
Sollten Qwen 3.7 Max-Nutzer sofort migrieren?
Nicht automatisch. Qwen 3.8 Max hat einen niedrigeren Standardlistenpreis, während Qwen 3.7 Max während seiner aktuellen Promotion günstiger ist. Migrieren Sie, wenn Ihre eigenen Daten zu Qualität, Latenz, Cache-Verhalten und Kosten pro akzeptierter Aufgabe die Umstellung stützen.
Qwen 3.8 Max mit CometAPI testen
Verwenden Sie den CometAPI Quickstart, um einen OpenAI-kompatiblen Client zu konfigurieren. Bevor Sie Produktionstraffic senden, bestätigen Sie, dass qwen3.8-max in Ihrem Konto live ist, und verifizieren Sie den dort angezeigten, gerouteten Preis.
Vergleichen Sie ihn mit Ihrer Qwen 3.7-Baseline mit identischen Prompts, Validatoren, Retry-Richtlinien und Telemetrie. So bleibt die Evaluation auf das Modell fokussiert statt auf Änderungen am Test-Harness.
