TL;DR Qwen 3.8 Max kostet auf QwenCloud $2 pro 1 Million Eingabetokens und $6 pro 1 Million Ausgabetokens. Modellspezifische Cacheraten betragen $0.25/M für implizit zwischengespeicherten Input, $2.50/M für die explizite Cache-Erstellung und $0.17/M für explizite Cache-Lesevorgänge.
Die gleichen Standardtokenraten gelten über das vom Modell unterstützte 1M-Token-Kontextfenster. Größere Prompts kosten mehr, weil sie mehr Tokens enthalten, nicht weil sie in eine höhere Langkontext-Preisstufe fallen.
Zum Listenpreis ist Qwen 3.8 Max 20 % günstiger als Qwen 3.7 Max. Während die aktuelle 50%-Aktion läuft, ist Qwen 3.7 Max jedoch günstiger. Die bessere Produktionswahl hängt von den Kosten pro akzeptierter Aufgabe ab, einschließlich Reasoning, Cache-Treffern, Tools, Retries, Latenz und menschlicher Prüfung.
Qwen 3.8 Max API-Preise auf einen Blick
| Posten | Aktueller offizieller Wert |
|---|---|
| Produktions‑Modell‑ID | qwen3.8-max |
| Offizielles Veröffentlichungsdatum | August 3, 2026 |
| Architektur | 2.4T Gesamtparameter; 95B aktive Parameter |
| Standard‑Eingabepreis | $2 / 1M Tokens |
| Standard‑Ausgabepreis | $6 / 1M Tokens |
| Implizit zwischengespeicherter Input | $0.25 / 1M Tokens |
| Explizite Cache‑Erstellung | $2.50 / 1M Tokens |
| Explizite Cache‑Lesung | $0.17 / 1M Tokens |
| Kontextfenster | 1M Tokens |
| Maximale Eingabe | 991K ohne Reasoning; 983K mit Reasoning |
| Maximale Ausgabe | 131K |
| Maximales Reasoning | 262K |
| Eingabemodalitäten | Text, Bild und Video |
| Ausgabemodalität | Text |
| QwenCloud‑Referenzlimits | 2M TPM und 15K RPM |
Die QwenCloud‑Modellseite ist die direkteste Quelle für die aktuelle Modell‑ID, Preise, Cache‑Raten, Kontextlimits und Modalitäten. Konten‑ und regionsspezifische Quoten können abweichen. Verwenden Sie daher die in Ihrer eigenen Konsole angezeigten Limits, wenn Sie die Produktions‑Parallelität festlegen.
Das Produktions‑Release ersetzt außerdem die Vorschau‑Kennung durch qwen3.8-max und fügt eine vollständige modellspezifische Preistabelle hinzu. Qwens Launch‑Materialien beschreiben Einstellungen für das Reasoning‑Aufwandsniveau low, medium und xhigh, aber das Produktionsverhalten sollte gegen den tatsächlich verwendeten Endpoint und die API‑Referenz verifiziert werden.
Zeitkritischer Hinweis: Qwen hat angekündigt, dass offene Gewichte dem API‑Release folgen würden. Stand 4. August 2026 gilt: Beschreiben Sie Qwen 3.8 Max nicht als herunterladbar oder selbst hostbar, bis ein offizielles Checkpoint und eine Lizenz veröffentlicht sind.
So funktionieren die Preise von Qwen 3.8 Max
QwenCloud führt derzeit einen einheitlichen Standardtarif von $2 pro 1M Eingabetokens und $6 pro 1M Ausgabetokens über das unterstützte 1M‑Token‑Kontextfenster von Qwen 3.8 Max. Der folgende offizielle Preissnapshot wurde am 4. August 2026 erstellt; prüfen Sie stets die Live‑Modellseite, bevor Sie Produktionsbudgets festlegen.

Quelle***:*** QwenCloud, „Qwen3.8-Max“ offiziell
| Abrechnungsposten | Preis pro 1M Tokens | Wann er anfällt |
|---|---|---|
| Standard‑Input | $2.00 | Neue Prompt‑Inhalte, Tool‑Definitionen und nicht zwischengespeicherter Kontext |
| Standard‑Output | $6.00 | Generierte Ausgabe und abgerechnete Reasoning‑Nutzung |
| Impliziter Cache‑Treffer | $0.25 | Automatisch wiederverwendete Prompt‑Präfixe; Treffer sind nicht garantiert |
| Explizite Cache‑Erstellung | $2.50 | Erstellung eines markierten, wiederverwendbaren Prompt‑Präfixes |
| Explizite Cache‑Lesung | $0.17 | Wiederverwendung eines gültigen expliziten Cache‑Blocks |
Eine Anfrage mit 900K Tokens kostet daher mehr als eine mit 100K Tokens, weil sie neunmal so viele Eingabetokens verarbeitet – nicht, weil sie in eine höhere Preisklasse fällt.
Reasoning kann die Ausgabekosten erhöhen
Eine kurze sichtbare Antwort ist nicht immer eine kostengünstige Antwort. Reasoning‑fähige Aufrufe können zusätzliche Reasoning‑Tokens erzeugen. Produktionsschätzungen sollten daher die vom API zurückgegebenen Nutzungsfelder verwenden und nicht die sichtbare Antwortlänge.
Wo Ihr Endpoint Reasoning‑Kontrollen für qwen3.8-max unterstützt, vergleichen Sie die verfügbaren Einstellungen auf demselben Evaluationssatz. Gehen Sie nicht davon aus, dass Vorschau‑Defaults auf das GA‑Modell übertragen werden.
Cache‑Einsparungen hängen von der Prompt‑Stabilität ab
Die Modellseite von Qwen 3.8 Max veröffentlicht modellspezifische Cache‑Raten. Verwenden Sie diese Raten – nicht generische Cache‑Verhältnisse –, wenn Sie die Ausgaben schätzen.
Explizite Cache‑Einträge haben eine Gültigkeitsdauer von fünf Minuten, und ein erfolgreicher Treffer setzt diese Periode zurück. Implizites Caching ist automatisch, aber ein Treffer ist nicht garantiert. Caching ist am sinnvollsten, wenn Systemprompts, Tool‑Definitionen, Repository‑Kontext oder große Dokumente über häufige Aufrufe hinweg stabil bleiben.
Integrierte Tools verursachen zusätzliche Gebühren
QwenCloud listet derzeit die folgenden Tool‑Gebühren zusätzlich zur Token‑Nutzung:
| Integriertes Tool | Aktuelle Gebühr |
|---|---|
| Web Search | $10 / 1K Aufrufe |
| Image Search | $8 / 1K Aufrufe |
| Web Extractor | Für begrenzte Zeit kostenlos |
| Code Interpreter | Für begrenzte Zeit kostenlos |
Function Calling und MCP haben keine separaten Tool‑Gebühren, aber Tool‑Beschreibungen zählen dennoch als Eingabetokens. Kostenlose Tool‑Promotionen können sich ändern. Prüfen Sie daher vor der Finalisierung eines Produktionsbudgets den QwenCloud‑Preisleitfaden.
Beispielsweise kostet eine Anfrage mit 20K Eingabetokens, 2K Ausgabetokens und zwei Web‑Search‑Aufrufen ungefähr:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
In diesem Beispiel machen die zwei Suchaufrufe etwa 27,8 % der Gesamtkosten der Anfrage aus.
Qwen 3.8 Max: Kostenbeispiele aus der Praxis
Diese Beispiele verwenden die aktuellen modellspezifischen Raten von QwenCloud. Sie schließen Steuern, Retries, Fallbacks und anbieterspezifische Aufschläge aus.
Beispiel 1: Mittlere Agenten‑Anfrage
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Ein erfolgreicher Erstversuch kostet etwa $0.13. Ein vollständiger Retry würde die Modellkosten auf ungefähr $0.26 erhöhen.
Beispiel 2: Langdokument‑Analyse
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Das Modell erhebt auf seiner aktuellen Preistabelle keinen separaten Langkontext‑Aufschlag, aber große Prompts verursachen dennoch erhebliche absolute Kosten.
Beispiel 3: Zwischengespeicherte Agent‑Sitzung
Angenommen ein wiederverwendbares 100K‑Token‑Präfix, 10K neue Eingabetokens, 5K Ausgabetokens und 50 Aufrufe, solange der explizite Cache gültig bleibt:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Geschätzte Einsparung = $8.917, bzw. 71,3 %
Die geschätzte Einsparung hängt von erfolgreichen Cache‑Treffern und einem stabilen Präfix ab. Lange Pausen oder häufige Änderungen an Systemprompts und Tool‑Schemata verringern den Nutzen.
Qwen 3.8 Max vs Qwen 3.7 Max:Preisvergleich
Qwen 3.8 Max ist zum Listenpreis 20 % günstiger als Qwen 3.7 Max, während Qwen 3.7 Max während seiner aktuellen 50%-Promotion 37,5 % günstiger ist.
| Modell und Preisstatus | Input / 1M | Output / 1M | Kontext |
|---|---|---|---|
| qwen3.8-max Standardpreis | $2.00 | $6.00 | 1M |
| qwen3.7-max Listenpreis | $2.50 | $7.50 | 1M |
| qwen3.7-max aktuelle Aktion | $1.25 | $3.75 | 1M |
Halten Sie die CometAPI Qwen3.7 Max Modellseite während der Tests des neuen Modells als Fallback verfügbar.
Der Preis pro Token ist nur ein Teil der Entscheidung. Qwen 3.8 Max kann dennoch wirtschaftlicher sein, wenn es die Erfolgsquote beim ersten Versuch erhöht, Tools zuverlässiger nutzt, Retries reduziert oder weniger menschliche Korrekturen erfordert.
Verwenden Sie diese Produktionsmetrik:
Kosten pro akzeptierter Aufgabe =
(Modell‑Tokens + Tool‑Aufrufe + Retries + Fallback‑Ausgaben + Prüfungskosten)
÷ akzeptierte Outputs
Vom Anbieter gemeldete Benchmark‑Vorteile sind ein Anlass, anspruchsvolle Coding‑ und professionelle Workflows neu zu testen – kein Beweis dafür, dass jede Qwen 3.7‑Arbeitslast migrieren sollte.
So migrieren Sie zu Qwen 3.8 Max
Das Ändern des Modell‑Strings ist notwendig, aber keine vollständige Produktionsmigration.
1. Produktions‑Modell‑ID testen
Ersetzen Sie die Vorschau‑Kennung in einer Testumgebung durch qwen3.8-max. Gehen Sie nicht davon aus, dass Vorschau‑Aliasse, Defaults, Latenz oder Antwortverhalten unverändert bleiben.
Eine minimal OpenAI‑kompatible Anfrage kann so aussehen:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Beginnen Sie mit der minimal dokumentierten Anfrage. Fügen Sie Reasoning‑Kontrollen nur hinzu, wenn die aktuelle API‑Referenz für Ihren Endpoint sie ausdrücklich unterstützt.
2. Kosten‑ und Leistungs‑Telemetrie neu ermitteln
Erfassen Sie mindestens:
- Eingabe‑, Ausgabe‑ und Reasoning‑Tokens
- Cache‑Treffer und Tokens für die Cache‑Erstellung
- Zeit bis zum ersten Token und Gesamtlatenz
- Tool‑Aufrufe, Retries und Fallbacks
- Akzeptierte vs. abgelehnte Outputs
- Zeit für menschliche Korrekturen
3. Die Schnittstelle Ihrer Anwendung erneut testen
Validieren Sie Streaming‑Ereignisse, multimodale Payloads, Tool‑Schemata, strukturierte Ausgabe, Abschlussgründe, Nutzungsfelder, Fehlerbehandlung und Multi‑Turn‑Verhalten. Die Produktions‑Modellseite dokumentiert DashScope‑ und OpenAI‑kompatiblen Zugriff; verifizieren Sie jede zusätzliche Kompatibilitätsschicht, bevor Sie sich darauf verlassen.
4. Praktische Kontextlimits beachten
Ein 1M‑Kontextfenster ist nicht dasselbe wie ein 1M‑Token‑User‑Prompt. QwenCloud führt maximale Eingaben von 991K ohne Reasoning und 983K mit Reasoning auf. Fügen Sie eine Sicherheitsmarge hinzu, damit die Anfrage noch Platz für Ausgabe und Reasoning hat.
5. Qwen 3.7 und Qwen 3.8 parallel betreiben
Verwenden Sie identische Prompts, Tools, Validatoren, Retry‑Regeln und Datensätze. Vergleichen Sie Kosten pro akzeptierter Aufgabe und Latenz, statt einzelne Antworten nach Augenschein zu bewerten.
So evaluieren und routen Sie Qwen 3.8 Max
Verwenden Sie reale Arbeitslasten statt breiter Benchmark‑Durchschnitte.
| Arbeitslast | Vorgeschlagene Aufgaben | Primäres Akzeptanzsignal |
|---|---|---|
| Repository‑Coding | 4 | Tests bestehen ohne menschliches Patchen |
| Langdokument‑Analyse | 3 | Behauptungen werden durch gelieferte Evidenz gestützt |
| Multimodale Analyse | 2 | Relevante Bild‑ oder Videodetails werden korrekt verwendet |
| Tool‑nutzende Agenten | 3 | Korrekte Tool‑Auswahl und gültige Argumente |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Verwenden Sie Qwen 3.8 Max für schwierige Repository‑Arbeiten, langhorizontige Agenten, multimodale Analysen und Workflows, bei denen Qwen 3.7 Akzeptanztests nicht besteht. Behalten Sie Qwen 3.7 Max, wenn die Promotion die Kosten spürbar senkt und das bestehende Modell Ihr Qualitätsziel bereits erfüllt.
Prüfen Sie die CometAPI Preisübersicht und die Live‑Routing‑Informationen, bevor Sie Schwellenwerte festlegen, da die Anbieter‑Verfügbarkeit und geroutete Preise unabhängig vom Direkt‑Listenpreis von QwenCloud variieren können. Das CometAPI Cookbook hilft Ihnen, wiederholbare Anfragen und einen konsistenten Evaluierungs‑Harness zu erstellen.
FAQ
Wie viel kostet die Qwen 3.8 Max API?
QwenCloud führt Qwen 3.8 Max derzeit mit $2 pro 1 Million Eingabetokens und $6 pro 1 Million Ausgabetokens. Cache‑Nutzung und integrierte Tools haben separate Raten.
Kostet Qwen 3.8 Max oberhalb von 128K Tokens mehr?
Auf der aktuellen modellspezifischen Preistabelle ist keine separate Langkontext‑Stufe ausgewiesen. Lange Anfragen kosten mehr, weil sie mehr Tokens enthalten, nicht wegen eines höheren Einheitspreises.
Werden Reasoning‑Tokens bei Qwen 3.8 Max abgerechnet?
Reasoning kann die generierte Nutzung und die Gesamtkosten erhöhen. Verwenden Sie die vom Endpoint zurückgegebenen Felder für Reasoning‑ und Ausgabetokens, statt aus der sichtbaren Antwort zu schätzen.
Ist Qwen 3.8 Max Open Source?
Qwen hat angekündigt, dass offene Gewichte dem API‑Release folgen würden. Beschreiben Sie das Modell nicht als herunterladbar oder selbst hostbar, bis ein offizielles Checkpoint und eine Lizenz verfügbar sind.
Sollten Qwen 3.7 Max‑Nutzer sofort migrieren?
Nicht automatisch. Qwen 3.8 Max hat einen niedrigeren Standard‑Listenpreis, während Qwen 3.7 Max während seiner aktuellen Promotion günstiger ist. Migrieren Sie, wenn Ihre eigenen Daten zu Qualität, Latenz, Cache‑Verhalten und Kosten pro akzeptierter Aufgabe den Wechsel stützen.
Testen Sie Qwen 3.8 Max mit CometAPI
Verwenden Sie das CometAPI Quickstart, um einen OpenAI‑kompatiblen Client zu konfigurieren. Bestätigen Sie vor dem Senden von Produktionsverkehr, dass qwen3.8-max in Ihrem Konto live ist, und verifizieren Sie den dort angezeigten gerouteten Preis.
Vergleichen Sie ihn mit Ihrer Qwen 3.7‑Baseline mit identischen Prompts, Validatoren, Retry‑Policies und Telemetrie. So bleibt die Evaluierung auf das Modell fokussiert und nicht auf Änderungen am Test‑Harness.
