GPT-5.6 Luna price down 80%, Terra down 20% →

Qwen 3.8 Max API-Preise: $2 Eingabe, $6 Ausgabe, 1M Kontext

CometAPI
Mia MarenAug 4, 2026
Qwen 3.8 Max API-Preise: $2 Eingabe, $6 Ausgabe, 1M Kontext

Qwen 3.8 Max API-Preise: $2 Input, $6 Output, 1M Kontext

TL;DR

Qwen 3.8 Max kostet $2 pro 1 Million Eingabetokens und $6 pro 1 Million Ausgabetokens auf QwenCloud. Modellspezifische Cache-Raten sind $0.25/M für implizit zwischengespeicherte Eingaben, $2.50/M für explizite Cache-Erstellung und $0.17/M für explizite Cache-Lesevorgänge.

Die gleichen Standard-Tokenpreise gelten über das unterstützte 1M-Token-Kontextfenster des Modells hinweg. Größere Prompts kosten mehr, weil sie mehr Tokens enthalten, nicht wegen eines höheren Preistarifs für langen Kontext.

Zum Listenpreis ist Qwen 3.8 Max 20% günstiger als Qwen 3.7 Max. Allerdings ist Qwen 3.7 Max günstiger, solange die aktuelle 50%-Promotion aktiv ist. Die bessere Produktionswahl hängt von den Kosten pro akzeptierter Aufgabe ab, einschließlich Reasoning, Cache-Treffern, Tools, Retries, Latenz und manueller Prüfung.

Qwen 3.8 Max API-Preise auf einen Blick

ItemCurrent official value
Production model IDqwen3.8-max
Official release dateAugust 3, 2026
Architecture2.4T total parameters; 95B active parameters
Standard input price$2 / 1M tokens
Standard output price$6 / 1M tokens
Implicit cached input$0.25 / 1M tokens
Explicit cache creation$2.50 / 1M tokens
Explicit cache read$0.17 / 1M tokens
Context window1M tokens
Maximum input991K without thinking; 983K with thinking
Maximum output131K
Maximum reasoning262K
Input modalitiesText, image, and video
Output modalityText
QwenCloud reference limits2M TPM and 15K RPM

Die QwenCloud-Modellseite ist die direkteste Quelle für die aktuellen Modell-IDs, Preise, Cache-Raten, Kontextgrenzen und Modalitäten. Konten- und regionsspezifische Quoten können abweichen; verwenden Sie die in Ihrer eigenen Konsole angezeigten Limits, wenn Sie die Produktionskonkurrenz festlegen.

Das Produktionsrelease ersetzt außerdem den Preview-Bezeichner durch qwen3.8-max und ergänzt eine vollständige modellspezifische Preisliste. Qwens Launch-Materialien beschreiben low, medium und xhigh Reasoning-Aufwandseinstellungen, aber das Produktionsverhalten sollte gegenüber dem Endpunkt und der API-Referenz überprüft werden, die Sie tatsächlich verwenden.

Zeitkritischer Hinweis: Qwen kündigte an, dass offene Gewichte auf die API-Veröffentlichung folgen würden. Stand 4. August 2026 sollten Sie Qwen 3.8 Max nicht als herunterladbar oder selbst hostbar bezeichnen, bis ein offizieller Checkpoint und eine Lizenz veröffentlicht sind.

So funktioniert die Preisgestaltung von Qwen 3.8 Max

QwenCloud führt derzeit einen einheitlichen Standardtarif von $2 pro 1M Eingabetokens und $6 pro 1M Ausgabetokens über das unterstützte 1M-Token-Kontextfenster von Qwen 3.8 Max auf. Die folgende offizielle Preisschnappschuss wurde am 4. August 2026 erfasst; prüfen Sie stets die Live-Modellseite, bevor Sie Produktionsbudgets festlegen.

Qwen 3.8 Max API-Preise: $2 Eingabe, $6 Ausgabe, 1M Kontext

Quelle***:*** QwenCloud, “Qwen3.8-Max” official

Billing itemPrice per 1M tokensWhen it applies
Standard input$2.00New prompt content, tool definitions, and uncached context
Standard output$6.00Generated output and billed reasoning usage
Implicit cache hit$0.25Automatically reused prompt prefixes; hits are not guaranteed
Explicit cache creation$2.50Creating a marked reusable prompt prefix
Explicit cache read$0.17Reusing a valid explicit cache block

Eine Anfrage mit 900K Tokens kostet daher mehr als eine mit 100K Tokens, weil sie neunmal so viele Eingabetokens verarbeitet – nicht, weil sie in eine höhere Preisklasse fällt.

Reasoning kann die Ausgabekosten erhöhen

Eine kurze sichtbare Antwort ist nicht immer eine günstige Antwort. Reasoning-aktivierte Aufrufe können zusätzliche Reasoning-Tokens erzeugen; Produktionsschätzungen sollten daher die vom API-Endpunkt zurückgegebenen Nutzungsfelder verwenden und nicht die sichtbare Antwortlänge.

Wo Ihr Endpunkt Reasoning-Kontrollen für qwen3.8-max unterstützt, vergleichen Sie die verfügbaren Einstellungen auf demselben Evaluationsset. Gehen Sie nicht davon aus, dass Preview-Defaults in das GA-Modell übernommen werden.

Cache-Einsparungen hängen von der Prompt-Stabilität ab

Die Modellseite von Qwen 3.8 Max veröffentlicht modellspezifische Cache-Raten. Verwenden Sie diese Raten – nicht generische Cache-Verhältnisse – bei der Ausgabenschätzung.

Explizite Cache-Einträge haben eine Gültigkeit von fünf Minuten, und ein erfolgreicher Treffer setzt diese Frist zurück. Implizites Caching erfolgt automatisch, aber ein Treffer ist nicht garantiert. Caching ist besonders nützlich, wenn Systemprompts, Tooldefinitionen, Repository-Kontext oder große Dokumente über häufige Aufrufe hinweg stabil bleiben.

Integrierte Tools verursachen separate Gebühren

QwenCloud führt derzeit die folgenden Tool-Gebühren zusätzlich zur Token-Nutzung auf:

Built-in toolCurrent fee
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web ExtractorFree for a limited time
Code InterpreterFree for a limited time

Function Calling und MCP haben keine separaten Tool-Gebühren, aber Toolbeschreibungen zählen weiterhin als Eingabetokens. Kostenlose Tool-Promotions können sich ändern; prüfen Sie den QwenCloud-Preisleitfaden, bevor Sie ein Produktionsbudget finalisieren.

Zum Beispiel kostet eine Anfrage mit 20K Eingabetokens, 2K Ausgabetokens und zwei Websuche-Aufrufen ungefähr:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

In diesem Beispiel entfallen etwa 27.8% der Gesamtkosten der Anfrage auf die zwei Suchaufrufe.

Qwen 3.8 Max Praxisbeispiele zu Kosten

Diese Beispiele verwenden die aktuellen modellspezifischen Raten von QwenCloud. Steuern, Retries, Fallbacks und anbieterabhängige Aufschläge sind ausgeschlossen.

Beispiel 1: Mittlere Agenten-Anfrage

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Ein erfolgreicher erster Versuch kostet etwa $0.13. Ein vollständiger Retry würde die Modellkosten auf ungefähr $0.26 erhöhen.

Beispiel 2: Analyse eines langen Dokuments

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Das Modell erhebt in seiner aktuellen Preisliste keinen separaten Aufschlag für langen Kontext, aber große Prompts verursachen dennoch erhebliche absolute Kosten.

Beispiel 3: Zwischengespeicherte Agenten-Sitzung

Angenommen, ein wiederverwendbares 100K-Token-Präfix, 10K neue Eingabetokens, 5K Ausgabetokens und 50 Aufrufe, während der explizite Cache gültig bleibt:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Geschätzte Einsparung = $8.917 bzw. 71.3%

Die geschätzte Einsparung hängt von erfolgreichen Cache-Treffern und einem stabilen Präfix ab. Lange Pausen oder häufige Änderungen an Systemprompts und Tool-Schemata verringern den Nutzen.

Qwen 3.8 Max vs. Qwen 3.7 Max: Preisvergleich

Qwen 3.8 Max ist zum Listenpreis 20% günstiger als Qwen 3.7 Max, aber Qwen 3.7 Max ist während seiner aktuellen 50%-Promotion 37.5% günstiger.

Model and pricing statusInput / 1MOutput / 1MContext
qwen3.8-max standard price$2.00$6.001M
qwen3.7-max list price$2.50$7.501M
qwen3.7-max current promotion$1.25$3.751M

Behalten Sie die CometAPI Qwen3.7 Max Modellseite als Fallback verfügbar, während Sie das neue Modell testen.

Der Preis pro Token ist nur ein Teil der Entscheidung. Qwen 3.8 Max kann dennoch wirtschaftlicher sein, wenn es die Erfolgsquote beim ersten Versuch verbessert, Tools zuverlässiger nutzt, Retries reduziert oder weniger manuelle Korrektur erfordert.

Verwenden Sie diese Produktionskennzahl:

Kosten pro akzeptierter Aufgabe =

(Modell-Tokens + Tool-Aufrufe + Retries + Fallback-Kosten + Prüfkosten)

÷ akzeptierte Ausgaben

Vom Anbieter gemeldete Benchmark-Gewinne sind ein Grund, anspruchsvolle Coding- und professionelle Workflows neu zu testen – kein Beweis dafür, dass jede Qwen 3.7-Workload migrieren sollte.

So migrieren Sie zu Qwen 3.8 Max

Das Ändern der Modellzeichenfolge ist notwendig, aber keine vollständige Produktionsmigration.

1. Testen Sie die Produktionsmodell-ID

Ersetzen Sie den Preview-Bezeichner in einer Testumgebung durch qwen3.8-max. Gehen Sie nicht davon aus, dass Preview-Aliasse, Defaults, Latenz oder das Antwortverhalten unverändert bleiben.

Eine minimale OpenAI-kompatible Anfrage kann so aussehen:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Beginnen Sie mit der minimal dokumentierten Anfrage. Fügen Sie Reasoning-Kontrollen nur hinzu, wenn die aktuelle API-Referenz für Ihren Endpunkt sie ausdrücklich unterstützt.

2. Kosten- und Leistungs-Telemetrie neu baselinen

Erfassen Sie mindestens:

  • Eingabe-, Ausgabe- und Reasoning-Tokens
  • Cache-Treffer und Cache-Erstellungs-Tokens
  • Time to first token und Gesamtlatenz
  • Tool-Aufrufe, Retries und Fallbacks
  • Akzeptierte versus abgelehnte Ausgaben
  • Zeit für manuelle Korrekturen

3. Testen Sie die von Ihrer Anwendung verwendete Schnittstelle erneut

Validieren Sie Streaming-Ereignisse, multimodale Nutzlasten, Tool-Schemata, strukturierte Ausgabe, Abschlussgründe, Nutzungsfelder, Fehlerbehandlung und Mehrturn-Verhalten. Die Produktionsmodellseite dokumentiert DashScope- und OpenAI-kompatiblen Zugriff; prüfen Sie jede zusätzliche Kompatibilitätsschicht, bevor Sie sich darauf verlassen.

4. Beachten Sie die praktischen Kontextgrenzen

Ein 1M-Kontextfenster ist nicht dasselbe wie ein 1M-Token-Nutzerprompt. QwenCloud listet eine maximale Eingabe von 991K ohne Reasoning und 983K mit Reasoning. Fügen Sie eine Sicherheitsmarge hinzu, damit die Anfrage noch Platz für Ausgabe und Reasoning hat.

5. Betreiben Sie Qwen 3.7 und Qwen 3.8 parallel

Verwenden Sie identische Prompts, Tools, Validatoren, Retry-Regeln und Datensätze. Vergleichen Sie Kosten pro akzeptierter Aufgabe und Latenz, anstatt einzelne Antworten nach Augenmaß zu beurteilen.

So evaluieren und routen Sie Qwen 3.8 Max

Verwenden Sie reale Workloads statt breiter Benchmark-Durchschnitte.

WorkloadSuggested tasksPrimary acceptance signal
Repository coding4Tests bestehen ohne manuelle Nachbesserung
Long-document analysis3Aussagen sind durch gelieferte Belege gestützt
Multimodal analysis2Relevante Bild- oder Videodetails korrekt genutzt
Tool-using agents3Korrekte Tool-Auswahl und gültige Argumente
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Verwenden Sie Qwen 3.8 Max für schwierige Repository-Arbeiten, langlaufende Agenten, multimodale Analysen und Workflows, bei denen Qwen 3.7 Akzeptanztests nicht besteht. Bleiben Sie bei Qwen 3.7 Max, wenn die Promotion die Kosten wesentlich senkt und das bestehende Modell Ihr Qualitätsziel bereits erfüllt.

Prüfen Sie die CometAPI-Preisseite und Live-Routing-Informationen, bevor Sie Schwellenwerte festlegen, da Anbieter-Verfügbarkeit und geroutete Preise unabhängig von den Direktlistenpreisen von QwenCloud variieren können. Das CometAPI Cookbook kann Ihnen helfen, reproduzierbare Anfragen und ein konsistentes Evaluations-Framework aufzubauen.

FAQ

Wie viel kostet die Qwen 3.8 Max API?

QwenCloud listet Qwen 3.8 Max derzeit mit $2 pro 1 Million Eingabetokens und $6 pro 1 Million Ausgabetokens. Cache-Nutzung und integrierte Tools haben separate Tarife.

Kostet Qwen 3.8 Max mehr oberhalb von 128K Tokens?

Auf der aktuellen modellspezifischen Preisliste ist kein separater Tarif für langen Kontext ausgewiesen. Lange Anfragen kosten mehr, weil sie mehr Tokens enthalten, nicht wegen eines höheren Einheitspreises.

Werden Reasoning-Tokens bei Qwen 3.8 Max abgerechnet?

Reasoning kann die erzeugte Nutzung und die Gesamtkosten erhöhen. Verwenden Sie die vom Endpunkt zurückgegebenen Felder für Reasoning- und Ausgabetokens, statt aus der sichtbaren Antwort zu schätzen.

Ist Qwen 3.8 Max Open Source?

Qwen kündigte an, dass offene Gewichte auf die API-Veröffentlichung folgen würden. Bezeichnen Sie das Modell nicht als herunterladbar oder selbst hostbar, bis ein offizieller Checkpoint und eine Lizenz verfügbar sind.

Sollten Qwen 3.7 Max-Nutzer sofort migrieren?

Nicht automatisch. Qwen 3.8 Max hat einen niedrigeren Standardlistenpreis, während Qwen 3.7 Max während seiner aktuellen Promotion günstiger ist. Migrieren Sie, wenn Ihre eigenen Daten zu Qualität, Latenz, Cache-Verhalten und Kosten pro akzeptierter Aufgabe die Umstellung stützen.

Qwen 3.8 Max mit CometAPI testen

Verwenden Sie den CometAPI Quickstart, um einen OpenAI-kompatiblen Client zu konfigurieren. Bevor Sie Produktionstraffic senden, bestätigen Sie, dass qwen3.8-max in Ihrem Konto live ist, und verifizieren Sie den dort angezeigten, gerouteten Preis.

Vergleichen Sie ihn mit Ihrer Qwen 3.7-Baseline mit identischen Prompts, Validatoren, Retry-Richtlinien und Telemetrie. So bleibt die Evaluation auf das Modell fokussiert statt auf Änderungen am Test-Harness.

Bereit, die KI-Entwicklungskosten um 20 % zu senken?

In wenigen Minuten kostenlos starten. Inklusive kostenlosem Testguthaben. Keine Kreditkarte erforderlich.

Mehr lesen