TL;DR Das Qwen-Team von Alibaba hat Qwen3.8-Max am 3. August 2026 offiziell veröffentlicht — ein sparsames Mixture-of-Experts-Modell mit 2.4 Billionen Gesamtparametern (95 Milliarden aktiv), einem 1‑Million‑Token‑Kontextfenster und nativer Multimodal‑Unterstützung (Text + Bild + Video).
Es ist das erste Qwen‑Max‑Modell mit angekündigten offenen Gewichten (geplant für die folgende Woche). Aggressiv bepreist mit $2 pro 1 Million Eingabe‑Token und $6 pro 1 Million Ausgabe‑Token liefert es starke Ergebnisse bei Aufgaben mit langem Zeithorizont, agentischer Autonomie, autonomer Softwareentwicklung (einschließlich eines dokumentierten, 16‑tägigen selbst‑evolvierenden Coding‑Projekts), Replikation von Forschung sowie Multimodal‑Benchmarks. Es konkurriert eng mit Modellen wie Kimi K3 und liegt in der Leistungsfähigkeit über schlankeren Optionen wie DeepSeek V4 Flash, bleibt dabei aber für ausgabeintensive Workloads deutlich kosteneffizienter als westliche Frontier‑Modelle. Entwickler können es ab heute über QwenCloud / Alibaba Cloud Model Studio und über vereinheitlichte Plattformen wie CometAPI nutzen.
Kernaussagen
- Skalierung und Effizienz: 2.4T gesamt / 95B aktiv, MoE‑Architektur, aufgebaut auf Qwen‑3.5‑Fundamenten, ermöglicht Frontier‑Leistung zu praktikablen Inferenzkosten.
- Stärke über lange Zeithorizonte: Nachgewiesene mehrtägige autonome Codierung (265 Commits, 127 PRs über ~16 Tage ohne menschliches Eingreifen), Reproduktion und Verbesserung von Forschungsarbeiten sowie einjähriger simulierter E‑Commerce‑Betrieb.
- Benchmark‑Highlights: PaperBench 93.0 (führend), Terminal‑Bench 2.1 86.6, starke Multimodal‑ und Dokument‑Scores; wettbewerbsfähig, aber nicht auf jeder reinen Coding‑Agent‑Rangliste dominierend im Vergleich zu Claude Fable 5 oder GPT‑5.6 Sol.
- Preisvorteil: Einheitlich $2 / $6 pro 1M Token über das gesamte 1M‑Kontextfenster (gecachte Eingabe ~$0.25), günstiger als Kimi K3 bei Ausgaben und viele westliche Modelle.
- Verfügbarkeit: Live auf QwenCloud und Alibaba Cloud Model Studio (OpenAI‑ und Anthropic‑kompatible APIs); offene Gewichte geplant; bereits auf CometAPI als
qwen3.8-maxgelistet für vereinheitlichten Zugriff neben 500+ weiteren Modellen. Offene Gewichte kommen in Kürze; eine kleinere Qwen3.8‑27B‑Variante ist ebenfalls für den praktischen lokalen/Edge‑Einsatz geplant. - Praktischer Vorteil: Überzeugt bei der Produktion von End‑to‑End‑Deliverables statt Einzeldreh‑Antworten — ideal für Coding‑Agents, Forschungspipelines, Office‑Workflows und lang laufende Agent‑Loops.
Was ist Qwen3.8-Max?
Qwen3.8‑Max ist Alibabas neuestes und leistungsfähigstes Flaggschiffmodell der Qwen‑Serie, offiziell veröffentlicht am 3. August 2026 (nach einer Preview Mitte Juli auf der World AI Conference in Shanghai). Es markiert eine bewusste Verschiebung hin zu Modellen, die komplexe, mehrtägige Aufgaben mit minimaler Aufsicht end‑to‑end erledigen und produktionsreife Deliverables erzeugen können.
Architektonisch ist es ein sparsames Mixture‑of‑Experts‑Modell mit 2.4 Billionen Gesamtparametern, von denen pro Token nur etwa 95 Milliarden aktiviert werden. Dieses auf Qwen 3.5 aufbauende Design verbindet enorme Kapazität mit Inferenz‑Effizienz. Das Modell unterstützt ein 1‑Million‑Token‑Kontextfenster (dokumentiertes Maximal‑Input um 991K Token und Maximal‑Output um 131K Token), native multimodale Eingaben (Text, Bilder und Video) sowie Text‑Ausgaben. Es bietet Steuerung des Reasoning‑Aufwands (xhigh / medium / low) und unterstützt sowohl OpenAI Chat Completions als auch Anthropic‑kompatible Protokolle, wodurch es Drop‑in‑kompatibel mit populären Agent‑Frameworks wie Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw ist.
Im Gegensatz zu früheren Max‑Modellen, die geschlossen blieben, hat sich Alibaba verpflichtet, die Gewichte von Qwen3.8‑Max (und einer kleineren Qwen3.8‑27B‑Variante) in der Woche nach dem Launch über Hugging Face und ModelScope zu veröffentlichen — das erste Mal, dass ein Qwen‑Max‑Modell offen verfügbar sein wird.
Das Modell ist ausgerichtet auf Coding‑Agents, professionelle Arbeit in der Praxis („cowork“), Forschung, langfristige Planung und multimodale Agent‑Loops. Offizielle Demos betonen selbst‑evolvierendes Verhalten: Das Modell erstellt Issues, weist sie sich selbst zu, schreibt und testet Code, iteriert auf Feedback und verbessert über längere Zeiträume sein eigenes Tooling.
Quellen: Offizieller Qwen‑Blog und Alibaba‑Cloud‑Ankündigungen (August 2026); Artificial Analysis Model Card; unabhängige Reviews zur GA‑Veröffentlichung.
Was ist neu in Qwen3.8-Max?
Gegenüber dem Vorgänger Qwen3.7‑Max liefert die 3.8‑Generation deutliche Fortschritte bei agentischem Coding, Langzeit‑Zuverlässigkeit, multimodalem Reasoning und Dokument/Office‑Performance. Wichtige Neuerungen:
Echte Autonomie über lange Zeithorizonte:
Das Modell kann über Hunderte Turns oder mehrere Tage geschlossene, adaptive Lernschleifen aufrechterhalten. Dokumentierte Beispiele umfassen ein 16‑tägiges autonomes Software‑Engineering‑Projekt, das ein selbst‑evolvierendes CLI‑Tool (oh‑my‑cli) mit 265 Commits, 127 Pull Requests und 151 Issues vollständig ohne menschliches Eingreifen erzeugte; die Reproduktion und Verbesserung der Methodik einer Forschungsarbeit (einschließlich GPU‑Trainingsschleifen und messbarer Benchmark‑Gewinne); sowie ein vollständig simuliertes Jahr E‑Commerce‑Betrieb, das Baselines deutlich übertraf.
Multimodalität als kontinuierliche Feedback‑Schleife:
Vision ist nicht bloß eine Eingabemodalität. Das Modell nutzt visuelles Verständnis für Planung, Ausführungs‑Monitoring und Selbstkorrektur — ermöglicht Aufgaben wie Screenshot‑zu‑Code‑Rekonstruktion, interaktive Spiel/Animations‑Generierung und 2D‑zu‑3D‑Visualisierung.
Das Modell rangiert in frühen Post‑Release‑Daten hoch auf der Text Arena (fünfter berichtet) und Vision Arena (zweiter berichtet) (Link).


Fokus auf End‑to‑End‑Deliverables:
Schwerpunkt auf produktionsreifen Ergebnissen über Hunderte Berufe hinweg statt isolierter Antworten.
Denk- und Schnellinferenz-Modi
Zwei Modi: Denkmodus und Schnellinferenz‑Modus. Denkmodus für tieferes Reasoning und komplexe Planung. Schnellmodus für geringere Latenz bei einfachen Aufgaben. Alibabas OpenCode‑Dokumente zeigen thinking für die Qwen3.8‑Routen aktiviert und listen Reasoning‑Kontrollen für die Preview‑Route, darunter xhigh, medium und low.
Diese Aufteilung ist für Produktdesign wertvoll. Teams sollten nicht bei jeder Anfrage den schwersten Reasoning‑Modus verwenden. Ein Support‑Bot kann ein einfaches Ticket günstig klassifizieren, mit einem schnelleren Modell zusammenfassen und nur bei komplizierten Richtlinienentscheidungen, Ursachenanalysen, Vertragsprüfungen oder Migrationsplänen in den Qwen3.8‑Max‑Denkmodus eskalieren.
Diese Fähigkeiten wurden durch interne, lang laufende Experimente und eine umfassende Benchmark‑Suite validiert, die Coding‑Agents, allgemeine Agents, multimodales Reasoning, Dokumentverständnis sowie Wahrnehmungs-/Grounding‑Aufgaben abdeckt.
Benchmarking: Leistung der Datenquantisierung
Alibaba veröffentlichte zur GA ein umfangreiches internes Benchmark‑Set. Unabhängige Verifikation (Artificial Analysis Intelligence Index, LMArena, etc.) holte in den Tagen nach dem Release auf; frühe Artificial‑Analysis‑Daten platzierten Qwen3.8‑Max bei einem Intelligence Index von 53 (Rang ~16/186 im Track), mit bemerkter hoher Verbosität und relativ geringerer Geschwindigkeit.
Ausgewählte offizielle/berichtete Scores (Qwen3.8‑Max vs. ausgewählte Peers):
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
Qwen3.8‑Max führt häufig oder liegt nahe an der Spitze bei multimodalem Reasoning, Dokument/Office‑Aufgaben und bestimmten agentischen Coding/Research‑Metriken, während es bei einigen reinen Software‑Engineering‑Agent‑Suiten hinter den stärksten geschlossenen Modellen zurückliegt. Besonders bemerkenswert ist der Generationssprung auf FrontierSWE und DeepSWE. Anbieteraussagen sind als Richtungen zu verstehen; unabhängige Läufe und workloadspezifische Evaluierung bleiben essenziell.
API-Preise für Qwen3.8-Max
Offizielle Qwen3.8‑Max‑Preise (GA‑Tarife Anfang August 2026) bei Alibaba Cloud Model Studio / QwenCloud:
- Eingabe: $2.00 pro 1 Million Token
- Ausgabe: $6.00 pro 1 Million Token (inklusive Thinking/Reasoning‑Token)
- Gecachte Eingabe: ungefähr $0.25 pro 1 Million Token (signifikante Ersparnis bei wiederholten langen Kontexten)
Die Preise sind über das gesamte 1M‑Token‑Kontextfenster flach — ein bemerkenswerter Vorteil gegenüber vielen Wettbewerbern, die Langkontext‑Aufschläge erheben. Mengen- und andere Rabatte können je nach Region und Plan gelten.
Vergleichskontext (ungefähre Listenpreise im gleichen Zeitraum):
- Kimi K3: ~$3 / $15
- Höherwertige Claude‑/GPT‑Frontier‑Modelle: oft $5+ / $15–25+
- DeepSeek‑V4 Flash-Varianten: deutlich niedriger (für viele Anwendungsfälle oft unter $0.50 kombiniert)
Für Teams, die bereits mehrere Anbieter nutzen, bieten aggregierte Gateways wie CometAPI typischerweise ~20% Rabatt gegenüber offiziellen Tarifen, einen einzigen OpenAI‑kompatiblen Endpunkt, einheitliche Abrechnung und einfaches Model‑Switching bzw. Failover. So wird das Experimentieren mit Qwen3.8‑Max (und der gleichzeitige Vergleich mit DeepSeek V4 Flash, Kimi‑Modellen oder anderen) operativ einfacher und oft günstiger. Prüfen Sie die aktuellen CometAPI‑Preisseiten und Free‑Credit‑Angebote für die jüngsten effektiven Tarife.
Wie Qwen3.8-Max mit Kimi K3 und DeepSeek V4 Flash mithält
| Dimension | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Gesamt-/aktive Parameter | 2.4T / ~95B | ~2.8T / ~104B | 284B / 13B |
| Kontext | 1M | 1M | 1M |
| Multimodal | Text + Bild + Video | Text + Bild + Video | Nur Text |
| Preis (Ein-/Ausgabe) | $2 / $6 | $3 / $15 | ~$0.14 / $0.28 (deutlich günstiger) |
| Offene Gewichte | Geplant (nächste Woche) | Bereits veröffentlicht | MIT, verfügbar |
| Stärken | Langzeitautonomie, Multimodalität, PaperBench, Ausgabepreis | Starke unabhängige Scores, Führung bei Frontend‑Coding Arena | Extreme Kosteneffizienz, solide agentische Codierung |
| Relative Einordnung | Wettbewerbsfähig / führend auf mehreren Agent‑ & Multimodal‑Benches | Leichter Vorsprung auf einigen geprüften Intelligenz‑Indizes | Exzellenter Wert; niedrigere absolute Fähigkeit |
Qwen3.8‑Max erreicht Kimi K3 bei der Kosteneffizienz für ausgabeintensive Arbeit und bei multimodalen Aufgaben oft oder übertrifft ihn, während DeepSeek V4 Flash der Budget‑König für hochvolumige Text‑Workloads bleibt, bei denen Spitzenfähigkeit zweitrangig ist. Viele Teams werden alle drei über ein vereinheitlichtes Gateway einsetzen, einfachen Traffic an Flash‑Klasse‑Modelle routen und komplexe Agent‑Sessions Qwen3.8‑Max oder Kimi K3 vorbehalten.
Entspricht Qwen3.8-Max Kimi K3?
In mancher Hinsicht ja. Es erreicht die 1M‑Kontext‑Klasse, hat eine starke Multimodal‑Positionierung und ist bei Standard‑Input/Output‑Preisen günstiger. Es erreicht nicht Kimi K3s 2.8T Gesamtparameterzahl, und Kimis öffentliche Dokumentation bietet derzeit besonders detaillierte Hinweise zu Tools, Kontext‑Caching, strukturierter Ausgabe und Vision‑Guidance.
Entspricht Qwen3.8-Max DeepSeek V4 Flash?
Es konkurriert bei 1M‑Kontext und MoE‑Architektur, die Produkte zielen jedoch auf unterschiedliche Jobs. DeepSeek V4 Flash ist die ökonomische, schnelle Route. Qwen3.8‑Max ist die größere, hochfähige Route für Arbeiten, bei denen multimodales Verständnis, fortgeschrittenes Reasoning und Enterprise‑Produktivität wichtiger sind als der niedrigste Token‑Preis.
Was kann Qwen3.8-Max?
Programmierung und Softwareentwicklung
Qwen3.8‑Max ist eine starke Wahl für Full‑Stack‑Entwicklung, Code‑Reviews, Repository‑Verständnis, Migrationsplanung, API‑Design, Debugging, Test‑Reasoning und Software‑Architektur. Sein langer Kontext hilft, wenn viele Dateien, Logs und Anforderungen gleichzeitig im Blick bleiben müssen. Nutzen Sie es für schwierige Code‑Aufgaben, nicht für jedes Autocomplete oder einfache Lint‑Erklärungen.
Büro- und Wissensarbeit
Die „Cowork“‑Positionierung des Modells ist wichtig. In Unternehmen stellen Mitarbeitende nicht nur Chat‑Fragen: Sie vergleichen PDFs, fassen Meetings zusammen, prüfen Folien, interpretieren Tabellen, checken Verträge, schreiben Berichte und bereiten Entscheidungen aus unstrukturierten Belegen vor. Qwen3.8‑Max’ Multimodalität und langer Kontext machen es geeignet für Office‑Workflows, in denen Text, Dokumente, Screenshots und strukturierte Daten zusammen beurteilt werden müssen.
Agentische Workflows
Qwen3.8‑Max ist nützlich für Agent‑Planung: ein Ziel in Schritte zerlegen, entscheiden, welches Tool aufzurufen ist, Ergebnisse bewerten und den Plan revidieren. In CometAPI wird dies praktikabler, weil dieselbe Anwendung einfache Schritte an günstigere Modelle routen und Qwen3.8‑Max für Planung oder Verifikation reservieren kann.
Erste Schritte und CometAPI-Integrationstipps
- Direkter Zugriff: Verwenden Sie QwenCloud oder Alibaba Cloud Model Studio mit der Modell‑ID
qwen3.8-max. Sowohl OpenAI‑kompatible als auch Anthropic‑kompatible Endpunkte werden unterstützt. - Vereinheitlichter Zugriff über CometAPI: Registrieren Sie sich auf CometAPI.com, holen Sie einen API‑Key, setzen Sie
base_urlaufhttps://api.cometapi.com/v1und rufen Sie mitmodel="qwen3.8-max"auf. Derselbe Key funktioniert für DeepSeek V4 Flash, Kimi K3, Claude, GPT und Hunderte weitere Modelle — ideal für Experimente, Kostenkontrolle und produktives Routing. CometAPI betont wettbewerbsfähige Preise, niedrige Latenz und schnelle Aufnahme neuer Modelle (Qwen3.8‑Max wurde kurz nach Launch gelistet). - Agent‑Frameworks: Direkt in Claude Code, OpenClaw oder eigene Harnesses einstecken. Für komplexe Langzeit‑Jobs höheren Reasoning‑Aufwand aktivieren.
- Offene Gewichte: Beobachten Sie Hugging Face / ModelScope für die bevorstehende Veröffentlichung, wenn Sie On‑Premise‑ oder Fine‑Tuning‑Deployments benötigen.
