Technische Spezifikationen von Qwen3.7-Plus
| Element | Spezifikation |
|---|---|
| Model Name | Qwen3.7-Plus |
| Provider | Alibaba Cloud (Qwen Team) |
| API Model ID | qwen3.7-plus |
| Model Type | Multimodales Agentenmodell |
| Input Types | Text, Bilder, Video |
| Output Types | Text |
| Context Window | Bis zu 1,000,000 Token |
| Maximum Input Tokens | ~991.8K |
| Maximum Output Tokens | ~65.5K |
| Core Strengths | Bild-Text-Reasoning, Programmierung, GUI-Interaktion, Agenten-Workflows |
| Built-in Features | Funktionsaufrufe, strukturierte Ausgaben, Cache, Websuche, Batch-API |
| API Compatibility | OpenAI-kompatibel über DashScope / Model Studio |
Was ist Qwen3.7-Plus?
Qwen3.7-Plus ist das ausgewogene multimodale Flaggschiff der Qwen-Generation 3.7 von Alibaba. Während Qwen3.7-Max sich auf reines Text-Reasoning und langfristige Codeerstellung konzentriert, erweitert Qwen3.7-Plus diese Fähigkeiten um natives Bild- und Videoverständnis, sodass es visuelle und textuelle Informationen innerhalb eines einzigen Modells gemeinsam erschließen kann.
Das Modell ist auf die Idee eines multimodalen, interaktiven Hybrid-Agenten ausgerichtet: Es kann Screenshots interpretieren, Diagramme analysieren, Oberflächen verstehen, Code aus visuellen Referenzen generieren und Werkzeuge verwenden, um mehrstufige Aufgaben zu erledigen. Dies macht es besonders attraktiv für AI-Agenten, GUI-Automatisierung und Produktivitäts-Workflows, bei denen visueller Kontext wichtig ist.
Hauptfunktionen von Qwen3.7-Plus
- Native multimodale Eingaben, die Text, Bilder und Video in einer einheitlichen Reasoning-Pipeline unterstützen.
- Kontextfenster von bis zu 1M Token, ermöglicht Analyse großer Codebasen und Workflows mit langen Dokumenten.
- Hybride GUI- + CLI-Agentenfähigkeiten, sodass das Modell Bildschirme versteht und mit Softwareumgebungen interagiert.
- Fortgeschrittene Programmierung und Tool-Nutzung, einschließlich Funktionsaufrufen, strukturierten Ausgaben und Integration externer Tools.
- Visuelles Verständnis für Diagramme, Dokumente und Screenshots, wodurch es für Geschäfts-, Engineering- und UI-Aufgaben nützlich ist.
- OpenAI-kompatibler API-Endpunkt, der eine relativ einfache Migration aus bestehender LLM-Infrastruktur ermöglicht.
Benchmark-Leistung von Qwen3.7-Plus
Laut öffentlichen Benchmark-Berichten und Drittanbieter-Evaluierungsplattformen liefert Qwen3.7-Plus eine Spitzenleistung in multimodalen und agentischen Aufgaben:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: ungefähr 90.0%.
- IFBench: ungefähr 78.0%.
- AA Long Context Reasoning (AA-LCR): ungefähr 65.0%.
- Terminal-Bench Hard: ungefähr 47.0%, was starke agentische Programmierfähigkeiten widerspiegelt.
Alibaba berichtet außerdem, dass Qwen3.7-Plus bei Agenten- und Programmierbenchmarks wettbewerbsfähig mit führenden proprietären Modellen ist, mit besonderer Stärke bei multimodalen Aufgaben und UI-Interaktion.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Merkmal | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Eingabemodalitäten | Text, Bild, Video | Nur Text | Text, Bild |
| Kontextfenster | Bis zu 1M Token | 1M Token | Großer Kontext |
| Visuelles Verständnis | Exzellent | Nicht unterstützt | Stark |
| Agent-/GUI-Interaktion | Nativer Schwerpunkt | Begrenzt | Gut |
| Langfristiges Text-Reasoning | Sehr stark | Am besten in der Qwen-Familie | Exzellent |
| Bester Anwendungsfall | Multimodale Agenten und Produktivität | Programmierung, Mathematik, tiefes Reasoning | Enterprise-Reasoning und Programmierung |
Für Projekte, die Screenshots, UI-Automatisierung, visuelles Debugging oder multimodale Workflows umfassen, ist Qwen3.7-Plus in der Regel die bessere Wahl. Für rein textbasiertes Reasoning oder Programmierung im Repository-Maßstab bleibt Qwen3.7-Max die stärkere Option.
Einschränkungen
- Qwen3.7-Plus wird derzeit als proprietäres Modell in der Vorschauphase veröffentlicht, und einige Fähigkeiten können sich vor der stabilen Veröffentlichung noch ändern.
- Funktionsaufrufe und bestimmte Agenten-Tooling-Funktionen werden noch ausgerollt.
- Für rein textbasierte, reasoning-intensive Workloads kann Qwen3.7-Max eine leicht bessere Leistung liefern.
- Wie bei den meisten großen multimodalen Modellen sollten Entwickler die Leistung anhand eigener Bild- und UI-Datensätze validieren, bevor sie in Produktion gehen.
Repräsentative Anwendungsfälle
- KI-Agenten, die Browser-, GUI- und Terminal-Interaktionen kombinieren.
- Software-Debugging anhand von Screenshots und UI-Aufnahmen.
- Analyse von Dokumenten, Diagrammen und Dashboards.
- Visuelle Coding-Assistenten, die Code aus Mockups oder Diagrammen generieren.
- Produktivitäts-Workflows im Enterprise-Umfeld mit gemischten Text- und Bildeingaben.
- Multimodale Forschungsassistenten, die Websuche mit visuellem Verständnis kombinieren