Technische Spezifikationen von Qwen3.7-Plus
| Element | Spezifikation |
|---|---|
| Modellname | Qwen3.7-Plus |
| Anbieter | Alibaba Cloud (Qwen Team) |
| API-Modell-ID | qwen3.7-plus |
| Modelltyp | Multimodales Agentenmodell |
| Eingabetypen | Text, Bilder, Video |
| Ausgabetypen | Text |
| Kontextfenster | Bis zu 1,000,000 Token |
| Maximale Eingabe-Token | ~991.8K |
| Maximale Ausgabe-Token | ~65.5K |
| Kernstärken | Visuell-sprachliches Schlussfolgern, Programmieren, GUI-Interaktion, Agent-Workflows |
| Integrierte Funktionen | Funktionsaufrufe, strukturierte Ausgaben, Cache, Websuche, Batch-API |
| API-Kompatibilität | OpenAI-kompatibel über DashScope / Model Studio |
Was ist Qwen3.7-Plus?
Qwen3.7-Plus ist das ausgewogene multimodale Flaggschiff der Qwen-Generation 3.7 von Alibaba. Während Qwen3.7-Max sich auf reines Text-Schlussfolgern und Programmierung über lange Horizonte konzentriert, erweitert Qwen3.7-Plus diese Fähigkeiten um natives Bild- und Videoverständnis, sodass es innerhalb eines einzigen Modells über visuelle und textuelle Informationen hinweg schlussfolgern kann.
Das Modell ist nach dem Prinzip eines multimodalen interaktiven Hybridagenten konzipiert: Es kann Screenshots interpretieren, Diagramme analysieren, Oberflächen verstehen, Code aus visuellen Referenzen generieren und Werkzeuge einsetzen, um mehrstufige Aufgaben abzuschließen. Das macht es besonders attraktiv für KI-Agenten, GUI-Automatisierung und Produktivitäts-Workflows, in denen visueller Kontext wichtig ist.
Hauptfunktionen von Qwen3.7-Plus
- Nativ multimodale Eingabe, die Text, Bilder und Video in einem einheitlichen Schlussfolgerungs-Workflow unterstützt.
- Kontextfenster bis zu 1M Token, ermöglicht Analyse großer Codebasen und Langdokument-Workflows.
- Hybride GUI- + CLI-Agentenfähigkeiten, wodurch das Modell Bildschirme versteht und mit Softwareumgebungen interagiert.
- Erweitertes Programmieren und Tool-Nutzung, einschließlich Funktionsaufrufen, strukturierten Ausgaben und Integration externer Tools.
- Visuelles Verständnis für Diagramme, Dokumente und Screenshots, wodurch es für Geschäfts-, Ingenieur- und UI-Aufgaben nützlich ist.
- OpenAI-kompatibler API-Endpunkt, ermöglicht relativ einfache Migration aus bestehender LLM-Infrastruktur.
Benchmark-Leistung von Qwen3.7-Plus
Laut öffentlichen Benchmark-Berichten und Plattformen von Drittanbietern liefert Qwen3.7-Plus Leistung auf Spitzenniveau in multimodalen und agentenorientierten Szenarien:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: ungefähr 90.0%.
- IFBench: ungefähr 78.0%.
- AA Long Context Reasoning (AA-LCR): ungefähr 65.0%.
- Terminal-Bench Hard: ungefähr 47.0%, was starke agentenorientierte Programmierfähigkeiten widerspiegelt.
Alibaba berichtet außerdem, dass Qwen3.7-Plus in Agent- und Coding-Benchmarks wettbewerbsfähig mit führenden proprietären Modellen ist, mit besonderer Stärke in multimodalen Aufgaben und UI-Interaktion.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Merkmal | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Eingabemodalitäten | Text, Bild, Video | Nur Text | Text, Bild |
| Kontextfenster | Bis zu 1M Token | 1M Token | Großes Kontextfenster |
| Visuelles Verständnis | Hervorragend | Nicht unterstützt | Stark |
| Agenten-/GUI-Interaktion | Nativer Schwerpunkt | Begrenzt | Gut |
| Langfristiges Text-Schlussfolgern | Sehr stark | Am besten in der Qwen-Familie | Hervorragend |
| Optimaler Anwendungsfall | Multimodale Agenten und Produktivität | Programmierung, Mathematik, tiefes Schlussfolgern | Enterprise-Reasoning und Programmierung |
Für Projekte, die Screenshots, UI-Automatisierung, visuelles Debugging oder multimodale Workflows beinhalten, ist Qwen3.7-Plus in der Regel die bessere Wahl. Für rein textbasierte Schlussfolgerungen oder Repository-scale-Programmierung bleibt Qwen3.7-Max die stärkere Option.
Einschränkungen
- Qwen3.7-Plus ist derzeit als proprietäres Modell im Vorschau-Stadium veröffentlicht; einige Funktionen können sich vor der stabilen Veröffentlichung noch ändern.
- Funktionsaufrufe und bestimmte Agent-Tooling-Funktionen werden noch ausgerollt.
- Für rein textbasierte, reasoning-intensive Arbeitslasten kann Qwen3.7-Max eine leicht bessere Leistung liefern.
- Wie bei den meisten großen multimodalen Modellen sollten Entwickler die Leistung an eigenen Bild- und UI-Datensätzen vor dem Produktionseinsatz validieren.
Repräsentative Anwendungsfälle
- KI-Agenten, die Browser-, GUI- und Terminal-Interaktionen kombinieren.
- Software-Debugging anhand von Screenshots und UI-Aufnahmen.
- Analyse von Dokumenten, Diagrammen und Dashboards.
- Visuelle Coding-Assistenten, die Code aus Mockups oder Diagrammen generieren.
- Produktivitäts-Workflows im Unternehmen mit gemischten Text- und Bildeingaben.
- Multimodale Forschungsassistenten, die Websuche mit visuellem Verständnis kombinieren.