Specyfikacje techniczne Qwen3.7-Plus
| Element | Specyfikacja |
|---|---|
| Model Name | Qwen3.7-Plus |
| Provider | Alibaba Cloud (Qwen Team) |
| API Model ID | qwen3.7-plus |
| Model Type | Model agenta multimodalnego |
| Input Types | Tekst, obrazy, wideo |
| Output Types | Tekst |
| Context Window | Do 1,000,000 tokenów |
| Maximum Input Tokens | ~991.8K |
| Maximum Output Tokens | ~65.5K |
| Core Strengths | Wnioskowanie wizualno‑językowe, programowanie, interakcja z GUI, przepływy pracy agenta |
| Built-in Features | Wywoływanie funkcji, strukturyzowane wyniki, pamięć podręczna, wyszukiwanie w sieci, Batch API |
| API Compatibility | Zgodny z OpenAI poprzez DashScope / Model Studio |
Czym jest Qwen3.7-Plus?
Qwen3.7-Plus to zrównoważony multimodalny flagowiec w generacji Qwen 3.7 od Alibaba. Podczas gdy Qwen3.7-Max koncentruje się na czysto tekstowym wnioskowaniu i długohoryzontowym programowaniu, Qwen3.7-Plus rozszerza te możliwości o natywne rozumienie obrazów i wideo, pozwalając wnioskować jednocześnie na podstawie informacji wizualnych i tekstowych w ramach jednego modelu.
Model został zaprojektowany wokół idei multimodalnego interaktywnego agenta hybrydowego: potrafi interpretować zrzuty ekranu, analizować wykresy, rozumieć interfejsy, generować kod na podstawie odniesień wizualnych oraz używać narzędzi do realizacji wieloetapowych zadań. Czyni go to szczególnie atrakcyjnym dla agentów AI, automatyzacji GUI i przepływów produktywności, w których liczy się kontekst wizualny.
Główne funkcje Qwen3.7-Plus
- Natywne wejście multimodalne obsługujące tekst, obrazy i wideo w ujednoliconym potoku wnioskowania.
- Okno kontekstu do 1M tokenów, umożliwiające analizę dużych baz kodu i pracę z długimi dokumentami.
- Hybrydowe możliwości agenta GUI + CLI, pozwalające modelowi rozumieć ekrany i wchodzić w interakcję ze środowiskami oprogramowania.
- Zaawansowane programowanie i użycie narzędzi, w tym wywoływanie funkcji, strukturyzowane wyniki i integrację z narzędziami zewnętrznymi.
- Rozumienie wizualne wykresów, dokumentów i zrzutów ekranu, przydatne w zadaniach biznesowych, inżynieryjnych i UI.
- Punkt końcowy API zgodny z OpenAI, umożliwiający stosunkowo łatwą migrację z istniejącej infrastruktury LLM.
Wyniki benchmarków Qwen3.7-Plus
Zgodnie z publicznymi raportami i niezależnymi platformami oceny, Qwen3.7-Plus oferuje czołowy poziom wydajności multimodalnej i agentowej:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: approximately 90.0%.
- IFBench: approximately 78.0%.
- AA Long Context Reasoning (AA-LCR): approximately 65.0%.
- Terminal-Bench Hard: approximately 47.0%, co odzwierciedla silne możliwości agentowego programowania.
Alibaba raportuje także, że Qwen3.7-Plus wypada konkurencyjnie względem wiodących modeli zastrzeżonych w benchmarkach agentowych i programistycznych, ze szczególną mocą w zadaniach multimodalnych i interakcji z interfejsem.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Feature | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Input Modalities | Tekst, obraz, wideo | Tylko tekst | Tekst, obraz |
| Context Window | Do 1M tokenów | 1M tokenów | Duży kontekst |
| Vision Understanding | Doskonałe | Brak obsługi | Silne |
| Agent / GUI Interaction | Natywny nacisk | Ograniczona | Dobra |
| Long-Horizon Text Reasoning | Bardzo silne | Najlepsze w rodzinie Qwen | Doskonałe |
| Best Use Case | Agenci multimodalni i produktywność | Programowanie, matematyka, głębokie wnioskowanie | Wnioskowanie i programowanie dla przedsiębiorstw |
W projektach obejmujących zrzuty ekranu, automatyzację UI, debugowanie wizualne lub przepływy multimodalne, Qwen3.7-Plus jest na ogół lepszym wyborem. Do czysto tekstowego wnioskowania lub programowania na skalę repozytorium Qwen3.7-Max pozostaje silniejszą opcją.
Ograniczenia
- Qwen3.7-Plus jest obecnie udostępniany jako własnościowy model w fazie podglądowej, a niektóre możliwości mogą się zmienić przed stabilnym wydaniem.
- Funkcje wywoływania funkcji i niektóre narzędzia agenta są nadal wdrażane.
- W przypadku czysto tekstowych, intensywnie opartych na wnioskowaniu zadań Qwen3.7-Max może zapewniać nieco lepszą wydajność.
- Jak w przypadku większości dużych modeli multimodalnych, deweloperzy powinni zweryfikować wydajność na własnych zbiorach obrazów i UI przed wdrożeniem produkcyjnym.
Reprezentatywne przypadki użycia
- Agenci AI łączący interakcje przeglądarki, GUI i terminala.
- Debugowanie oprogramowania na podstawie zrzutów ekranu i ujęć interfejsu.
- Analiza dokumentów, wykresów i pulpitów nawigacyjnych.
- Wizualni asystenci programowania generujący kod na podstawie makiet lub diagramów.
- Korporacyjne przepływy pracy zwiększające produktywność, obejmujące mieszane dane wejściowe tekstowe i obrazowe.
- Multimodalni asystenci badawczy łączący wyszukiwanie w sieci z rozumieniem wizualnym.