Specyfikacja techniczna Qwen3.7-Plus
| Pozycja | Specyfikacja |
|---|---|
| Nazwa modelu | Qwen3.7-Plus |
| Dostawca | Alibaba Cloud (Qwen Team) |
| ID modelu API | qwen3.7-plus |
| Typ modelu | Wielomodalny model agenta |
| Typy wejścia | Tekst, obrazy, wideo |
| Typy wyjścia | Tekst |
| Okno kontekstu | Do 1,000,000 tokenów |
| Maksymalna liczba tokenów wejściowych | ~991.8K |
| Maksymalna liczba tokenów wyjściowych | ~65.5K |
| Kluczowe mocne strony | Rozumowanie łączące obraz i język, programowanie, interakcja z GUI, przepływy pracy agenta |
| Wbudowane funkcje | Wywoływanie funkcji, strukturyzowane wyjścia, pamięć podręczna, wyszukiwanie w sieci, API wsadowe |
| Zgodność API | Zgodne z OpenAI za pośrednictwem DashScope / Model Studio |
Czym jest Qwen3.7-Plus?
Qwen3.7-Plus to zrównoważony, wielomodalny flagowiec w generacji Qwen 3.7 firmy Alibaba. Podczas gdy Qwen3.7-Max koncentruje się na czysto tekstowym rozumowaniu i długohoryzontowym programowaniu, Qwen3.7-Plus rozszerza te możliwości o natywne rozumienie obrazów i wideo, umożliwiając wnioskowanie na podstawie informacji wizualnych i tekstowych w jednym modelu.
Model został zaprojektowany wokół idei wielomodalnego interaktywnego agenta hybrydowego: potrafi interpretować zrzuty ekranu, analizować wykresy, rozumieć interfejsy, generować kod na podstawie odwołań wizualnych oraz używać narzędzi do realizacji wieloetapowych zadań. Czyni to go szczególnie atrakcyjnym dla agentów AI, automatyzacji GUI i przepływów pracy związanych z produktywnością, w których kontekst wizualny ma znaczenie.
Główne funkcje Qwen3.7-Plus
- Natywne wielomodalne wejście obsługujące tekst, obrazy i wideo w zunifikowanym potoku wnioskowania.
- Okno kontekstu do 1M tokenów, umożliwiające analizę dużych baz kodu i pracę z długimi dokumentami.
- Hybrydowe możliwości agenta GUI + CLI, pozwalające modelowi rozumieć ekrany i wchodzić w interakcje ze środowiskami oprogramowania.
- Zaawansowane programowanie i korzystanie z narzędzi, w tym wywoływanie funkcji, strukturyzowane wyjścia oraz integrację z zewnętrznymi narzędziami.
- Rozumienie wizualne dla wykresów, dokumentów i zrzutów ekranu, co czyni go przydatnym w zadaniach biznesowych, inżynierskich i związanych z interfejsem użytkownika.
- Punkt końcowy API zgodny z OpenAI, umożliwiający relatywnie łatwą migrację z istniejącej infrastruktury LLM.
Wyniki benchmarków Qwen3.7-Plus
Zgodnie z publicznymi raportami benchmarkowymi i platformami oceny stron trzecich, Qwen3.7-Plus zapewnia czołowy poziom wydajności w zadaniach wielomodalnych i agentowych:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: około 90.0%.
- IFBench: około 78.0%.
- AA Long Context Reasoning (AA-LCR): około 65.0%.
- Terminal-Bench Hard: około 47.0%, co odzwierciedla silne możliwości programistyczne agenta.
Alibaba informuje również, że Qwen3.7-Plus wypada konkurencyjnie względem wiodących modeli własnościowych w benchmarkach agentowych i programistycznych, ze szczególną mocą w zadaniach wielomodalnych i interakcji z UI.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Funkcja | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Modalności wejściowe | Tekst, obraz, wideo | Tylko tekst | Tekst, obraz |
| Okno kontekstu | Do 1M tokenów | 1M tokenów | Duży kontekst |
| Rozumienie obrazu | Doskonałe | Brak wsparcia | Silne |
| Interakcja agenta/GUI | Natywny priorytet | Ograniczona | Dobra |
| Długohoryzontowe rozumowanie tekstowe | Bardzo silne | Najlepsze w rodzinie Qwen | Doskonałe |
| Najlepsze zastosowanie | Wielomodalni agenci i produktywność | Programowanie, matematyka, głębokie rozumowanie | Rozumowanie i programowanie w środowiskach korporacyjnych |
W projektach obejmujących zrzuty ekranu, automatyzację UI, debugowanie wizualne lub wielomodalne przepływy pracy, Qwen3.7-Plus jest zazwyczaj lepszym wyborem. W przypadku czysto tekstowego rozumowania lub programowania na skalę repozytorium, Qwen3.7-Max pozostaje mocniejszą opcją.
Ograniczenia
- Qwen3.7-Plus jest obecnie udostępniany jako własnościowy model w fazie podglądowej, a niektóre możliwości mogą ewoluować przed stabilnym wydaniem.
- Wywoływanie funkcji i niektóre funkcje narzędziowe agenta są nadal wdrażane.
- W przypadku zadań czysto tekstowych, silnie obciążonych rozumowaniem, Qwen3.7-Max może zapewniać nieco lepszą wydajność.
- Jak w przypadku większości dużych modeli wielomodalnych, programiści powinni zweryfikować wydajność na własnych zestawach danych obrazów i UI przed wdrożeniem produkcyjnym.
Reprezentatywne przypadki użycia
- Agenci AI łączący interakcje przeglądarki, GUI i terminala.
- Debugowanie oprogramowania na podstawie zrzutów ekranu i ujęć UI.
- Analiza dokumentów, wykresów i pulpitów nawigacyjnych.
- Wizualni asystenci programowania generujący kod na podstawie makiet lub diagramów.
- Korporacyjne przepływy pracy związane z produktywnością, obejmujące mieszane wejścia tekstowe i obrazowe.
- Wielomodalni asystenci badawczy łączący wyszukiwanie w sieci z rozumieniem wizualnym