Tekniske specifikationer for Qwen3.7-Plus
| Punkt | Specifikation |
|---|---|
| Modelnavn | Qwen3.7-Plus |
| Udbyder | Alibaba Cloud (Qwen Team) |
| API-model-ID | qwen3.7-plus |
| Modeltype | Multimodal agentmodel |
| Inputtyper | Tekst, billeder, video |
| Outputtyper | Tekst |
| Kontekstvindue | Op til 1,000,000 tokens |
| Maksimalt antal input-tokens | ~991.8K |
| Maksimalt antal output-tokens | ~65.5K |
| Kernekompetencer | Vision-sprog-ræsonnering, kodning, GUI-interaktion, agent-workflows |
| Indbyggede funktioner | Funktionskald, strukturerede output, cache, websøgning, batch-API |
| API-kompatibilitet | OpenAI-kompatibel via DashScope / Model Studio |
Hvad er Qwen3.7-Plus?
Qwen3.7-Plus er det afbalancerede multimodale flagskib i Alibabas Qwen 3.7-generation. Mens Qwen3.7-Max fokuserer på ren tekstræsonnering og langsigtet kodning, udvider Qwen3.7-Plus disse kapaciteter med indbygget billed- og videoforståelse, så den kan ræsonnere på tværs af visuel og tekstuel information i én model.
Modellen er designet omkring idéen om en multimodal interaktiv hybridagent: den kan fortolke skærmbilleder, analysere diagrammer, forstå grænseflader, generere kode ud fra visuelle referencer og bruge værktøjer til at fuldføre flertrinsopgaver. Det gør den særligt attraktiv til AI-agenter, GUI-automatisering og produktivitets-workflows, hvor visuel kontekst er vigtig.
Hovedfunktioner i Qwen3.7-Plus
- Indbygget multimodalt input, der understøtter tekst, billeder og video i en samlet ræsonneringspipeline.
- Op til 1M-token kontekstvindue, som muliggør analyse af store kodebaser og arbejdsgange med lange dokumenter.
- Hybride GUI + CLI agentkapaciteter, der gør det muligt for modellen at forstå skærme og interagere med softwaremiljøer.
- Avanceret kodning og værktøjsbrug, herunder funktionskald, strukturerede output og integration af eksterne værktøjer.
- Visuel forståelse af diagrammer, dokumenter og skærmbilleder, hvilket gør den nyttig til forretnings-, ingeniør- og UI-opgaver.
- OpenAI-kompatibelt API-endepunkt, hvilket muliggør relativt nem migration fra eksisterende LLM-infrastruktur.
Benchmark-ydeevne for Qwen3.7-Plus
Ifølge offentlige benchmarkrapporter og tredjeparts evalueringsplatforme leverer Qwen3.7-Plus ydeevne på førende niveau inden for multimodalitet og agentkapaciteter:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: cirka 90.0%.
- IFBench: cirka 78.0%.
- AA Long Context Reasoning (AA-LCR): cirka 65.0%.
- Terminal-Bench Hard: cirka 47.0%, hvilket afspejler stærke agentbaserede kodningskapaciteter.
Alibaba rapporterer også, at Qwen3.7-Plus klarer sig konkurrencedygtigt mod førende proprietære modeller på agent- og kodningsbenchmarks, med særlig styrke i multimodale opgaver og UI-interaktion.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Funktion | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Inputmodaliteter | Tekst, billede, video | Kun tekst | Tekst, billede |
| Kontekstvindue | Op til 1M tokens | 1M tokens | Stor kontekst |
| Visuel forståelse | Fremragende | Ikke understøttet | Stærk |
| Agent-/GUI-interaktion | Primært fokus | Begrænset | God |
| Langsigtet tekstræsonnering | Meget stærk | Bedst i Qwen-familien | Fremragende |
| Bedste anvendelse | Multimodale agenter og produktivitet | Kodning, matematik, dyb ræsonnering | Ræsonnering og kodning til virksomheder |
Til projekter, der involverer skærmbilleder, UI-automatisering, visuel fejlfinding eller multimodale arbejdsgange, er Qwen3.7-Plus generelt det bedste valg. Til rent tekstbaseret ræsonnering eller kodning i repositories i stor skala er Qwen3.7-Max stadig den stærkere løsning.
Begrænsninger
- Qwen3.7-Plus er i øjeblikket udgivet som en proprietær model i preview-stadiet, og nogle kapaciteter kan udvikle sig før den stabile udgivelse.
- Funktionskald og visse agentværktøjsfunktioner udrulles stadig.
- Til rent tekstbaserede, ræsonneringstunge arbejdsbelastninger kan Qwen3.7-Max levere en smule bedre ydeevne.
- Som med de fleste store multimodale modeller bør udviklere validere ydeevnen på deres egne billed- og UI-datasæt før produktionsimplementering.
Repræsentative anvendelsestilfælde
- AI-agenter, der kombinerer browser-, GUI- og terminalinteraktioner.
- Fejlfinding af software ud fra skærmbilleder og UI-optagelser.
- Analyse af dokumenter, diagrammer og dashboards.
- Visuelle kodeassistenter, der genererer kode ud fra mockups eller diagrammer.
- Produktivitets-workflows i virksomheder med blandede tekst- og billedinput.
- Multimodale forskningsassistenter, der kombinerer websøgning med visuel forståelse.