Tekniske spesifikasjoner for Qwen3.7-Plus
| Element | Spesifikasjon |
|---|---|
| Modellnavn | Qwen3.7-Plus |
| Leverandør | Alibaba Cloud (Qwen Team) |
| API-modell-ID | qwen3.7-plus |
| Modelltype | Multimodal agentmodell |
| Inndatatyper | Tekst, bilder, video |
| Utdatatyper | Tekst |
| Kontekstvindu | Opptil 1,000,000 tokens |
| Maksimalt inndata-tokens | ~991.8K |
| Maksimalt utdata-tokens | ~65.5K |
| Kjernestyrker | Visuell-språklig resonnering, koding, GUI-interaksjon, agent-arbeidsflyter |
| Innebygde funksjoner | Funksjonskalling, strukturerte utdata, Cache, Web-søk, Batch-API |
| API-kompatibilitet | OpenAI-kompatibel via DashScope / Model Studio |
Hva er Qwen3.7-Plus?
Qwen3.7-Plus er det balanserte multimodale flaggskipet i Alibabas Qwen 3.7-generasjon. Mens Qwen3.7-Max fokuserer på ren tekstreasonering og koding over lang horisont, utvider Qwen3.7-Plus disse evnene med innebygd bilde- og videoforståelse, slik at den kan resonere på tvers av visuell og tekstlig informasjon i én og samme modell.
Modellen er designet rundt ideen om en multimodal interaktiv hybridagent: den kan tolke skjermbilder, analysere diagrammer, forstå grensesnitt, generere kode fra visuelle referanser og bruke verktøy til å fullføre flerstegsoppgaver. Dette gjør den spesielt attraktiv for KI-agenter, GUI-automatisering og produktivitetsarbeidsflyter der visuell kontekst er viktig.
Hovedfunksjoner i Qwen3.7-Plus
- Innebygd multimodal inndata som støtter tekst, bilder og video i en samlet resonneringspipeline.
- Opptil 1M-token kontekstvindu, som muliggjør analyse av store kodebaser og arbeidsflyter med lange dokumenter.
- Hybride GUI + CLI-agentfunksjoner, som lar modellen forstå skjermer og samhandle med programvaremiljøer.
- Avansert koding og verktøybruk, inkludert funksjonskalling, strukturerte utdata og integrasjon med eksterne verktøy.
- Visuell forståelse for diagrammer, dokumenter og skjermbilder, som gjør den nyttig for forretnings-, ingeniør- og UI-oppgaver.
- OpenAI-kompatibelt API-endepunkt, som muliggjør relativt enkel migrering fra eksisterende LLM-infrastruktur.
Benchmark-ytelse for Qwen3.7-Plus
I følge offentlige benchmark-rapporter og tredjeparts evalueringsplattformer leverer Qwen3.7-Plus multimodal og agentytelse på toppnivå:
- Artificial Analysis Intelligence Index: 53.3.
- GPQA Diamond: omtrent 90.0%.
- IFBench: omtrent 78.0%.
- AA Long Context Reasoning (AA-LCR): omtrent 65.0%.
- Terminal-Bench Hard: omtrent 47.0%, noe som reflekterer sterke agent-kodingsevner.
Alibaba rapporterer også at Qwen3.7-Plus leverer konkurransedyktig ytelse sammenlignet med ledende proprietære modeller på agent- og koding-benchmarks, med særlig styrke i multimodale oppgaver og UI-interaksjon.
Qwen3.7-Plus vs Qwen3.7-Max vs Claude Opus 4.6
| Funksjon | Qwen3.7-Plus | Qwen3.7-Max | Claude Opus 4.6 |
|---|---|---|---|
| Inndatamodaliteter | Tekst, bilde, video | Kun tekst | Tekst, bilde |
| Kontekstvindu | Opptil 1M tokens | 1M tokens | Stor kontekst |
| Visuell forståelse | Utmerket | Ikke støttet | Sterk |
| Agent-/GUI-interaksjon | Naturlig fokus | Begrenset | God |
| Tekstresonnering over lang horisont | Svært sterk | Best i Qwen-familien | Utmerket |
| Beste bruksområde | Multimodale agenter og produktivitet | Koding, matematikk, dyp resonnering | Bedriftsresonnering og koding |
For prosjekter som involverer skjermbilder, UI-automatisering, visuell debugging eller multimodale arbeidsflyter, er Qwen3.7-Plus generelt det bedre valget. For rent tekstbasert resonnering eller koding i repositorium-skala, er Qwen3.7-Max fortsatt det sterkere alternativet.
Begrensninger
- Qwen3.7-Plus er for øyeblikket lansert som en proprietær modell i forhåndsvisningsstadiet, og noen kapabiliteter kan utvikle seg før stabil utgivelse.
- Funksjonskalling og enkelte agentverktøy-funksjoner rulles fortsatt ut.
- For rent tekstbaserte, resonnementstunge arbeidsbelastninger kan Qwen3.7-Max levere noe bedre ytelse.
- Som med de fleste store multimodale modeller bør utviklere validere ytelsen på egne bilde- og UI-datasett før produksjonsutrulling.
Representative bruksområder
- KI-agenter som kombinerer nettleser-, GUI- og terminalinteraksjoner.
- Feilsøking av programvare fra skjermbilder og UI-opptak.
- Analyse av dokumenter, diagrammer og dashbord.
- Visuelle kodeassistenter som genererer kode fra mockups eller diagrammer.
- Produktivitetsarbeidsflyter for bedrifter med blandede tekst- og bildeinndata.
- Multimodale forskningsassistenter som kombinerer nettsøk med visuell forståelse.