Svar først: Qwen4 er ikke længere kun et spekulativt navn. Qwen beskriver nu Qwen3.8-Flash-Next som en multimodal MoE-model og en eksperimentel forhåndsvisning af den arkitektur, der vil danne grundlaget for Qwen4. Det bekræfter en arkitekturretning med effektivitet først, men det udgør ikke en Qwen4-produktlancering. Den endelige modellineup, parameterskala, benchmark-scorekort, API-identifikator, licens, prissætning og udgivelsesplan er fortsat ikke offentliggjort.
Hvad er Qwen4?
Qwen4 er den næste store Qwen-arkitektur, som nu er anerkendt af Qwen-teamet, selvom der ikke er lanceret nogen selvstændig Qwen4-model eller -produktfamilie. De officielle Qwen3.8-Flash-Next-materialer kalder den en eksperimentel arkitekturforhåndsvisning for Qwen4. De oplyser ikke det endelige antal parametre, produktlineup, benchmark-scorekort, pris, API-identifikator, licens eller udgivelsesdato. Præcise værdier, der ikke kan spores til Qwen eller Alibaba Cloud, bør fortsat betragtes som ubekræftede.
Den mest nyttige måde at diskutere Qwen4 på er stadig at adskille tre evidenslag. Bekræftet information omfatter nu de aktuelle Qwen-modeller, offentliggjort dokumentation og arkitekturforhåndsvisningen Qwen3.8-Flash-Next. Forventede retninger er slutninger baseret på disse signaler. Ukendte er endelige produktdetaljer, der ikke ansvarligt kan udfyldes med estimater. Denne sondring er vigtig, fordi forhåndsvisningen bekræfter arkitektoniske intentioner uden at definere den produktionsklare Qwen4-familie.
| Evidence level | How it should be used | Examples in this article |
|---|---|---|
| Confirmed | State as fact with a direct official link | Qwen3.8-Flash-Next architecture preview; Qwen3.8-Max scale and benchmark baseline |
| Expected | Use cautious language and explain the inference | How the preview architecture may scale into final Qwen4 models |
| Unknown | Do not invent a value or release commitment | Final model lineup, parameters, scorecard, price, license, and API ID |
Hvorfor Qwen4 er det logiske næste skridt
Qwen3-generationen etablerede en hybrid tilgang til ræsonnering. Den officielle introduktion beskriver tilstande for tænkning og ikke-tænkning, som lader udviklere afveje svartid mod dybere overvejelse. Den samme generation udvidede også flersproget støtte og styrkede værktøjsbrug, inklusive MCP-orienterede agent-workflows.
Qwens køreplan pegede derefter mod opskalering af data, udvidelse af kontekst, udvidede modaliteter og RL med miljøfeedback. Den køreplan er vigtigere end rygtebaserede udgivelsesforudsigelser: den indrammer den næste generation som en overgang fra at træne modeller til at træne agenter, der kan interagere med miljøer og fuldføre arbejde med lang horisont.
Qwen3.8-linjen giver nu to forskellige baselines. Qwen3.8-Max er fortsat den nuværende flagskibskapabilitetsbaseline med et hostet 2.4-trillion-parameter MoE-system til kodning, kontorarbejde, visuel forståelse, lange dokumenter, lange videoer og autonom planlægning. Qwen3.8-Flash-Next spiller en anden rolle: Qwen positionerer den eksplicit som arkitekturforhåndsvisningen for Qwen4. En fremtidig Qwen4 skal kombinere flagskibets bredde med forhåndsvisningens effektivitetsorienterede design.
Hvad Qwen3.8-Flash-Next afslører om Qwen4
Qwen3.8-Flash-Next er det første konkrete offentlige bevis for Qwen4’s fundament. Qwen kalder den den første open-weight-udgivelse under den nye arkitektur og siger, at designet vil danne grundlaget for Qwen4. Forhåndsvisningen er derfor stærkere end en køreplansslutning, mens den stadig holder produktionsmodellens skala og konfiguration åben.
Modellen er en multimodal kausal sprogmodel med en visionsenkoder. Dens sprogmodel indeholder 125B parametre med 6B aktiveret, plus 51B n-gram-indlejringer og 4B MTP-parametre. Den har 48 lag, 512 eksperter med 10 routede og én delt ekspert aktiv pr. token, en indbygget kontekst på 262,144 tokens og udvidelsesunderstøttelse op til 1,000,000 tokens.
| Architecture signal | Confirmed in Qwen3.8-Flash-Next | What it suggests for Qwen4 |
|---|---|---|
| Ultra-sparse MoE | 125B main model; 6B active per token; 512 experts | Capability per unit of active compute may be a central objective |
| Hybrid attention | Three Gated DeltaNet layers for every Qwen Sparse Attention layer | Long-context latency and KV-cache efficiency may matter more than raw window size |
| Gated Residual | Four widened residual branches with data-dependent gates | Qwen is testing more expressive deep scaling with controlled overhead |
| N-gram embedding | 51B bigram and trigram embedding parameters | Memory-offloadable capacity may supplement compute-heavy MoE scaling |
| Native multimodality | Causal language model with a vision encoder | Text and vision are likely architectural foundations, not bolt-on variants |
| Long context | 262K native; extensible to 1M | Qwen4 is likely to emphasize efficient long-horizon agents |
Forhåndsvisningens leverandør-rapporterede benchmarkresultater viser også, hvorfor arkitekturen betyder noget. Trods kun 6B aktiverede parametre pr. token forbedrer den den tætte Qwen3.8-27B-baseline på de udvalgte evalueringer for kodning, kontorarbejde, værktøjsbrug og multimodale agenter nedenfor. Disse resultater er ikke Qwen4-scorer; de er bevis for, at den nye arkitektur er designet til at øge kapabilitet pr. aktiv parameter.
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 |
| SWE-bench Pro | 62.5 | 61.7 |
| CoWorkBench | 73.9 | 70.7 |
| Toolathlon Verified | 73.5 | 67.1 |
| ClawEval-MM (Pass@3) | 64.4 | 57.4 |
| AndroidWorld | 84.5 | 81.9 |
Fortolkning: Flash-Next gør tre Qwen4-forventninger til stærkere signaler: ultrasparsom aktivering, hybrid langkontekst-opmærksomhed og indbygget multimodalitet. Den afslører ikke Qwen4’s endelige antal parametre, præcise konfigurationskontekst, produkttyper eller udgivelsestidspunkt.
Forventede Qwen4-specifikationer
Da der ikke findes nogen endelig Qwen4-specifikation, bruger tabellen nedenfor Qwen3.8-Max som den bekræftede produktionsbaseline og Qwen3.8-Flash-Next som det bekræftede arkitektursignal. Forhåndsvisningen øger sikkerheden i flere retninger, men alle endelige Qwen4-felter forbliver enten forventede eller ukendte, indtil Qwen udgiver modellen.
| Specification | Qwen3.8-Max confirmed baseline | Qwen4 expectation | Confidence |
|---|---|---|---|
| Status | Released | Architecture preview confirmed; model not launched | Confirmed |
| Architecture | Sparse MoE with hybrid attention foundation | Expected to build on Flash-Next's GDN + QSA, gated residual, and n-gram embedding | High |
| Total parameters | 2.4T | Unknown; may not need to exceed 2.4T | Low |
| Active parameters | About 95B per step in the open-weight model | Likely ultra-sparse routing; exact active compute unknown | Medium-high |
| Context window | 1,000,000 tokens | Long-context optimized; final native and default limits unknown | High |
| Maximum output | 131,072 tokens | Likely maintained or expanded | Medium |
| Hosted inputs | Text, image, and video | Multimodal direction is confirmed; exact audio support is unknown | High |
| Output modality | Text | Text is likely; native media output is unconfirmed | Medium |
| Reasoning | Thinking and faster inference workflows | Thinking controls are likely; final API behavior unknown | Medium-high |
| Tool support | Function calling and structured output | Stronger tool selection, preserved state, and recovery expected | High |
| Weights and license | Open-weight flagship checkpoint exists | Preview is open-weight; final Qwen4 license and checkpoints unknown | Medium |
| API model ID | qwen3.8-max | Not available | Confirmed |
Fortolkning: Flash-Next øger konfidensen i ultrasparsom MoE-routing, hybrid langkontekst-opmærksomhed, gated residuals, n-gram-indlejring og indbygget multimodalitet. Den beviser ikke, at en endelig Qwen4-model vil bruge 125B parametre, aktivere 6B pr. token eller leveres med samme kontekstgrænser.
Hvilken arkitektur forventes Qwen4 at bygge på?
Ultrasparsom MoE er nu det stærkeste signal
Arkitekturspørgsmålet er nu mindre spekulativt. Qwen3.8-Flash-Nexts modelkort dokumenterer 125B hovedparametre med kun 6B aktiveret pr. token, plus 51B n-gram-indlejringer. Dette ultrasparsomt design antyder, at Qwen4 kan prioritere samlet opgavekapabilitet pr. enhed aktiv beregning frem for at udvide antallet af aktive parametre i takt med den lagrede kapacitet.
Det vigtige spørgsmål er ikke, om Qwen4 indeholder flere eksperter, men om routing, hukommelsesadgang og ekspertspecialisering forbliver stabile over lange opgaver. Flash-Nexts n-gram-indlejringer viser også, at Qwen udforsker kapacitet, der er billigere at beregne og lettere at offloade end konventionel MoE-skalering.
Hybridopmærksomhed sigter mod effektivitet ved lang kontekst
Flash-Next erstatter den tidligere parring af Gated DeltaNet og fuld opmærksomhed med Gated DeltaNet og Qwen Sparse Attention på mikroblo-kniveau. Dets 48 lag gentager tre Gated DeltaNet-blokke efterfulgt af én blok med sparsom opmærksomhed. Dette er det tydeligste tegn på, at Qwen4 kan være designet til at reducere latens ved lang kontekst og KV-cache-pres frem for at basere sig på et større vindue med tæt opmærksomhed.
Lang kontekst bør blive agenthukommelse, ikke blot et større prompt
Et million-token-vindue er kun nyttigt, når modellen kan hente den rette evidens, bevare mål og undgå at akkumulere modstridende tilstand. Qwen4 bør derfor evalueres på, hvordan den bruger lang kontekst på tværs af værktøjskald, filændringer, mellemresultater og fejlgenopretning. Rå kontekstlængde er mindre informativ end hentningsnøjagtighed og opgavefuldførelse over en lang bane.
Styring af ræsonnering kan blive mere granulær
Qwen3’s hybride tænkedesign tillod allerede hurtig og overlagt adfærd. Flash-Next styrker signalet ved at understøtte kontrollerne enable_thinking, preserve_thinking og reasoning_effort. En meningsfuld Qwen4-opgradering kan allokere ræsonnering dynamisk og kun bevare den tilstand, der forbedrer konsistensen over flere trin, og dermed reducere den samlede workflow-omkostning frem for blot at producere længere synlig ræsonnering.
Multimodalitet kan rykke tættere på computerbrug
Multimodalitet er nu en stærkere forventning, fordi både den hostede Qwen3.8-Max-tjeneste og open-weight-forhåndsvisningen Flash-Next understøtter visuel input. Qwen4 kan kombinere den perception med mere pålidelig handling: forstå et screenshot, vælge en UI-kontrol, tjekke resultatet og korrigere planen. Indbygget audio, billedgenerering, stemmeoutput og videogenerering er fortsat ubekræftet.
Forventede Qwen4-funktioner
- Mere pålidelige lang-horisont-agenter. Lavere fejlrate ved værktøjskald, stærkere målopretholdelse, bedre genopretning og mere konsistente leverancer efter hundredvis af handlinger.
- Software engineering i repository-skala. Forbedret planlægning på tværs af store kodebaser, tests, terminaler, issuetrackere og udrulningsmiljøer.
- End-to-end vidensarbejde. En stærkere sti fra research og dokumentanalyse til regneark, præsentationer, rapporter og beslutningsklare output.
- Multimodal værktøjsbrug. Visuel forståelse, der informerer UI-interaktion, dokumentoperationer og miljøforankret ræsonnering.
- Adaptive ræsonneringsbudgetter. Automatisk eskalering fra hurtige svar til dybere ræsonnering, når usikkerhed eller opgavekompleksitet øges.
- Højere kapabilitet pr. aktiv parameter. Bedre ekspertrouting, n-gram-kapacitet, sparsom opmærksomhed, caching og eftertræning frem for skalering for skaleringens skyld.
- En bredere modelfamilie. Mulige Max-, Plus-, Coder-, small MoE-, VL- eller Omni-varianter, selvom ingen af disse navne er bekræftet.
Qwen4 benchmark-udsigter: Hvad Qwen3.8-Max-baselinen viser
Der findes ingen Qwen4-benchmark-scorer. Flash-Next og Max besvarer forskellige spørgsmål: Flash-Next-scorekortet tester den nye arkitekturs effektivitetsorienterede kapabilitet, mens det officielle Qwen3.8-Max-scorekort forbliver den stærkere produktionsbaseline for kapabilitet på tværs af kodeagenter, reproduktion af forskning, professionelt samarbejde, visuel ræsonnering, mobilbrug og computerbrug. Qwen4 skal kombinere begge retninger under matchede evalueringer.
| Benchmark | Qwen3.8-Max reported score | What Qwen4 would need to prove |
|---|---|---|
| SWE-Pro | 67.7 | Close the gap in professional repository-level issue resolution |
| TerminalBench 2.1 | 86.6 | Improve terminal-agent reliability under the same harness |
| PaperBench | 93.0 | Maintain research strength with independent replication |
| FrontierSWE | 73.5 | Convert long-horizon reasoning into more completed engineering work |
| CoWorkBench | 74.8 | Produce more dependable professional deliverables |
| OSWorld-Verified | 86.1 | Reduce visual-action errors in computer-use workflows |
De to baselines peger på et dobbelt krav. Flash-Next viser, at lav aktiv beregning stadig kan levere stærke agentiske og multimodale resultater; Max viser det højere kapabilitetloft, som et nyt flagskib skal overgå. Qwen4 bør derfor bedømmes både på matchet opgavesucces og den samlede workflow-omkostning, med leverandørrapporterede scorer adskilt fra uafhængig replikation.
Officielle Qwen3.8-Max benchmarkresultater. Kilde: Qwen3.8-Max officiel udgivelse**.
Qwen4 vs. aktuelle frontmodeller: bekræftede baselines og ukendte
Den mest nyttige sammenligning er ikke blot Qwen4 mod Qwen3.8-Max. Det er Qwen4 mod de designvalg, der allerede er synlige i Kimi K3, DeepSeek V4 Pro og GLM-5.3. Tabellen nedenfor sammenligner bekræftede attributter for aktuelle modeller med den stadig ukendte Qwen4-kolonne.
| Dimension | Qwen4 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Pro | GLM-5.3 |
|---|---|---|---|---|---|
| Status | Architecture preview confirmed; model unreleased | Released | Released | Released | Released |
| Scale | Unknown | 2.4T / about 95B active | 2.8T / 16 of 896 experts | 1.6T / 49B active | Not disclosed for this release |
| Context | Expected 1M+ | 1M | 1M | 1M | 1M |
| Input | Multimodal direction confirmed; final interface unknown | Text, image, video | Text and native vision | Text-oriented | Text only |
| Reasoning | Unknown | Thinking and fast workflows | Low / high / max effort | Thinking / non-thinking | Always on; low / high / max |
| Open ecosystem | Final weights and license unconfirmed | Open-weight flagship exists | Open-source positioning | Open weights | Open-source positioning |
| Core focus | Expected efficient multimodal agent | Coding, cowork, visual agents | Coding and knowledge work | Efficient reasoning and coding | Coding and cybersecurity |
Modellens skala og inferenseffektivitet
Kimis dokumentation beskriver 2.8T parametre og 16 aktiverede eksperter ud af 896. DeepSeek V4 Pro tager en anden vej med 1.6T i alt og 49B aktive parametre. Qwen4 behøver ikke være den største model for at vinde denne sammenligning; den skal omsætte aktiv beregning til mere pålideligt fuldført arbejde.
Kontekst og multimodalitet
En million tokens er blevet en almindelig flagskibsbaseline, så kontekstlængde alene vil ikke differentiere Qwen4. Qwens stærkere mulighed er multimodal kontekstbrug: at finde den korrekte evidens på tværs af dokumenter, kode, screenshots og video og derefter tage den rigtige handling. Kimi K3 har også indbygget visuel forståelse, mens GLM-5.3’s nuværende interface er kun tekst med 1M kontekst og 128K maksimal output.
Kodning, agenter og specialiserede styrker
Qwen3.8-Max bringer en bred profil for kodning, research, samarbejde og visuelle agenter. Qwen3.8-Flash-Next tilføjer en effektivitetsorienteret multimodal arkitektur med stærkere kapabilitet pr. aktiv parameter. Kimi K3 lægger vægt på lang-horisont-kodning og vidensarbejde, DeepSeek V4 Pro lægger vægt på effektiv ræsonnering og agentisk kodning, og GLM-5.3 tilføjer et markant fokus på cybersikkerhed. En troværdig Qwen4-lancering skal kombinere bred agentpålidelighed med specialistniveau inden for software engineering og visuel computerbrug.
Åbne vægte er ikke hele implementeringshistorien
Åbne vægte kan forbedre kontrol, tilpasning og valg af leverandør, men den praktiske sammenligning omfatter også licensvilkår, hardwarekrav, kvalitet af kvantisering, finjusteringsstøtte og tilgængeligheden af optimerede serving-stakke. Ordet open bør ikke bruges som erstatning for at tjekke den præcise licens og implementeringsbetingelser for hver udgivelse.
Sammenligningsresultat: Qwen4’s stærkeste potentielle position er en bred multimodal agent, der kombinerer Qwen3.8-Max’s styrker inden for visuel forståelse og samarbejde med Flash-Nexts arkitektur med lav aktiv beregning og bedre pålidelighed i software engineering. Den kan ikke erklæres som vinder, før matchede evalueringer og produktionsadfærd er tilgængelige.
Potentielle anvendelser for Qwen4
Autonom software engineering
En stærkere Qwen-agent kan inspicere et repository, reproducere et issue, redigere flere filer, køre tests, gennemgå fejl og forberede en pull request-klar ændring. Det vigtige mål er andelen af opgaver, der fuldføres uden menneskelig hjælp, ikke mængden af genereret kode.
Enterprise-vidensarbejde
Lang kontekst og multimodal forståelse kan understøtte workflows, der starter med kontrakter, PDF’er, regneark, diagrammer og mødereferater og ender med et beslutningsnotat, en analyse eller en struktureret handlingsplan. Virksomheder vil stadig have brug for hentningskontroller, revisionslogge og kildeverifikation omkring modellen.
Multimodale computerbrugs-agenter
Qwen4 kan være nyttig, hvor en agent skal fortolke screenshots, navigere i applikationer, verificere UI-tilstand og komme sig, når et klik eller en formularindsendelse giver et uventet resultat. Dette er en naturlig forlængelse af Qwen3.8-Max’s stærke baseline for visuel forståelse og OSWorld-stil, men indbygget computerkontrol er ikke annonceret.
Videnskabelig og ingeniørmæssig forskning
Forskningsworkflows kombinerer litteraturgennemgang, kode, simulering, dataanalyse og rapportskrivning. En fremtidig Qwen-model kan orkestrere disse trin og opretholde en længere eksperimenthistorik. PaperBench-ydelsen gør dette til en troværdig retning, men reproducerbarhed og uafhængig verifikation vil forblive afgørende.
Hvad vi ikke ved endnu
Selvom Qwen har anerkendt arkitekturen gennem Flash-Next, er følgende produktionsdetaljer stadig utilgængelige og bør forblive eksplicit uafklarede, indtil en officiel Qwen4-meddelelse:
- De præcise produktnavne og om Qwen4 lanceres som én model eller en familie.
- Udgivelsesdatoen eller forhåndsvisningsplanen.
- Om de endelige modeller bevarer Flash-Nexts præcise GDN/QSA-forhold, gated residual-design, n-gram-indlejringsskala og ekspertrouting.
- Samlet antal parametre, aktive parametre, ekspertantal og træningsdatas skala for hver Qwen4-model.
- Indbygget kontekstlængde, standardkontekst, maksimal output og understøttede modaliteter for hver rute.
- Indbygget audio, billedgenerering, tale eller videogenerering.
- Officielle benchmarkresultater og evalueringsharnesset for hver score.
- Tilgængelighed af åbne vægte, licensvilkår og betingelser for kommerciel brug.
- API-priser, regional tilgængelighed, raterestriktioner og den endelige model-ID.
Verifikationsregel: Behandl enhver præcis Qwen4-specifikation, benchmark-graf, prisskema eller API-identifikator som ubekræftet, medmindre den kan spores direkte til Qwen, Alibaba Cloud eller et officielt modelrepository.
Hvornår bliver Qwen4 udgivet?
Der findes ingen forsvarlig offentlig udgivelsesdato. Qwen3.8-Flash-Next bekræfter, at Qwen tester den arkitektur, der vil danne grundlaget for Qwen4, men de offentlige materialer giver ingen tidsplan for en produktionsklar Qwen4-model. Træningsfærdiggørelse, serving-effektivitet, sikkerhedsevaluering, vægtlicensering og produktintegration kan alle påvirke tidspunktet og udformningen af udgivelsen.
Den sikreste publiceringspraksis er at undgå forudsigelser om måned eller kvartal. Læsere bør følge det officielle Qwen-site, Alibaba Cloud Model Studio-dokumentationen, verificerede modelrepositories og CometAPI’s modelkatalog. En Qwen4-modelside bør kun tilføjes, efter at modellen faktisk er listet.
Hvordan udviklere kan forberede sig på Qwen4
- Etabler to baselines. Brug Qwen3.8-Flash-Next til at måle arkitektureffektivitet og Qwen3.8-Max til at måle den nuværende flagskibskapabilitet.
- Adskil model-ID’er fra forretningslogik. Hold routing og konfiguration uden for applikationskode, så modeller kan skiftes sikkert.
- Byg evalueringer på opgaveniveau. Mål fuldførte softwarefixes, korrekte forskningsoutput, succesfulde værktøjskæder og brugbare leverancer.
- Log den samlede workflow-omkostning. Spor latens, input- og outputtokens, cache-brug, retries, mislykkede handlinger og menneskelig rework.
- Bevar fallback-ruter. Brug modelrouting og leverandør-fallbacks i stedet for at gøre én ikke-udgivet model til et single point of failure.
- Opfind ikke et model-ID. Vent på den officielle identifikator, før du tilføjer qwen4 eller qwen4-max til produktionskonfigurationen.
Prøv Qwen3.8-Flash-Next og Qwen3.8-Max via CometAPI
Udviklere kan nu teste Qwen3.8-Flash-Next via CometAPI og beholde Qwen3.8-Max som flagskibssammenligning. Opret en API-nøgle, gem den i en miljøvariabel, og kald den eksisterende model via en OpenAI-kompatibel klient. Eksemplet bruger bevidst qwen3.8-flash-next; det antager ikke en fremtidig Qwen4-identifikator.
Konklusion
Qwen4 er nu mere end et rygte: Qwen har eksplicit identificeret Qwen3.8-Flash-Next som en eksperimentel forhåndsvisning af den arkitektur, der vil danne grundlaget for den. Forhåndsvisningen bekræfter en multimodal, ultrasparsom MoE-retning bygget omkring Gated DeltaNet, Qwen Sparse Attention, gated residuals og n-gram-indlejringer. Qwen3.8-Max forbliver den stærkere nuværende kapabilitetsbaseline.
Den virkelige test for Qwen4 bliver ikke, om dens antal parametre er større. Det bliver, om den endelige model kan kombinere Flash-Nexts effektivitet med Max-niveau kapabilitet, fuldføre længere arbejde med færre fejl og bruge multimodal evidens mere pålideligt. Arkitekturretningen er nu offentlig, men de endelige specifikationer, benchmarks, licens, pris, API-ID og udgivelsesdato er stadig ukendte.
