Resposta primeiro: O Qwen4 deixou de ser apenas um nome especulativo. O Qwen agora descreve o Qwen3.8-Flash-Next como um modelo multimodal MoE e uma prévia experimental da arquitetura que sustentará o Qwen4. Isso confirma uma direção de arquitetura com foco em eficiência, mas não constitui um lançamento de produto Qwen4. O alinhamento final de modelos, a escala de parâmetros, o painel de benchmarks, o identificador de API, a licença, os preços e o cronograma de lançamento permanecem não divulgados.
O que é o Qwen4?
O Qwen4 é a próxima grande arquitetura do Qwen agora reconhecida pela equipe Qwen, embora nenhum modelo ou família de produtos Qwen4 independente tenha sido lançado. Os materiais oficiais do Qwen3.8-Flash-Next o chamam de uma prévia experimental da arquitetura para o Qwen4. Eles não divulgam a contagem final de parâmetros, o alinhamento de produtos, o painel de benchmarks, preços, identificador de API, licença ou data de lançamento. Valores exatos que não possam ser rastreados ao Qwen ou à Alibaba Cloud ainda devem ser tratados como não verificados.
A maneira mais útil de discutir o Qwen4 continua sendo separar três camadas de evidência. Informações confirmadas agora incluem os modelos atuais do Qwen, a documentação publicada e a prévia da arquitetura Qwen3.8-Flash-Next. Direções esperadas são inferências fundamentadas nesses sinais. Desconhecidos são detalhes finais de produto que não podem ser preenchidos com estimativas de forma responsável. Essa distinção é importante porque a prévia confirma a intenção arquitetural sem definir a família Qwen4 de produção.
| Evidence level | How it should be used | Examples in this article |
|---|---|---|
| Confirmed | State as fact with a direct official link | Qwen3.8-Flash-Next architecture preview; Qwen3.8-Max scale and benchmark baseline |
| Expected | Use cautious language and explain the inference | How the preview architecture may scale into final Qwen4 models |
| Unknown | Do not invent a value or release commitment | Final model lineup, parameters, scorecard, price, license, and API ID |
Por que o Qwen4 é o próximo passo lógico
A geração Qwen3 estabeleceu uma abordagem híbrida para raciocínio. Sua introdução oficial descreve modos de pensamento e de não pensamento que permitem aos desenvolvedores trocar velocidade de resposta por deliberação mais profunda. A mesma geração também expandiu o suporte multilíngue e fortaleceu o uso de ferramentas, incluindo fluxos de trabalho orientados a MCP.
O roteiro do Qwen então apontou para escala de dados, extensão de contexto, ampliação de modalidades e RL com feedback do ambiente. Esse roteiro importa mais do que previsões de lançamento baseadas em rumores: ele enquadra a próxima geração como uma transição de treinar modelos para treinar agentes que podem interagir com ambientes e completar trabalhos de longo horizonte.
A linha Qwen3.8 agora fornece duas bases diferentes. O Qwen3.8-Max permanece como a baseline de capacidade atual, com um sistema MoE hospedado de 2.4-trillion-parameter para programação, trabalho de escritório, compreensão visual, documentos longos, vídeos longos e planejamento autônomo. O Qwen3.8-Flash-Next desempenha um papel diferente: o Qwen o posiciona explicitamente como a prévia da arquitetura para o Qwen4. Um futuro Qwen4 deve combinar a amplitude do flagship com o design orientado à eficiência da prévia.
O que o Qwen3.8-Flash-Next revela sobre o Qwen4
O Qwen3.8-Flash-Next é a primeira evidência pública concreta sobre a base do Qwen4. O Qwen o chama de a primeira release de pesos abertos sob a nova arquitetura e diz que o design sustentará o Qwen4. A prévia é, portanto, mais forte do que uma inferência do roteiro, embora ainda deixe em aberto a escala e a configuração do modelo de produção.
O modelo é um modelo de linguagem causal multimodal com um codificador de visão. Seu modelo de linguagem contém 125B parâmetros com 6B ativados, além de 51B parâmetros de incorporação de n-gramas e 4B parâmetros MTP. Ele tem 48 camadas, 512 especialistas com 10 roteados e um especialista compartilhado ativo por token, um contexto nativo de 262.144 tokens e suporte de extensão até 1.000.000 de tokens.
| Architecture signal | Confirmed in Qwen3.8-Flash-Next | What it suggests for Qwen4 |
|---|---|---|
| Ultra-sparse MoE | 125B main model; 6B active per token; 512 experts | Capability per unit of active compute may be a central objective |
| Hybrid attention | Three Gated DeltaNet layers for every Qwen Sparse Attention layer | Long-context latency and KV-cache efficiency may matter more than raw window size |
| Gated Residual | Four widened residual branches with data-dependent gates | Qwen is testing more expressive deep scaling with controlled overhead |
| N-gram embedding | 51B bigram and trigram embedding parameters | Memory-offloadable capacity may supplement compute-heavy MoE scaling |
| Native multimodality | Causal language model with a vision encoder | Text and vision are likely architectural foundations, not bolt-on variants |
| Long context | 262K native; extensible to 1M | Qwen4 is likely to emphasize efficient long-horizon agents |
Os resultados de benchmark relatados pelo fornecedor na prévia também mostram por que a arquitetura importa. Apesar de ativar apenas 6B parâmetros por token, ela melhora o baseline denso Qwen3.8-27B nos testes selecionados de programação, trabalho de escritório, uso de ferramentas e avaliações de agentes multimodais abaixo. Esses resultados não são pontuações do Qwen4; são evidências de que a nova arquitetura é projetada para elevar a capacidade por parâmetro ativo.
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 |
| SWE-bench Pro | 62.5 | 61.7 |
| CoWorkBench | 73.9 | 70.7 |
| Toolathlon Verified | 73.5 | 67.1 |
| ClawEval-MM (Pass@3) | 64.4 | 57.4 |
| AndroidWorld | 84.5 | 81.9 |
Interpretação: o Flash-Next transforma três expectativas do Qwen4 em sinais mais fortes: ativação ultraesparsa, atenção híbrida para longos contextos e multimodalidade nativa. Ele não revela a contagem final de parâmetros do Qwen4, a configuração exata de contexto, os níveis de produto ou o cronograma de lançamento.
Especificações esperadas do Qwen4
Como não existe especificação final do Qwen4, a tabela abaixo usa o Qwen3.8-Max como a baseline de produção confirmada e o Qwen3.8-Flash-Next como o sinal de arquitetura confirmado. A prévia aumenta a confiança em várias direções, mas cada campo final do Qwen4 permanece esperado ou desconhecido até que o Qwen publique o modelo.
| Specification | Qwen3.8-Max confirmed baseline | Qwen4 expectation | Confidence |
|---|---|---|---|
| Status | Released | Architecture preview confirmed; model not launched | Confirmed |
| Architecture | Sparse MoE with hybrid attention foundation | Expected to build on Flash-Next's GDN + QSA, gated residual, and n-gram embedding | High |
| Total parameters | 2.4T | Unknown; may not need to exceed 2.4T | Low |
| Active parameters | About 95B per step in the open-weight model | Likely ultra-sparse routing; exact active compute unknown | Medium-high |
| Context window | 1,000,000 tokens | Long-context optimized; final native and default limits unknown | High |
| Maximum output | 131,072 tokens | Likely maintained or expanded | Medium |
| Hosted inputs | Text, image, and video | Multimodal direction is confirmed; exact audio support is unknown | High |
| Output modality | Text | Text is likely; native media output is unconfirmed | Medium |
| Reasoning | Thinking and faster inference workflows | Thinking controls are likely; final API behavior unknown | Medium-high |
| Tool support | Function calling and structured output | Stronger tool selection, preserved state, and recovery expected | High |
| Weights and license | Open-weight flagship checkpoint exists | Preview is open-weight; final Qwen4 license and checkpoints unknown | Medium |
| API model ID | qwen3.8-max | Not available | Confirmed |
Interpretação: o Flash-Next eleva a confiança em roteamento MoE ultraesparso, atenção híbrida para contextos longos, residuais com portas, incorporação de n-gramas e multimodalidade nativa. Ele não prova que um modelo final do Qwen4 usará 125B parâmetros, ativará 6B por token ou será lançado com os mesmos limites de contexto.
Em que arquitetura espera-se que o Qwen4 se apoie?
MoE ultraesparso é agora o sinal mais forte
A questão arquitetural agora é menos especulativa. O card do modelo Qwen3.8-Flash-Next documenta 125B parâmetros principais com apenas 6B ativados por token, além de 51B n-gramas incorporados. Esse design ultraesparso sugere que o Qwen4 pode priorizar a capacidade total de tarefa por unidade de computação ativa, em vez de expandir a contagem de parâmetros ativos na mesma proporção da capacidade armazenada.
A questão importante não é se o Qwen4 contém mais especialistas, mas se o roteamento, o acesso à memória e a especialização de especialistas permanecem estáveis ao longo de tarefas longas. As incorporações de n-gramas do Flash-Next também mostram que o Qwen está explorando capacidade mais barata de computar e mais fácil de descarregar do que a escalada convencional de MoE.
Atenção híbrida mira a eficiência em contextos longos
O Flash-Next substitui a combinação anterior de Gated DeltaNet e atenção total por Gated DeltaNet e Qwen Sparse Attention operando no nível de microbloco. Suas 48 camadas repetem três blocos Gated DeltaNet seguidos por um bloco de atenção esparsa. Este é o sinal mais claro de que o Qwen4 pode ser projetado para reduzir a latência em longos contextos e a pressão no cache de KV, em vez de depender de uma janela de atenção densa maior.
Contexto longo deve virar memória do agente, não apenas um prompt maior
Uma janela de um milhão de tokens só é útil quando o modelo consegue recuperar a evidência correta, preservar objetivos e evitar acumular estado contraditório. O Qwen4 deve, portanto, ser avaliado em como usa o contexto longo ao longo de chamadas de ferramentas, mudanças de arquivos, resultados intermediários e recuperação de erros. O comprimento bruto do contexto é menos informativo do que a precisão de recuperação e a conclusão de tarefas ao longo de uma trajetória longa.
O controle de raciocínio pode tornar-se mais granular
O design híbrido de pensamento do Qwen3 já permitiu comportamentos rápidos e deliberados. O Flash-Next fortalece o sinal ao suportar controles enable_thinking, preserve_thinking e reasoning_effort. Uma melhoria significativa no Qwen4 poderia alocar raciocínio de forma dinâmica e preservar apenas o estado que melhora a consistência de múltiplas etapas, reduzindo o custo total do fluxo de trabalho em vez de simplesmente produzir raciocínios visíveis mais longos.
A multimodalidade pode aproximar-se do uso de computador
A multimodalidade é agora uma expectativa mais forte porque tanto o serviço hospedado Qwen3.8-Max quanto a prévia de pesos abertos Flash-Next suportam entrada visual. O Qwen4 poderia combinar essa percepção com ação mais confiável: entender uma captura de tela, selecionar um controle de UI, verificar o resultado e corrigir o plano. Áudio nativo, geração de imagens, saída de fala e geração de vídeo continuam não confirmados.
Recursos esperados do Qwen4
- Agentes de longo horizonte mais confiáveis. Menores taxas de falha em chamadas de ferramentas, retenção de objetivos mais forte, melhor recuperação e entregas mais consistentes após centenas de ações.
- Engenharia de software em escala de repositório. Planejamento aprimorado em grandes bases de código, testes, terminais, rastreadores de issues e ambientes de implantação.
- Trabalho de conhecimento de ponta a ponta. Um caminho mais robusto de pesquisa e análise de documentos até planilhas, apresentações, relatórios e outputs prontos para decisão.
- Uso multimodal de ferramentas. Compreensão visual que informa interação com UI, operações de documento e raciocínio ancorado no ambiente.
- Orçamentos de raciocínio adaptativos. Escalonamento automático de respostas rápidas para raciocínio mais profundo quando a incerteza ou a complexidade da tarefa aumenta.
- Maior capacidade por parâmetro ativo. Melhor roteamento de especialistas, capacidade via n-gramas, atenção esparsa, caching e pós-treinamento, em vez de escala por si só.
- Uma família de modelos mais ampla. Possíveis variantes Max, Plus, Coder, MoE pequeno, VL ou Omni, embora nenhum desses nomes esteja confirmado.
Perspectiva de benchmarks do Qwen4: o que a baseline do Qwen3.8-Max mostra
Não há pontuações de benchmarks do Qwen4. O Flash-Next e o Max respondem a perguntas diferentes: o painel do Flash-Next testa a capacidade orientada à eficiência da nova arquitetura, enquanto o painel oficial do Qwen3.8-Max permanece como a baseline de capacidade de produção mais forte em agentes de programação, reprodução de pesquisa, cowork profissional, raciocínio visual, uso móvel e uso de computador. O Qwen4 precisará combinar ambas as direções sob avaliações alinhadas.
| Benchmark | Qwen3.8-Max reported score | What Qwen4 would need to prove |
|---|---|---|
| SWE-Pro | 67.7 | Close the gap in professional repository-level issue resolution |
| TerminalBench 2.1 | 86.6 | Improve terminal-agent reliability under the same harness |
| PaperBench | 93.0 | Maintain research strength with independent replication |
| FrontierSWE | 73.5 | Convert long-horizon reasoning into more completed engineering work |
| CoWorkBench | 74.8 | Produce more dependable professional deliverables |
| OSWorld-Verified | 86.1 | Reduce visual-action errors in computer-use workflows |
As duas baselines apontam para um requisito duplo. O Flash-Next mostra que baixo compute ativo ainda pode entregar resultados fortes em agentes e multimodalidade; o Max mostra o teto de capacidade mais alto que um novo flagship deve superar. O Qwen4 deve, portanto, ser julgado tanto pelo sucesso em tarefas alinhadas quanto pelo custo total do fluxo de trabalho, mantendo separadas as pontuações relatadas pelo fornecedor da replicação independente.
Resultados oficiais de benchmark do Qwen3.8-Max. Fonte: Qwen3.8-Max official release**.
Qwen4 vs modelos de fronteira atuais: baselines confirmadas e incógnitas
A comparação mais útil não é simplesmente Qwen4 contra Qwen3.8-Max. É Qwen4 contra as escolhas de design já visíveis no Kimi K3, DeepSeek V4 Pro e GLM-5.3. A tabela a seguir compara atributos confirmados de modelos atuais com a coluna ainda desconhecida do Qwen4.
| Dimension | Qwen4 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Pro | GLM-5.3 |
|---|---|---|---|---|---|
| Status | Architecture preview confirmed; model unreleased | Released | Released | Released | Released |
| Scale | Unknown | 2.4T / about 95B active | 2.8T / 16 of 896 experts | 1.6T / 49B active | Not disclosed for this release |
| Context | Expected 1M+ | 1M | 1M | 1M | 1M |
| Input | Multimodal direction confirmed; final interface unknown | Text, image, video | Text and native vision | Text-oriented | Text only |
| Reasoning | Unknown | Thinking and fast workflows | Low / high / max effort | Thinking / non-thinking | Always on; low / high / max |
| Open ecosystem | Final weights and license unconfirmed | Open-weight flagship exists | Open-source positioning | Open weights | Open-source positioning |
| Core focus | Expected efficient multimodal agent | Coding, cowork, visual agents | Coding and knowledge work | Efficient reasoning and coding | Coding and cybersecurity |
Escala do modelo e eficiência de inferência
A documentação do Kimi descreve 2.8T parâmetros e 16 especialistas ativados de 896. O DeepSeek V4 Pro segue uma rota diferente com 1.6T no total e 49B parâmetros ativos. O Qwen4 não precisa ser o maior modelo para vencer essa comparação; ele precisa converter computação ativa em mais trabalhos concluídos com confiabilidade.
Contexto e multimodalidade
Um milhão de tokens tornou-se um baseline comum de flagship, então o comprimento de contexto sozinho não diferenciará o Qwen4. A oportunidade mais forte do Qwen é o uso multimodal do contexto: encontrar a evidência correta em documentos, código, capturas de tela e vídeo, e então tomar a ação certa. O Kimi K3 também tem compreensão visual nativa, enquanto a interface atual do GLM-5.3 é apenas texto com contexto de 1M e saída máxima de 128K.
Programação, agentes e pontos fortes especializados
O Qwen3.8-Max traz um perfil amplo de programação, pesquisa, cowork e agentes visuais. O Qwen3.8-Flash-Next adiciona uma arquitetura multimodal orientada à eficiência com maior capacidade por parâmetro ativo. O Kimi K3 enfatiza programação de longo horizonte e trabalho de conhecimento, o DeepSeek V4 Pro enfatiza raciocínio eficiente e programação agêntica, e o GLM-5.3 adiciona um foco distinto em segurança cibernética. Um lançamento crível do Qwen4 precisaria combinar confiabilidade ampla de agentes com desempenho em nível especialista em engenharia de software e uso visual de computador.
Pesos abertos não são toda a história de implantação
Pesos abertos podem melhorar controle, customização e escolha de provedor, mas a comparação prática também inclui termos de licença, requisitos de hardware, qualidade de quantização, suporte a fine-tuning e a disponibilidade de stacks de serving otimizados. A palavra open não deve ser usada como substituto para verificar a licença exata e as condições de implantação de cada release.
Resultado da comparação: a posição potencial mais forte do Qwen4 é um agente multimodal amplo que combina os pontos fortes de visual e cowork do Qwen3.8-Max com a arquitetura de baixo compute ativo do Flash-Next e melhor confiabilidade em engenharia de software. Ele não pode ser declarado vencedor até que avaliações alinhadas e comportamento de produção estejam disponíveis.
Casos de uso potenciais para o Qwen4
Engenharia de software autônoma
Um agente Qwen mais forte poderia inspecionar um repositório, reproduzir um problema, editar múltiplos arquivos, rodar testes, revisar falhas e preparar uma mudança pronta para pull request. A métrica importante seria a porcentagem de tarefas concluídas sem resgate humano, não a quantidade de código gerado.
Trabalho de conhecimento em empresas
Contexto longo e compreensão multimodal poderiam suportar fluxos de trabalho que começam com contratos, PDFs, planilhas, diagramas e registros de reuniões e terminam com um memorando de decisão, análise ou plano de ação estruturado. As empresas ainda precisariam de controles de recuperação, logs de auditoria e verificação de fontes em torno do modelo.
Agentes multimodais de uso de computador
O Qwen4 poderia ser útil onde um agente deve interpretar capturas de tela, navegar por aplicativos, verificar o estado da UI e se recuperar quando um clique ou envio de formulário produz um resultado inesperado. Esta é uma extensão natural do forte baseline visual e estilo OSWorld do Qwen3.8-Max, mas suporte nativo a controle de computador não foi anunciado.
Pesquisa científica e de engenharia
Fluxos de trabalho de pesquisa combinam revisão de literatura, código, simulação, análise de dados e redação de relatórios. Um futuro modelo Qwen poderia orquestrar essas etapas e manter um histórico experimental mais longo. O desempenho no PaperBench torna essa uma direção crível, mas reprodutibilidade e verificação independente continuariam essenciais.
O que ainda não sabemos
Embora o Qwen tenha reconhecido a arquitetura por meio do Flash-Next, os seguintes detalhes de produção permanecem indisponíveis e devem permanecer explicitamente em aberto até um anúncio oficial do Qwen4:
- Os nomes exatos dos produtos e se o Qwen4 será lançado como um modelo ou uma família.
- A data de lançamento ou cronograma de prévia.
- Se os modelos finais manterão a proporção exata GDN/QSA do Flash-Next, o design de residuais com portas, a escala de incorporação de n-gramas e o roteamento de especialistas.
- Parâmetros totais, parâmetros ativos, contagem de especialistas e escala de dados de treinamento para cada modelo do Qwen4.
- Comprimento de contexto nativo, contexto padrão, saída máxima e modalidades suportadas para cada rota.
- Capacidades nativas de áudio, geração de imagem, saída de fala ou geração de vídeo.
- Resultados oficiais de benchmarks e o harness de avaliação usado para cada pontuação.
- Disponibilidade de pesos abertos, termos de licença e condições de uso comercial.
- Preços de API, disponibilidade regional, limites de taxa e o ID final do modelo.
Regra de verificação: trate quaisquer especificações exatas do Qwen4, gráficos de benchmarks, tabelas de preços ou identificadores de API como não verificados, a menos que possam ser rastreados diretamente ao Qwen, à Alibaba Cloud ou a um repositório oficial de modelos.
Quando o Qwen4 será lançado?
Não há uma data pública defensável de lançamento. O Qwen3.8-Flash-Next confirma que o Qwen está testando a arquitetura que sustentará o Qwen4, mas os materiais públicos não fornecem cronograma para um modelo de produção Qwen4. Conclusão de treinamento, eficiência de serving, avaliação de segurança, licenciamento de pesos e integração de produto podem todos afetar o timing e a forma do lançamento.
A abordagem de publicação mais segura é evitar previsão de mês ou trimestre. Os leitores devem acompanhar o site oficial do Qwen, a documentação do Alibaba Cloud Model Studio, repositórios de modelos verificados e o catálogo de modelos da CometAPI. Uma página de modelo do Qwen4 deve ser adicionada apenas depois que o modelo estiver de fato listado.
Como desenvolvedores podem se preparar para o Qwen4
- Estabeleça duas baselines. Use o Qwen3.8-Flash-Next para medir a eficiência da arquitetura e o Qwen3.8-Max para medir a capacidade atual do flagship.
- Separe IDs de modelo da lógica de negócios. Mantenha roteamento e configuração fora do código da aplicação para que modelos possam ser trocados com segurança.
- Construa avaliações no nível de tarefa. Meça correções de software concluídas, outputs de pesquisa precisos, cadeias de ferramentas bem-sucedidas e entregáveis utilizáveis.
- Registre o custo total do fluxo de trabalho. Acompanhe latência, tokens de entrada e saída, uso de cache, retries, ações com falha e retrabalho humano.
- Preserve rotas de fallback. Use roteamento de modelos e fallbacks de provedores em vez de tornar um modelo não lançado um ponto único de falha.
- Não invente um ID de modelo. Aguarde o identificador oficial antes de adicionar qwen4 ou qwen4-max à configuração de produção.
Experimente Qwen3.8-Flash-Next e Qwen3.8-Max via CometAPI
Os desenvolvedores podem agora testar o Qwen3.8-Flash-Next via CometAPI e manter o Qwen3.8-Max como a comparação de flagship. Crie uma chave de API, mantenha-a em uma variável de ambiente e chame o modelo existente por meio de um cliente compatível com OpenAI. O exemplo usa intencionalmente qwen3.8-flash-next; ele não assume um futuro identificador Qwen4.
Conclusão
O Qwen4 agora é mais do que um rumor: o Qwen identificou explicitamente o Qwen3.8-Flash-Next como uma prévia experimental da arquitetura que o sustentará. A prévia confirma uma direção de MoE ultraesparso multimodal, construída em torno de Gated DeltaNet, Qwen Sparse Attention, residuais com portas e incorporações de n-gramas. O Qwen3.8-Max permanece como a baseline de capacidade atual mais forte.
O verdadeiro teste para o Qwen4 não será se sua contagem de parâmetros é maior. Será se o modelo final consegue combinar a eficiência do Flash-Next com a capacidade em nível Max, completar trabalhos mais longos com menos falhas e usar evidências multimodais com mais confiabilidade. A direção de arquitetura agora é pública, mas as especificações finais, benchmarks, licença, preço, ID de API e data de lançamento permanecem desconhecidos.
