GPT-6 Astra is now live on CometAPI →
new/Pesquisa CometAPI

Qwen4 chegará em breve: O que Qwen3.8-Flash-Next revela

Explore o que Qwen3.8-Flash-Next revela sobre a arquitetura do Qwen4, as funcionalidades esperadas, a direção dos benchmarks, a perspectiva de lançamento

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 6, 2026 18 min de leitura
Qwen4 chegará   em breve: O que Qwen3.8-Flash-Next revela
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Resposta primeiro: O Qwen4 deixou de ser apenas um nome especulativo. O Qwen agora descreve o Qwen3.8-Flash-Next como um modelo multimodal MoE e uma prévia experimental da arquitetura que sustentará o Qwen4. Isso confirma uma direção de arquitetura com foco em eficiência, mas não constitui um lançamento de produto Qwen4. O alinhamento final de modelos, a escala de parâmetros, o painel de benchmarks, o identificador de API, a licença, os preços e o cronograma de lançamento permanecem não divulgados.

O que é o Qwen4?

O Qwen4 é a próxima grande arquitetura do Qwen agora reconhecida pela equipe Qwen, embora nenhum modelo ou família de produtos Qwen4 independente tenha sido lançado. Os materiais oficiais do Qwen3.8-Flash-Next o chamam de uma prévia experimental da arquitetura para o Qwen4. Eles não divulgam a contagem final de parâmetros, o alinhamento de produtos, o painel de benchmarks, preços, identificador de API, licença ou data de lançamento. Valores exatos que não possam ser rastreados ao Qwen ou à Alibaba Cloud ainda devem ser tratados como não verificados.

A maneira mais útil de discutir o Qwen4 continua sendo separar três camadas de evidência. Informações confirmadas agora incluem os modelos atuais do Qwen, a documentação publicada e a prévia da arquitetura Qwen3.8-Flash-Next. Direções esperadas são inferências fundamentadas nesses sinais. Desconhecidos são detalhes finais de produto que não podem ser preenchidos com estimativas de forma responsável. Essa distinção é importante porque a prévia confirma a intenção arquitetural sem definir a família Qwen4 de produção.

Evidence levelHow it should be usedExamples in this article
ConfirmedState as fact with a direct official linkQwen3.8-Flash-Next architecture preview; Qwen3.8-Max scale and benchmark baseline
ExpectedUse cautious language and explain the inferenceHow the preview architecture may scale into final Qwen4 models
UnknownDo not invent a value or release commitmentFinal model lineup, parameters, scorecard, price, license, and API ID

Por que o Qwen4 é o próximo passo lógico

A geração Qwen3 estabeleceu uma abordagem híbrida para raciocínio. Sua introdução oficial descreve modos de pensamento e de não pensamento que permitem aos desenvolvedores trocar velocidade de resposta por deliberação mais profunda. A mesma geração também expandiu o suporte multilíngue e fortaleceu o uso de ferramentas, incluindo fluxos de trabalho orientados a MCP.

O roteiro do Qwen então apontou para escala de dados, extensão de contexto, ampliação de modalidades e RL com feedback do ambiente. Esse roteiro importa mais do que previsões de lançamento baseadas em rumores: ele enquadra a próxima geração como uma transição de treinar modelos para treinar agentes que podem interagir com ambientes e completar trabalhos de longo horizonte.

A linha Qwen3.8 agora fornece duas bases diferentes. O Qwen3.8-Max permanece como a baseline de capacidade atual, com um sistema MoE hospedado de 2.4-trillion-parameter para programação, trabalho de escritório, compreensão visual, documentos longos, vídeos longos e planejamento autônomo. O Qwen3.8-Flash-Next desempenha um papel diferente: o Qwen o posiciona explicitamente como a prévia da arquitetura para o Qwen4. Um futuro Qwen4 deve combinar a amplitude do flagship com o design orientado à eficiência da prévia.

img

O que o Qwen3.8-Flash-Next revela sobre o Qwen4

O Qwen3.8-Flash-Next é a primeira evidência pública concreta sobre a base do Qwen4. O Qwen o chama de a primeira release de pesos abertos sob a nova arquitetura e diz que o design sustentará o Qwen4. A prévia é, portanto, mais forte do que uma inferência do roteiro, embora ainda deixe em aberto a escala e a configuração do modelo de produção.

O modelo é um modelo de linguagem causal multimodal com um codificador de visão. Seu modelo de linguagem contém 125B parâmetros com 6B ativados, além de 51B parâmetros de incorporação de n-gramas e 4B parâmetros MTP. Ele tem 48 camadas, 512 especialistas com 10 roteados e um especialista compartilhado ativo por token, um contexto nativo de 262.144 tokens e suporte de extensão até 1.000.000 de tokens.

Architecture signalConfirmed in Qwen3.8-Flash-NextWhat it suggests for Qwen4
Ultra-sparse MoE125B main model; 6B active per token; 512 expertsCapability per unit of active compute may be a central objective
Hybrid attentionThree Gated DeltaNet layers for every Qwen Sparse Attention layerLong-context latency and KV-cache efficiency may matter more than raw window size
Gated ResidualFour widened residual branches with data-dependent gatesQwen is testing more expressive deep scaling with controlled overhead
N-gram embedding51B bigram and trigram embedding parametersMemory-offloadable capacity may supplement compute-heavy MoE scaling
Native multimodalityCausal language model with a vision encoderText and vision are likely architectural foundations, not bolt-on variants
Long context262K native; extensible to 1MQwen4 is likely to emphasize efficient long-horizon agents

Os resultados de benchmark relatados pelo fornecedor na prévia também mostram por que a arquitetura importa. Apesar de ativar apenas 6B parâmetros por token, ela melhora o baseline denso Qwen3.8-27B nos testes selecionados de programação, trabalho de escritório, uso de ferramentas e avaliações de agentes multimodais abaixo. Esses resultados não são pontuações do Qwen4; são evidências de que a nova arquitetura é projetada para elevar a capacidade por parâmetro ativo.

BenchmarkQwen3.8-Flash-NextQwen3.8-27B
DeepSWE 1.158.742.2
SWE-bench Pro62.561.7
CoWorkBench73.970.7
Toolathlon Verified73.567.1
ClawEval-MM (Pass@3)64.457.4
AndroidWorld84.581.9

Interpretação: o Flash-Next transforma três expectativas do Qwen4 em sinais mais fortes: ativação ultraesparsa, atenção híbrida para longos contextos e multimodalidade nativa. Ele não revela a contagem final de parâmetros do Qwen4, a configuração exata de contexto, os níveis de produto ou o cronograma de lançamento.

Especificações esperadas do Qwen4

Como não existe especificação final do Qwen4, a tabela abaixo usa o Qwen3.8-Max como a baseline de produção confirmada e o Qwen3.8-Flash-Next como o sinal de arquitetura confirmado. A prévia aumenta a confiança em várias direções, mas cada campo final do Qwen4 permanece esperado ou desconhecido até que o Qwen publique o modelo.

SpecificationQwen3.8-Max confirmed baselineQwen4 expectationConfidence
StatusReleasedArchitecture preview confirmed; model not launchedConfirmed
ArchitectureSparse MoE with hybrid attention foundationExpected to build on Flash-Next's GDN + QSA, gated residual, and n-gram embeddingHigh
Total parameters2.4TUnknown; may not need to exceed 2.4TLow
Active parametersAbout 95B per step in the open-weight modelLikely ultra-sparse routing; exact active compute unknownMedium-high
Context window1,000,000 tokensLong-context optimized; final native and default limits unknownHigh
Maximum output131,072 tokensLikely maintained or expandedMedium
Hosted inputsText, image, and videoMultimodal direction is confirmed; exact audio support is unknownHigh
Output modalityTextText is likely; native media output is unconfirmedMedium
ReasoningThinking and faster inference workflowsThinking controls are likely; final API behavior unknownMedium-high
Tool supportFunction calling and structured outputStronger tool selection, preserved state, and recovery expectedHigh
Weights and licenseOpen-weight flagship checkpoint existsPreview is open-weight; final Qwen4 license and checkpoints unknownMedium
API model IDqwen3.8-maxNot availableConfirmed

Interpretação: o Flash-Next eleva a confiança em roteamento MoE ultraesparso, atenção híbrida para contextos longos, residuais com portas, incorporação de n-gramas e multimodalidade nativa. Ele não prova que um modelo final do Qwen4 usará 125B parâmetros, ativará 6B por token ou será lançado com os mesmos limites de contexto.

Em que arquitetura espera-se que o Qwen4 se apoie?

MoE ultraesparso é agora o sinal mais forte

A questão arquitetural agora é menos especulativa. O card do modelo Qwen3.8-Flash-Next documenta 125B parâmetros principais com apenas 6B ativados por token, além de 51B n-gramas incorporados. Esse design ultraesparso sugere que o Qwen4 pode priorizar a capacidade total de tarefa por unidade de computação ativa, em vez de expandir a contagem de parâmetros ativos na mesma proporção da capacidade armazenada.

A questão importante não é se o Qwen4 contém mais especialistas, mas se o roteamento, o acesso à memória e a especialização de especialistas permanecem estáveis ao longo de tarefas longas. As incorporações de n-gramas do Flash-Next também mostram que o Qwen está explorando capacidade mais barata de computar e mais fácil de descarregar do que a escalada convencional de MoE.

Atenção híbrida mira a eficiência em contextos longos

O Flash-Next substitui a combinação anterior de Gated DeltaNet e atenção total por Gated DeltaNet e Qwen Sparse Attention operando no nível de microbloco. Suas 48 camadas repetem três blocos Gated DeltaNet seguidos por um bloco de atenção esparsa. Este é o sinal mais claro de que o Qwen4 pode ser projetado para reduzir a latência em longos contextos e a pressão no cache de KV, em vez de depender de uma janela de atenção densa maior.

Contexto longo deve virar memória do agente, não apenas um prompt maior

Uma janela de um milhão de tokens só é útil quando o modelo consegue recuperar a evidência correta, preservar objetivos e evitar acumular estado contraditório. O Qwen4 deve, portanto, ser avaliado em como usa o contexto longo ao longo de chamadas de ferramentas, mudanças de arquivos, resultados intermediários e recuperação de erros. O comprimento bruto do contexto é menos informativo do que a precisão de recuperação e a conclusão de tarefas ao longo de uma trajetória longa.

O controle de raciocínio pode tornar-se mais granular

O design híbrido de pensamento do Qwen3 já permitiu comportamentos rápidos e deliberados. O Flash-Next fortalece o sinal ao suportar controles enable_thinking, preserve_thinking e reasoning_effort. Uma melhoria significativa no Qwen4 poderia alocar raciocínio de forma dinâmica e preservar apenas o estado que melhora a consistência de múltiplas etapas, reduzindo o custo total do fluxo de trabalho em vez de simplesmente produzir raciocínios visíveis mais longos.

A multimodalidade pode aproximar-se do uso de computador

A multimodalidade é agora uma expectativa mais forte porque tanto o serviço hospedado Qwen3.8-Max quanto a prévia de pesos abertos Flash-Next suportam entrada visual. O Qwen4 poderia combinar essa percepção com ação mais confiável: entender uma captura de tela, selecionar um controle de UI, verificar o resultado e corrigir o plano. Áudio nativo, geração de imagens, saída de fala e geração de vídeo continuam não confirmados.

Recursos esperados do Qwen4

  • Agentes de longo horizonte mais confiáveis. Menores taxas de falha em chamadas de ferramentas, retenção de objetivos mais forte, melhor recuperação e entregas mais consistentes após centenas de ações.
  • Engenharia de software em escala de repositório. Planejamento aprimorado em grandes bases de código, testes, terminais, rastreadores de issues e ambientes de implantação.
  • Trabalho de conhecimento de ponta a ponta. Um caminho mais robusto de pesquisa e análise de documentos até planilhas, apresentações, relatórios e outputs prontos para decisão.
  • Uso multimodal de ferramentas. Compreensão visual que informa interação com UI, operações de documento e raciocínio ancorado no ambiente.
  • Orçamentos de raciocínio adaptativos. Escalonamento automático de respostas rápidas para raciocínio mais profundo quando a incerteza ou a complexidade da tarefa aumenta.
  • Maior capacidade por parâmetro ativo. Melhor roteamento de especialistas, capacidade via n-gramas, atenção esparsa, caching e pós-treinamento, em vez de escala por si só.
  • Uma família de modelos mais ampla. Possíveis variantes Max, Plus, Coder, MoE pequeno, VL ou Omni, embora nenhum desses nomes esteja confirmado.

Perspectiva de benchmarks do Qwen4: o que a baseline do Qwen3.8-Max mostra

Não há pontuações de benchmarks do Qwen4. O Flash-Next e o Max respondem a perguntas diferentes: o painel do Flash-Next testa a capacidade orientada à eficiência da nova arquitetura, enquanto o painel oficial do Qwen3.8-Max permanece como a baseline de capacidade de produção mais forte em agentes de programação, reprodução de pesquisa, cowork profissional, raciocínio visual, uso móvel e uso de computador. O Qwen4 precisará combinar ambas as direções sob avaliações alinhadas.

BenchmarkQwen3.8-Max reported scoreWhat Qwen4 would need to prove
SWE-Pro67.7Close the gap in professional repository-level issue resolution
TerminalBench 2.186.6Improve terminal-agent reliability under the same harness
PaperBench93.0Maintain research strength with independent replication
FrontierSWE73.5Convert long-horizon reasoning into more completed engineering work
CoWorkBench74.8Produce more dependable professional deliverables
OSWorld-Verified86.1Reduce visual-action errors in computer-use workflows

As duas baselines apontam para um requisito duplo. O Flash-Next mostra que baixo compute ativo ainda pode entregar resultados fortes em agentes e multimodalidade; o Max mostra o teto de capacidade mais alto que um novo flagship deve superar. O Qwen4 deve, portanto, ser julgado tanto pelo sucesso em tarefas alinhadas quanto pelo custo total do fluxo de trabalho, mantendo separadas as pontuações relatadas pelo fornecedor da replicação independente.

img

Resultados oficiais de benchmark do Qwen3.8-Max. Fonte: Qwen3.8-Max official release**.

Qwen4 vs modelos de fronteira atuais: baselines confirmadas e incógnitas

A comparação mais útil não é simplesmente Qwen4 contra Qwen3.8-Max. É Qwen4 contra as escolhas de design já visíveis no Kimi K3, DeepSeek V4 Pro e GLM-5.3. A tabela a seguir compara atributos confirmados de modelos atuais com a coluna ainda desconhecida do Qwen4.

DimensionQwen4Qwen3.8-MaxKimi K3DeepSeek V4 ProGLM-5.3
StatusArchitecture preview confirmed; model unreleasedReleasedReleasedReleasedReleased
ScaleUnknown2.4T / about 95B active2.8T / 16 of 896 experts1.6T / 49B activeNot disclosed for this release
ContextExpected 1M+1M1M1M1M
InputMultimodal direction confirmed; final interface unknownText, image, videoText and native visionText-orientedText only
ReasoningUnknownThinking and fast workflowsLow / high / max effortThinking / non-thinkingAlways on; low / high / max
Open ecosystemFinal weights and license unconfirmedOpen-weight flagship existsOpen-source positioningOpen weightsOpen-source positioning
Core focusExpected efficient multimodal agentCoding, cowork, visual agentsCoding and knowledge workEfficient reasoning and codingCoding and cybersecurity

Escala do modelo e eficiência de inferência

A documentação do Kimi descreve 2.8T parâmetros e 16 especialistas ativados de 896. O DeepSeek V4 Pro segue uma rota diferente com 1.6T no total e 49B parâmetros ativos. O Qwen4 não precisa ser o maior modelo para vencer essa comparação; ele precisa converter computação ativa em mais trabalhos concluídos com confiabilidade.

Contexto e multimodalidade

Um milhão de tokens tornou-se um baseline comum de flagship, então o comprimento de contexto sozinho não diferenciará o Qwen4. A oportunidade mais forte do Qwen é o uso multimodal do contexto: encontrar a evidência correta em documentos, código, capturas de tela e vídeo, e então tomar a ação certa. O Kimi K3 também tem compreensão visual nativa, enquanto a interface atual do GLM-5.3 é apenas texto com contexto de 1M e saída máxima de 128K.

Programação, agentes e pontos fortes especializados

O Qwen3.8-Max traz um perfil amplo de programação, pesquisa, cowork e agentes visuais. O Qwen3.8-Flash-Next adiciona uma arquitetura multimodal orientada à eficiência com maior capacidade por parâmetro ativo. O Kimi K3 enfatiza programação de longo horizonte e trabalho de conhecimento, o DeepSeek V4 Pro enfatiza raciocínio eficiente e programação agêntica, e o GLM-5.3 adiciona um foco distinto em segurança cibernética. Um lançamento crível do Qwen4 precisaria combinar confiabilidade ampla de agentes com desempenho em nível especialista em engenharia de software e uso visual de computador.

Pesos abertos não são toda a história de implantação

Pesos abertos podem melhorar controle, customização e escolha de provedor, mas a comparação prática também inclui termos de licença, requisitos de hardware, qualidade de quantização, suporte a fine-tuning e a disponibilidade de stacks de serving otimizados. A palavra open não deve ser usada como substituto para verificar a licença exata e as condições de implantação de cada release.

Resultado da comparação: a posição potencial mais forte do Qwen4 é um agente multimodal amplo que combina os pontos fortes de visual e cowork do Qwen3.8-Max com a arquitetura de baixo compute ativo do Flash-Next e melhor confiabilidade em engenharia de software. Ele não pode ser declarado vencedor até que avaliações alinhadas e comportamento de produção estejam disponíveis.

Casos de uso potenciais para o Qwen4

Engenharia de software autônoma

Um agente Qwen mais forte poderia inspecionar um repositório, reproduzir um problema, editar múltiplos arquivos, rodar testes, revisar falhas e preparar uma mudança pronta para pull request. A métrica importante seria a porcentagem de tarefas concluídas sem resgate humano, não a quantidade de código gerado.

Trabalho de conhecimento em empresas

Contexto longo e compreensão multimodal poderiam suportar fluxos de trabalho que começam com contratos, PDFs, planilhas, diagramas e registros de reuniões e terminam com um memorando de decisão, análise ou plano de ação estruturado. As empresas ainda precisariam de controles de recuperação, logs de auditoria e verificação de fontes em torno do modelo.

Agentes multimodais de uso de computador

O Qwen4 poderia ser útil onde um agente deve interpretar capturas de tela, navegar por aplicativos, verificar o estado da UI e se recuperar quando um clique ou envio de formulário produz um resultado inesperado. Esta é uma extensão natural do forte baseline visual e estilo OSWorld do Qwen3.8-Max, mas suporte nativo a controle de computador não foi anunciado.

Pesquisa científica e de engenharia

Fluxos de trabalho de pesquisa combinam revisão de literatura, código, simulação, análise de dados e redação de relatórios. Um futuro modelo Qwen poderia orquestrar essas etapas e manter um histórico experimental mais longo. O desempenho no PaperBench torna essa uma direção crível, mas reprodutibilidade e verificação independente continuariam essenciais.

O que ainda não sabemos

Embora o Qwen tenha reconhecido a arquitetura por meio do Flash-Next, os seguintes detalhes de produção permanecem indisponíveis e devem permanecer explicitamente em aberto até um anúncio oficial do Qwen4:

  • Os nomes exatos dos produtos e se o Qwen4 será lançado como um modelo ou uma família.
  • A data de lançamento ou cronograma de prévia.
  • Se os modelos finais manterão a proporção exata GDN/QSA do Flash-Next, o design de residuais com portas, a escala de incorporação de n-gramas e o roteamento de especialistas.
  • Parâmetros totais, parâmetros ativos, contagem de especialistas e escala de dados de treinamento para cada modelo do Qwen4.
  • Comprimento de contexto nativo, contexto padrão, saída máxima e modalidades suportadas para cada rota.
  • Capacidades nativas de áudio, geração de imagem, saída de fala ou geração de vídeo.
  • Resultados oficiais de benchmarks e o harness de avaliação usado para cada pontuação.
  • Disponibilidade de pesos abertos, termos de licença e condições de uso comercial.
  • Preços de API, disponibilidade regional, limites de taxa e o ID final do modelo.

Regra de verificação: trate quaisquer especificações exatas do Qwen4, gráficos de benchmarks, tabelas de preços ou identificadores de API como não verificados, a menos que possam ser rastreados diretamente ao Qwen, à Alibaba Cloud ou a um repositório oficial de modelos.

Quando o Qwen4 será lançado?

Não há uma data pública defensável de lançamento. O Qwen3.8-Flash-Next confirma que o Qwen está testando a arquitetura que sustentará o Qwen4, mas os materiais públicos não fornecem cronograma para um modelo de produção Qwen4. Conclusão de treinamento, eficiência de serving, avaliação de segurança, licenciamento de pesos e integração de produto podem todos afetar o timing e a forma do lançamento.

A abordagem de publicação mais segura é evitar previsão de mês ou trimestre. Os leitores devem acompanhar o site oficial do Qwen, a documentação do Alibaba Cloud Model Studio, repositórios de modelos verificados e o catálogo de modelos da CometAPI. Uma página de modelo do Qwen4 deve ser adicionada apenas depois que o modelo estiver de fato listado.

Como desenvolvedores podem se preparar para o Qwen4

  • Estabeleça duas baselines. Use o Qwen3.8-Flash-Next para medir a eficiência da arquitetura e o Qwen3.8-Max para medir a capacidade atual do flagship.
  • Separe IDs de modelo da lógica de negócios. Mantenha roteamento e configuração fora do código da aplicação para que modelos possam ser trocados com segurança.
  • Construa avaliações no nível de tarefa. Meça correções de software concluídas, outputs de pesquisa precisos, cadeias de ferramentas bem-sucedidas e entregáveis utilizáveis.
  • Registre o custo total do fluxo de trabalho. Acompanhe latência, tokens de entrada e saída, uso de cache, retries, ações com falha e retrabalho humano.
  • Preserve rotas de fallback. Use roteamento de modelos e fallbacks de provedores em vez de tornar um modelo não lançado um ponto único de falha.
  • Não invente um ID de modelo. Aguarde o identificador oficial antes de adicionar qwen4 ou qwen4-max à configuração de produção.

Experimente Qwen3.8-Flash-Next e Qwen3.8-Max via CometAPI

Os desenvolvedores podem agora testar o Qwen3.8-Flash-Next via CometAPI e manter o Qwen3.8-Max como a comparação de flagship. Crie uma chave de API, mantenha-a em uma variável de ambiente e chame o modelo existente por meio de um cliente compatível com OpenAI. O exemplo usa intencionalmente qwen3.8-flash-next; ele não assume um futuro identificador Qwen4.

Conclusão

O Qwen4 agora é mais do que um rumor: o Qwen identificou explicitamente o Qwen3.8-Flash-Next como uma prévia experimental da arquitetura que o sustentará. A prévia confirma uma direção de MoE ultraesparso multimodal, construída em torno de Gated DeltaNet, Qwen Sparse Attention, residuais com portas e incorporações de n-gramas. O Qwen3.8-Max permanece como a baseline de capacidade atual mais forte.

O verdadeiro teste para o Qwen4 não será se sua contagem de parâmetros é maior. Será se o modelo final consegue combinar a eficiência do Flash-Next com a capacidade em nível Max, completar trabalhos mais longos com menos falhas e usar evidências multimodais com mais confiabilidade. A direção de arquitetura agora é pública, mas as especificações finais, benchmarks, licença, preço, ID de API e data de lançamento permanecem desconhecidos.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Sep 6, 2026
Última atualização Sep 6, 2026
15 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais