Especificações Técnicas do Qwen3.8-Flash-Next
| Especificação | Qwen3.8-Flash-Next |
|---|---|
| Desenvolvedor | Equipe Qwen, Alibaba Group |
| Tipo de modelo | Modelo de linguagem causal multimodal com codificador de visão; MoE ultra-esparso |
| Parâmetros do modelo principal | 125B |
| Parâmetros ativados | 6B por token |
| Parâmetros de incorporação de n-gramas | 51B adicionais |
| Parâmetros de MTP | 4B |
| Camadas | 48 |
| Padrão de atenção híbrida | 12 x [3 camadas Gated DeltaNet + 1 camada Qwen Sparse Attention] |
| Especialistas MoE | 512 no total; 10 roteados + 1 compartilhado por token |
| Residual com gating | 4 ramificações; rank do gargalo 320 |
| Janela de contexto nativa | 262,144 tokens |
| Contexto estendido | Até 1,000,000 tokens com YaRN |
| Modalidades | Entrada de texto, imagem, vídeo; saída de texto |
| Controles de pensamento | Modos pensar/não pensar e controles de esforço de raciocínio em APIs compatíveis |
| Implantação | Transformers, vLLM, SGLang, TokenSpeed e outros frameworks compatíveis |
| Pesos abertos | Sim |
| ID de modelo CometAPI | qwen3.8-flash-next |
O que é Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next é um modelo MoE multimodal de pesos abertos, a ser lançado pela equipe Qwen da Alibaba. Mais importante, está posicionado como uma prévia inicial da arquitetura destinada a impulsionar a futura família de modelos Qwen4, em vez de apenas mais um checkpoint incremental do Qwen3.8.
A Qwen está usando este lançamento para expor sua direção arquitetural de próxima geração ao ecossistema de código aberto antes da chegada da família Qwen4 mais ampla. Isso dá aos desenvolvedores de mecanismos de inferência, projetos de quantização, frameworks de serving de modelos e desenvolvedores de aplicações a oportunidade de se preparar antecipadamente para as mudanças arquiteturais.
A arquitetura atualmente divulgada introduz dois componentes importantes: uma arquitetura híbrida baseada em GDN e o Qwen Sparse Attention (QSA). GDN refere-se a uma abordagem de atenção linear no estilo DeltaNet com gating, que segue a direção de atenção híbrida previamente explorada no Qwen3-Next. QSA é apresentado como um novo mecanismo de atenção esparsa, embora sua especificação técnica completa ainda não tenha sido documentada publicamente.
Principais recursos do Qwen3.8-Flash-Next
- Prévia da arquitetura Qwen4: Qwen3.8-Flash-Next é explicitamente posicionado como uma implementação inicial da direção arquitetural que dará suporte à próxima família Qwen4.
- Design MoE multimodal: O modelo é descrito como um Mixture-of-Experts multimodal, estendendo a estratégia de modelos esparsos eficiente da Qwen rumo a uma nova geração de arquitetura.
- Arquitetura híbrida GDN: O modelo continua a direção de pesquisa de atenção híbrida introduzida com o Qwen3-Next, combinando mecanismos de atenção linear eficientes com atenção convencional onde a recuperação precisa é importante. O Qwen3-Next demonstrou que essa abordagem pode melhorar substancialmente a eficiência de inferência em contextos longos.
- Qwen Sparse Attention: QSA é uma das duas mudanças arquiteturais destacadas publicamente para o Flash-Next. Sua implementação detalhada e benefícios quantitativos ainda precisam ser documentados pela Qwen.
- Orientação para o ecossistema de pesos abertos: O lançamento pretende dar à comunidade de código aberto acesso antecipado às mudanças arquiteturais para que runtimes de inferência e ferramentas downstream possam se adaptar antes da chegada do Qwen4.
- Desempenho em codificação e agentes de Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| Modelo | Posicionamento | Arquitetura / Escala | Multimodal | Status atual |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Prévia de arquitetura Qwen4 / modelo aberto orientado à eficiência | MoE multimodal; especificações completas pendentes | Sim | Em breve |
| Qwen3.8-Max | Modelo flagship Qwen3.8 hospedado | MoE em larga escala | Sim | Disponível |
| Qwen3.8-27B | Modelo Qwen3.8 de pesos abertos | Modelo denso de 27B | Capacidades específicas do modelo | Disponível |
Qwen3.8-Max já está disponível por meio do ecossistema de nuvem da Alibaba e é posicionado para cargas de trabalho de raciocínio avançado, compreensão visual, codificação e agentes. A documentação atual da Qwen lista o Qwen3.8-Max com uma janela de contexto de 1M tokens, enquanto a CometAPI já expõe qwen3.8-max.
Portanto, o Flash-Next deve ser visto de forma diferente: sua importância primária neste estágio é arquitetural, em vez de baseada em benchmarks. Ele antecipa a direção técnica do Qwen4 e dá ao ecossistema de código aberto um alvo antecipado para otimização de runtime e implantação.