Qwen3.8-Flash-Next não é simplesmente um membro menor ou mais rápido da família Qwen3.8. A Qwen o descreve como um modelo MoE multimodal de pesos abertos e uma prévia inicial da arquitetura usada em Qwen4. Seu design muda atenção, conexões residuais, capacidade de embedding e otimização ao mesmo tempo, com o objetivo de melhorar a capacidade enquanto reduz drasticamente a quantidade de computação exigida por token.
TL;DR
Qwen3.8-Flash-Next combina um modelo principal de 125B parâmetros com uma tabela de embedding N-gram de 51B adicional, enquanto ativa apenas 6B parâmetros por token. Ele lida nativamente com 262.144 tokens e pode ser estendido a 1.000.000 de tokens com YaRN. A arquitetura é construída em torno de uma mistura 3:1 de Gated DeltaNet e Qwen Sparse Attention, conexões residuais Gated de quatro ramos, N-gram Embedding, um grande pool de experts ultra-esparso de MoE, Multi-Token Prediction e treinamento baseado em Muon.
O ponto mais importante é a eficiência, e não apenas a contagem bruta de parâmetros. A Qwen relata que o treinamento do modelo exige cerca de um nono do custo do Qwen3.7-Plus, e sua avaliação de lançamento coloca o modelo à frente das linhas de base anteriores do Qwen em muitas tarefas de codificação, agentes de escritório e multimodais. Esses são resultados relatados pelo fornecedor e devem ser lidos como evidência de lançamento, não como validação independente.
Para desenvolvedores, os pesos abertos estão disponíveis pelos canais Qwen, enquanto a versão gerenciada de produção se chama Qwen3.8-Flash no QwenCloud. A CometAPI lista Qwen3.8-Flash-Next com o ID de modelo qwen3.8-flash-next, oferecendo aos desenvolvedores uma rota unificada ao lado de outros modelos de fronteira.
Principais conclusões
- 125B parâmetros do modelo principal + 51B de embedding N-gram, com 6B de parâmetros ativos por token.
- Um padrão híbrido de atenção 3 GDN : 1 QSA projetado para combinar memória eficiente com recuperação precisa de longo alcance.
- Contexto nativo de 262.144 tokens e até 1M de tokens por meio do YaRN.
- A Qwen relata até 7,6x de aceleração de prefill e 4,9x de aceleração de decodificação em kernel a 1M de contexto para QSA.
- O fluxo residual é alargado em quatro ramos com portas (gated), melhorando o fluxo de informação entre camadas e a estabilidade do treinamento.
- A tabela oficial de lançamento mostra resultados fortes em SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld e RealWorldQA, mas não um domínio absoluto em todos os benchmarks.
- A Qwen posiciona o lançamento como uma prévia de arquitetura, então sua importância está em parte no que o design sinaliza para o Qwen4, e não apenas no seu ranking atual em benchmarks.
O que é Qwen3.8-Flash-Next?
Qwen3.8-Flash-Next é um modelo de linguagem causal multimodal com um codificador de visão e um backbone de linguagem com Mixture-of-Experts ultra-esparso. O model card oficial descreve uma arquitetura de 48 camadas com 512 experts, 10 experts roteados mais um expert compartilhado, e um arranjo de camadas que repete três camadas de Gated DeltaNet seguidas por uma camada de Qwen Sparse Attention.
O lançamento cumpre um papel similar ao Qwen3-Next: expõe mudanças arquiteturais antes que sejam escaladas para a próxima família completa. A Qwen chama explicitamente o modelo de uma prévia experimental da arquitetura que sustentará o Qwen4. Isso torna o modelo incomum e interessante para engenheiros que se importam com eficiência de serving, contexto longo e a direção da pesquisa de arquitetura de modelos abertos.
4 componentes centrais do Qwen3.8-Flash-Next
O modelo altera quatro componentes centrais ao mesmo tempo: atenção, fluxo residual, capacidade de embedding e otimização. Esse co-design importa porque ganhos de eficiência em um componente podem ser perdidos se outro componente se tornar o gargalo em contexto longo ou grande escala.
Atenção híbrida: GDN + Qwen Sparse Attention
A maioria das camadas não realiza atenção global. Em vez disso, três de cada quatro camadas usam Gated DeltaNet para comprimir informações históricas em um estado de tamanho fixo. A quarta camada usa atenção global para recuperação exata, mas essa atenção global é redesenhada como Qwen Sparse Attention (QSA).
QSA evita buscar cada token independentemente. Um indexador leve primeiro agrupa a sequência em microblocos, estima quais blocos importam e então presta atenção apenas às regiões selecionadas. Na descrição da Qwen, isso reduz tanto a computação de atenção quanto a sobrecarga de indexação necessária para encontrar o contexto relevante. O design é especialmente compatível com uma rede híbrida porque o índice esparso é construído independentemente dentro de cada camada de atenção, em vez de depender de similaridade entre camadas de atenção adjacentes.
Os números de eficiência são substanciais. Em um contexto de 1M tokens, a Qwen relata até 7,6x mais rápido no prefill e 4,9x mais rápido na decodificação para o kernel de atenção QSA. Em um experimento de serving com alta reutilização de cache e 90% de taxa de acerto no cache de prefixo, o modelo completo atinge 8,6x a vazão de prefill do Qwen3.7-Plus em contexto de 1M.
Gated Residual: quatro caminhos em vez de um
Um Transformer convencional lê e escreve repetidamente em um único fluxo residual. Qwen3.8-Flash-Next, em vez disso, usa Gated Residual para alargar esse fluxo em quatro ramos paralelos. Portas de leitura element-wise decidem quanto de informação tomar de cada ramo, enquanto portas de escrita em nível de ramo determinam o que é escrito de volta.
A intenção é preservar recursos úteis ao longo da profundidade sem forçar cada recurso pelo mesmo canal continuamente misturado. A Qwen também relata que a porta suprime outliers de ativação e que o estado residual pode ser armazenado em FP8, reduzindo o tráfego de memória. A ideia-chave não é simplesmente mais capacidade residual; é o roteamento controlado de informações entre camadas.
N-gram Embedding: mais capacidade sem computação proporcional
O modelo adiciona 51B de parâmetros de N-gram Embedding além dos 125B do backbone principal. Diferente de embeddings comuns que indexam a partir de um único token, N-gram Embedding usa padrões locais de tokens como bigramas e trigramas. Isso dá ao modelo uma grande memória do tipo lookup para padrões locais recorrentes.
A parte incomum é onde essa capacidade reside. Como o endereço de lookup pode ser conhecido antes de o embedding ser necessário, a tabela pode ser mantida na memória do host e pré-buscada de forma assíncrona enquanto a computação em GPU continua. Isso significa que os 51B parâmetros extras não se comportam como 51B parâmetros adicionais de multiplicação de matrizes densas. A arquitetura está, efetivamente, escalando dois recursos diferentes: parâmetros de modelo pesados em computação e memória de lookup de baixa computação.
Muon e otimização de treinamento
A Qwen treina a arquitetura com o otimizador Muon para mapas lineares bidimensionais, como os pesos principais em atenção, GDN e experts de MoE, enquanto embeddings, o roteador e parâmetros de Gated Residual de baixo rank continuam a usar AdamW. Matrizes fundidas como projeções QKV e SwiGLU são divididas em suas transformações lineares independentes antes da ortogonalização.
A equipe também reajustou sua lei de escala para a nova arquitetura e relata que o Batch Size Warmup convencional foi desnecessário. Aumentar gradualmente o tamanho do batch não melhorou o resultado final e, em vez disso, exigiu 18,8% mais etapas do otimizador. A receita final, portanto, começa diretamente no tamanho de batch alvo.
MoE ultra-esparso e Multi-Token Prediction
O model card oficial lista 512 experts com 10 experts roteados e um expert compartilhado ativo por token. O grande pool de experts aumenta a capacidade armazenada sem ativar o modelo inteiro para cada token. Um módulo de Multi-Token Prediction (MTP) de uma camada é treinado com múltiplos passos para melhorar a aceitação da decodificação especulativa enquanto também dá suporte ao backbone principal.
Desempenho do Qwen3.8-Flash-Next em benchmarks
A Qwen publica avaliações amplas de linguagem, codificação, agentes e visão-linguagem. Esses números são úteis porque muitos modelos de comparação foram reexecutados no framework da Qwen, mas ainda são avaliações de lançamento relatadas pelo fornecedor, não reproduções independentes de benchmarks. Várias linhas também usam frameworks ou juízes específicos de benchmark, então a interpretação mais segura é direcional: elas mostram onde Qwen3.8-Flash-Next é mais forte e onde os concorrentes ainda lideram.
Desempenho em codificação e agentes
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
A história em codificação é forte, mas nuançada. Qwen3.8-Flash-Next lidera o conjunto de comparação listado em SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified e LiveCodeBench v6. Contudo, a DeepSeek V4 Flash está à frente na NL2Repo-Bench, enquanto a Claude Opus 4.6 lidera o HLE. Isso torna a eficiência a manchete mais defensável do que um domínio universal de benchmarks.
Os ganhos mais notáveis sobre as linhas de base anteriores do Qwen aparecem em trabalhos de longo horizonte. CoWorkBench sobe de 65,1 no Qwen3.7-Plus para 73,9, enquanto JobBench vai de 27,6 para 55,7. Como o CoWorkBench é um benchmark interno da Qwen, esses ganhos merecem replicação independente, mas se alinham com o foco declarado da arquitetura em agentes e fluxos de trabalho de escritório com custo eficiente.
Desempenho multimodal
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (without / with CI) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (without / with CI) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
Fonte dos dados: avaliação de lançamento oficial da Qwen**.
Os resultados multimodais suportam a visão de que este não é apenas um modelo Flash focado em codificação. Qwen3.8-Flash-Next marca 84,5 no AndroidWorld, 64,0 no Vision2Web, 76,6 no LVBench e 88,5 no RealWorldQA na tabela da Qwen. O model card também fornece exemplos de entrada de imagem e vídeo, incluindo recomendações para amostragem com taxa de quadros mais alta em cargas de trabalho de vídeo na escala de horas. cargas de trabalho de vídeo.
Qwen3.8-Flash-Next vs outros modelos
Uma comparação útil deve separar três perguntas: quanta computação é ativada por token, quão amplas são as modalidades e o contexto do modelo e quão bem ele performa em fluxos de trabalho representativos. A contagem total bruta de parâmetros por si só não responde a essas perguntas.
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| Dimensão | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| Parâmetros do modelo | 125B + 51B N-gram embedding | 27B | 397B |
| Parâmetros ativos | 6B | 27B | 17B |
| Contexto nativo | 262K | 262K no setup de comparação Qwen | Modelo de contexto longo de geração anterior |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
O resultado-chave é a capacidade por parâmetro ativado. Qwen3.8-Flash-Next ativa 6B parâmetros por token versus 27B no Qwen3.8-27B e 17B no Qwen3.7-Plus, ainda assim fica à frente nos scores listados de DeepSWE, CoWorkBench, JobBench e AndroidWorld. A compensação é a pegada de memória: a esparsidade reduz a computação ativa, não a quantidade de capacidade de modelo que deve, em última instância, ser armazenada em algum lugar.
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| Dimensão | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| Pesos | Pesos abertos | Pesos abertos | Fechado |
| Perfil de parâmetros relatado | 125B principal + 51B N-gram; 6B ativos | 284B total; 13B ativos | Não divulgado publicamente |
| História principal de eficiência | QSA + GDN + MoE com 6B ativos + memória de lookup | MoE esparso de alta vazão | Stack gerenciado de raciocínio e agentes |
| Multimodalidade nativa | Texto, imagem, vídeo -> texto | Família Flash voltada a texto; rota de visão disponível separadamente na CometAPI | Texto + visão/arquivos via APIs hospedadas |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
A DeepSeek V4 Flash permanece mais forte em NL2Repo-Bench na comparação da Qwen, o que importa para geração de código em nível de repositório. A Claude Opus 4.6 é mais forte no HLE na mesma tabela e representa um modelo gerenciado fechado, não um alvo de implantação aberta. Qwen3.8-Flash-Next se diferencia mais pela combinação de pesos abertos, multimodalidade nativa, engenharia de contexto longo e um orçamento de parâmetros ativos muito pequeno.
Qwen3.8-Flash-Next vs Qwen3.8-Max
| Dimensão | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| Papel | Prévia de arquitetura com eficiência em primeiro lugar | Flagship do Qwen3.8 |
| Escala principal/total | 125B principal + 51B N-gram; 6B ativos | 2,4T total; cerca de 95B ativos na página do modelo da CometAPI |
| Ênfase da arquitetura | QSA, GDN, Gated Residual, N-gram Embedding, Muon | Capacidade de fronteira máxima em escala muito maior |
| Melhor ajuste | Agentes de alto volume, assistentes de código, automação multimodal, auto-hospedagem | Raciocínio mais difícil, grandes agentes empresariais, workloads com capacidade em primeiro lugar |
| Contexto | 262K nativo; até 1M com YaRN | Contexto de classe 1M hospedado nas rotas atuais flagship do Qwen3.8 |
As especificações do Qwen3.8-Max são baseadas na listagem atual do modelo na CometAPI.
A distinção é simples: Qwen3.8-Max é o flagship de capacidade, enquanto Qwen3.8-Flash-Next é o experimento de arquitetura e eficiência. Desenvolvedores escolhendo entre eles devem perguntar se o gargalo é a capacidade absoluta do modelo ou o custo de executar muitas tarefas de contexto longo e uso de ferramentas em escala.
Preço e disponibilidade do Qwen3.8-Flash-Next
Os pesos abertos de Qwen3.8-Flash-Next são publicados via Hugging Face e ModelScope. Para serving gerenciado, a Qwen afirma que a versão de produção se chama Qwen3.8-Flash no QwenCloud, com contexto de 1M habilitado por padrão e ferramentas oficiais embutidas.
A Qwen lista o preço do modelo de produção gerenciado em US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída. Esse preço se refere ao modelo de produção Qwen3.8-Flash no QwenCloud, não à auto-hospedagem dos pesos abertos.
| Rota | Entrada | Saída |
|---|---|---|
| Modelo de produção no QwenCloud (Qwen3.8-Flash) | US$ 0,16 / 1M tokens | US$ 0,47 / 1M tokens |
| Auto-hospedagem com pesos abertos | Dependente da infraestrutura | Dependente da infraestrutura |
| Rota CometAPI | Verificar página do modelo ao vivo | Verificar página do modelo ao vivo |
Os preços do QwenCloud vêm do artigo oficial de lançamento da Qwen; a cobrança da CometAPI deve ser verificada na página do modelo ao vivo.
Para usuários da CometAPI, o modelo dedicado Qwen3.8-Flash-Next identifica a rota como qwen3.8-flash-next. Como o roteamento, a disponibilidade upstream e a cobrança podem mudar independentemente do lançamento de pesos abertos, integrações de produção devem ler o catálogo ao vivo da CometAPI antes de fixar suposições de preço.
Recomendação da CometAPI
Espera-se que o Qwen3.8-Flash-Next se torne disponível em breve via CometAPI. A CometAPI fornece um único endpoint compatível com OpenAI (https://api.cometapi.com/v1) que agrega mais de 500 modelos de provedores líderes, incluindo a série Qwen. Essa abordagem reduz lock-in de fornecedor, simplifica a experimentação com o Qwen3.8-Flash (assim que estiver disponível via plataforma ou endpoints correlatos da Qwen) e agiliza implantações de produção que podem misturar modelos para diferentes tarefas (por exemplo, Qwen para agentes de codificação com custo eficiente + outro modelo para raciocínio especializado). Documentação e guias de início rápido estão disponíveis em apidoc.cometapi.com e no site principal da CometAPI.
Seja auto-hospedando os pesos abertos, usando o QwenCloud ou roteando por uma plataforma unificada como a CometAPI, Qwen3.8-Flash-Next reduz a barreira para agentes multimodais de alto desempenho e contexto longo.
O que o Qwen3.8-Flash-Next pode fazer?
1. Agentes de codificação em alto volume
Um orçamento de 6B de parâmetros ativos combinado com um score de 62,5 no SWE-bench Pro na avaliação da Qwen torna o Qwen3.8-Flash-Next especialmente interessante para sistemas de codificação que executam muitas sessões em paralelo. Exemplos incluem revisão de código, triagem de issues, navegação em repositórios, geração de testes e patching iterativo, onde throughput importa quase tanto quanto a inteligência por execução.
2. Trabalho de escritório e conhecimento de longo horizonte
CoWorkBench e JobBench são centrais para o posicionamento do modelo. A arquitetura é projetada para loops de agentes que repetidamente leem contexto, chamam ferramentas, atualizam estado e continuam trabalhando, em vez de responder uma única vez. Isso mapeia naturalmente para fluxos de trabalho de documentos, análise de planilhas, montagem de relatórios, síntese de pesquisa e automação de processos de negócio.
3. Agentes multimodais em computador e dispositivos móveis
Entradas de imagem e vídeo, desempenho em AndroidWorld, avaliação em OSWorld e resultados em Vision2Web tornam o modelo relevante para agentes de GUI. Ele pode servir como a camada de raciocínio por trás de sistemas que interpretam capturas de tela, operam interfaces móveis, reproduzem layouts de aplicativos ou combinam estado visual com chamadas de ferramentas.
4. Vídeo longo e raciocínio visual
O model card oficial inclui exemplos explícitos de entrada de vídeo e orientações para pré-processamento de vídeo em escala de horas. Isso torna o modelo útil para perguntas e respostas sobre vídeo, busca em vídeos longos, extração de eventos visuais e fluxos de trabalho que combinam entendimento de vídeo com ferramentas downstream.
5. Pesquisas e workflows de repositório com milhão de tokens
O modelo aberto é nativo em 262.144 tokens e extensível a 1.000.000 com YaRN. Essa distinção importa: 1M é uma extensão, e não o contexto nativo do modelo aberto. Para grandes repositórios ou corpora de pesquisa, QSA pretende tornar mais prático o custo de recuperação desses contextos longos do que a atenção global densa.
Como os desenvolvedores podem executar o Qwen3.8-Flash-Next?
Os desenvolvedores podem baixar os pesos abertos do Hugging Face e executar o modelo com Transformers, vLLM, SGLang ou TokenSpeed. A Qwen fornece exemplos compatíveis com OpenAI Chat Completions tanto para entrada de texto quanto multimodal.
Por exemplo, o model card oficial demonstra servir Qwen/Qwen3.8-Flash-Next com vLLM e chamá-lo via /v1/chat/completions. Entradas de imagem e vídeo também são demonstradas pela interface compatível com OpenAI.
Qwen3.8-Flash-Next opera em modo de pensamento por padrão. Os desenvolvedores podem controlar o comportamento de pensamento por meio de enable_thinking, preserve_thinking e reasoning_effort; os níveis documentados de reasoning_effort são xhigh, medium e low.
Quais são as limitações do Qwen3.8-Flash-Next?
A maior limitação prática é o custo de hardware. Embora apenas 6B parâmetros do modelo de linguagem sejam ativados, o checkpoint contém 125B parâmetros de linguagem mais o componente de embedding de n-gram de 51B e 4B de parâmetros do MTP. O repositório atual tem aproximadamente 360 GB, então a implantação local ainda é uma tarefa pesada em infraestrutura.
A segunda limitação é que 262K é o comprimento de contexto nativo, não 1M. O modelo pode ser estendido a 1M tokens, mas uma CometAPI ou página de modelo não deve simplesmente listar "contexto nativo de 1M". A formulação correta é contexto nativo de 262K, extensível a 1M.
Por fim, o desempenho em benchmarks é desigual. Qwen3.8-Flash-Next é altamente competitivo em tarefas de codificação e agentes, mas não lidera todos os benchmarks. Por exemplo, Claude Opus 4.6 marca 40,0 no HLE versus 35,9 para o Flash-Next, enquanto DeepSeek-V4-Flash-0731 lidera os modelos listados na NL2Repo-Bench.
Qwen3.8-Flash-Next: o que sinaliza para o Qwen4
O significado mais amplo deste lançamento é seu papel como uma prévia inicial da arquitetura que se espera sustentar o Qwen4. Qwen3.8-Flash-Next reúne Qwen Sparse Attention, Gated DeltaNet, conexões Gated Residual de quatro ramos, N-gram Embedding, um pool de experts de MoE ultra-esparso e Multi-Token Prediction. Essas escolhas mostram como a Qwen está explorando maior capacidade, contexto mais longo e desempenho multimodal e de agentes mais forte sem aumentar a computação ativa na mesma proporção.
Veredito final
Qwen3.8-Flash-Next é importante porque muda a forma do problema de eficiência. Em vez de tratar todos os parâmetros como equivalentes, ele combina um caminho MoE ativo relativamente pequeno com uma memória do tipo lookup muito grande e um mecanismo de recuperação esparsa projetado para contexto longo. Isso dá à Qwen várias alavancas independentes para aumentar a capacidade sem aumentar, na mesma taxa, a computação de matrizes por token.
Para desenvolvedores, isso torna o modelo uma opção atraente para assistentes de codificação de alto volume, agentes de contexto longo, automação multimodal e experimentação auto-hospedada. Para o roteiro mais amplo do Qwen, é ainda mais significativo: a Qwen está explicitamente usando este lançamento para expor a direção arquitetural que planeja refinar rumo ao Qwen4.
