Resumo
Qwen3.8-Omni-Flash é o modelo onimodal nativo da Qwen (Alibaba) para compreensão de texto, imagem, áudio e vídeo, tendo texto como modalidade de saída. Anunciado em 18 de setembro de 2026, combina uma janela de contexto de 1M tokens, raciocínio nativo sobre áudio e vídeo, raciocínio ajustável, chamadas de função, pesquisa na web, compreensão de áudio espacial e uso de ferramentas.
A mudança mais importante não é apenas melhor compreensão de vídeo. A Qwen descreve o modelo como seu primeiro modelo onimodal construído em torno de capacidades agênticas: ele entende o que vê e ouve, planeja o que fazer em seguida, invoca ferramentas e executa tarefas mais longas, como edição de vlogs, tradução de vídeos, produção de resumos de filmes, análise de reuniões e pesquisa multimídia.
No lançamento, a Qwen reportou uma melhora média de mais de 25% em 29 avaliações em comparação ao Qwen3.5-Omni-Plus. São resultados reportados pelo fornecedor no lançamento, e não avaliações independentes.
Principais pontos
- Entrada onimodal nativa: Qwen3.8-Omni-Flash aceita texto, imagem, áudio e vídeo, retornando atualmente texto.
- Workflows de mídia agênticos: combina compreensão de mídia com planejamento, chamadas de função e pesquisa na web.
- Contexto longo e profundidade de áudio: o modelo hospedado oferece janela de contexto de 1M tokens e suporta áudio multilíngue, estéreo e ambisônico de primeira ordem.
- Ganhos de benchmark reportados pelo fornecedor: as maiores melhorias aparecem em agentes multimodais, compreensão de áudio longo, diarização de falantes e grounding de áudio.
- Disponibilidade hospedada: o modelo está disponível por APIs hospedadas; Qwen-MM-Plugins é open source separadamente para workflows de agentes multimodais.
Desenvolvedores podem acessar a API Qwen3.8-Omni-Flash na CometAPI por meio de um fluxo de API unificado.
O que é o Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash é a próxima geração de modelo onimodal nativo da Qwen. Em vez de tratar áudio ou vídeo apenas como artefatos de pré-processamento, ele raciocina sobre texto, quadros visuais, fala, som ambiente e relações temporais dentro de um único workflow. Suas entradas suportadas são texto, imagens, áudio e vídeo; sua saída atual é texto.
Essa distinção de saída importa. A documentação oficial da Alibaba Cloud posiciona o Qwen3.8-Omni-Flash para compreensão multimodal e execução agêntica, enquanto casos de uso com saída de fala continuam melhor atendidos por variantes Omni que suportam geração de áudio.
O enquadramento do lançamento desloca-se de “perceber a mídia” para “entender, planejar, executar e entregar”. Isso torna o modelo relevante para edição de vídeo, pesquisa multimídia, análise de reuniões, processamento de vídeos instrucionais e outros workflows em que o modelo precisa fazer algo com a mídia, e não apenas resumi-la.
Especificações do Qwen3.8-Omni-Flash
A tabela de especificações abaixo baseia-se nas páginas oficiais da Alibaba Cloud e QwenCloud; limites e preços podem variar por região e devem ser verificados novamente antes de publicação ou implantação.
| Especificação | Qwen3.8-Omni-Flash — página oficial do modelo |
|---|---|
| Desenvolvedor | Alibaba Qwen |
| Lançamento | September 18, 2026 |
| Tipo de modelo | Modelo onimodal nativo |
| Entrada / saída | Texto, imagem, áudio, vídeo / texto |
| Janela de contexto | 1,000,000 tokens |
| Entrada máxima | 991,808 tokens normal; 983,616 tokens em modo de raciocínio |
| Saída máxima | 131,072 tokens |
| Limite máximo de raciocínio | Até 262K tokens no QwenCloud |
| Raciocínio | Ativado por padrão; esforço de raciocínio configurável |
| Ferramentas e cache | Chamadas de função, pesquisa na web, cache implícito e cache de sessão |
| Áudio | 113 idiomas e dialetos; estéreo e FOA de quatro canais |
| Estilos de API | Chat Completions e Responses |
| Preço no QwenCloud | $0.15 entrada, $0.47 saída e $0.016 entrada via cache implícito por 1M tokens |
| Pesos abertos | Não anunciados para este modelo no lançamento |
Como o Qwen3.8-Omni-Flash funciona?
O QwenCloud afirma que o Qwen3.8-Omni-Flash é construído sobre a arquitetura Qwen3.8-Flash-Next. Isso fornece contexto arquitetural, mas as contagens de parâmetros publicadas para o Flash-Next não devem ser automaticamente apresentadas como a especificação exata de parâmetros do modelo Omni, a menos que a Qwen confirme esse mapeamento.
Gated DeltaNet + Qwen Sparse Attention
A base do Flash-Next combina Gated DeltaNet com Qwen Sparse Attention. Em termos simplificados, o componente recorrente condensa a informação histórica em um estado compacto, enquanto a atenção esparsa recupera contexto de longo alcance selecionado em vez de aplicar atenção densa total a cada par de tokens. Isso é especialmente relevante para fluxos longos de áudio e vídeo, em que o comprimento da sequência pode dominar o custo computacional.
Percepção agêntica em vez de percepção estática
A mudança maior é no nível de sistema. A Qwen afirma que o modelo pode explorar ativamente vídeos longos e focar em momentos relevantes, em vez de gastar computação igualmente em cada segmento. Conceitualmente, o agente identifica onde é provável que estejam as evidências, inspeciona esses momentos com mais profundidade, raciocina sobre eles e então decide qual ferramenta ou operação deve ocorrer em seguida.
Quais são os principais recursos do Qwen3.8-Omni-Flash?
Raciocínio nativo sobre áudio e vídeo
Qwen3.8-Omni-Flash raciocina conjuntamente sobre os fluxos visual e de áudio de um vídeo. Isso é importante quando a resposta depende de ambas as modalidades: identificar quem disse algo, decidir se um som ocorreu antes ou depois de uma ação, interpretar música ou áudio ambiente, ou conectar instruções faladas ao que aparece na tela.
Compreensão de áudio espacial e de múltiplos falantes
A API suporta áudio multicanais, incluindo estéreo de dois canais e ambisônico de primeira ordem com quatro canais. Preservar a informação direcional pode ajudar em análise de reuniões, agentes incorporados, eventos gravados, ambientes com múltiplos falantes e grounding de áudio.
Esforço de raciocínio ajustável
O raciocínio vem ativado por padrão. Desenvolvedores podem configurar o esforço de raciocínio para equilibrar latência e consumo de tokens com um raciocínio mais profundo em tarefas multimídia complexas.
Chamadas de função e pesquisa na web
Chamadas de função e pesquisa na web são centrais para o posicionamento agêntico. Após entender um vídeo, imagem ou arquivo de áudio, o modelo pode passar argumentos estruturados para uma ferramenta externa, recuperar informações adicionais ou continuar um workflow fora do modelo.
Qwen-MM-Plugins
A Qwen também lançou o Qwen-MM-Plugins, um toolkit Apache-2.0 para harnesses nativos multimodais de agentes. Seus workflows incluem produção de vídeo, conversão de vídeo para notas, aprendizado de habilidades reutilizáveis a partir de vídeos de demonstração e memória audiovisual.
Quão bom é o Qwen3.8-Omni-Flash em benchmarks?
O Qwen3.8-Omni-Flash ainda é bom em texto e programação?
Os resultados de lançamento da Qwen indicam que o modelo Omni permanece próximo ao modelo de texto relacionado (Flash) em várias avaliações de programação e raciocínio. A Qwen reporta 92.6 no LiveCodeBench v6, 63.3 no SWE-bench Pro e 91.0 no GPQA Diamond. São resultados reportados pelo fornecedor sob a configuração de lançamento da Qwen e devem ser validados em relação às tarefas de programação e ao arcabouço de agente usados em produção.
A Qwen reporta mais de 25% de melhoria média em 29 avaliações em comparação com o Qwen3.5-Omni-Plus. As tabelas a seguir resumem os resultados oficiais de benchmark do lançamento. São resultados de primeira parte e ainda não haviam sido reproduzidos independentemente na publicação.
Condições de avaliação: Linhas estáticas medem uma única execução do modelo sob a configuração de lançamento da Qwen. Linhas rotuladas “+ agent” incluem um arcabouço de agente ao redor, recuperação (retrieval) ou inspeção iterativa de mídia. Os materiais oficiais de lançamento devem ser consultados para templates de prompt, configurações de amostragem, pré-processamento de mídia e versões do arcabouço; onde esses detalhes não são divulgados, o resultado deve ser tratado como reportado pelo fornecedor, e não como reprodutível independentemente.
O significado maior é a mudança de compreensão multimodal para execução multimodal. Pipelines anteriores frequentemente transcreviam áudio, amostravam quadros de vídeo, enviavam esses artefatos para um LLM, produziam uma resposta e então se apoiavam em lógica de aplicação separada para a tarefa real. O Qwen3.8-Omni-Flash foi projetado para condensar mais desse ciclo em um único sistema de agente.
Um agente de produção de mídia pode inspecionar as filmagens e o áudio antes de planejar edições. Um agente de reuniões pode combinar identidade do falante com conteúdo falado e visuais de apresentação. Um agente de pesquisa pode localizar momentos relevantes em horas de material audiovisual e então buscar contexto externo. Nesse enquadramento, áudio e vídeo tornam-se contexto de trabalho para um agente, e não anexos passivos.
Agentes de áudio e vídeo
| Benchmark — fonte oficial do lançamento | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
O maior salto geracional é no WildClawBench-MM, onde a Qwen reporta uma subida de 34.5 para 71.0. O AgenticVBench também melhora acentuadamente, enquanto o Gemini 3.8 Flash permanece à frente nesse benchmark. O padrão, portanto, não é um resultado universal de “um único modelo vence tudo”.
Compreensão e raciocínio de áudio e vídeo
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code agent | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + agent | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + agent | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
As linhas estáticas são mistas. O Gemini lidera vários testes convencionais de raciocínio em vídeo, mas o resultado da Qwen geralmente sobe dentro de um loop agêntico. Essa distinção só importa quando a aplicação em produção usa retrieval, ferramentas ou inspeção iterativa comparáveis.
Compreensão de áudio e de múltiplos falantes
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
As linhas de reunião são o destaque, enquanto FLEURS-ASR e VoiceBench não melhoram sobre o predecessor. Os resultados do lançamento, portanto, apontam para uma compreensão mais rica de áudio de múltiplos falantes, espacial e de contexto longo, em vez de uma vitória uniforme em reconhecimento de fala.
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
A tabela combina informações oficiais de produto da Qwen com a especificação oficial do Gemini 3.8 Flash do Google. As comparações de benchmark continuam executadas pela Qwen e não devem ser tratadas como rankings neutros de terceiros.
| Dimensão | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Arquitetura | Base Qwen3.8-Flash-Next; mapeamento exato de parâmetros do Omni não divulgado | Geração Omni anterior da Qwen | Arquitetura proprietária Gemini do Google |
| Janela de contexto | 1M tokens | Limites de implantação menores | 1,048,576 tokens de entrada |
| Raciocínio | Esforço de raciocínio ajustável; raciocínio ativado por padrão | Sem modo de raciocínio “ativado por padrão” equivalente na implantação citada | Níveis de raciocínio baixo, médio e alto |
| Entrada multimodal | Texto, imagem, áudio, vídeo | Texto, imagem, áudio, vídeo | Texto, imagem, vídeo, áudio e PDF |
| Saída | Texto | Texto e fluxos de trabalho com saída de fala suportados | Texto |
| Programação | Fortes pontuações de programação reportadas; não é seu principal diferencial | Não é o principal posicionamento | Projetado para engenharia de software de longo horizonte e agentes |
| Disponibilidade da API | Chat Completions e Responses; API hospedada | APIs hospedadas da Qwen | Gemini API; disponibilidade geral |
| Ferramentas | Chamadas de função e pesquisa na web | Chamadas de função e pesquisa na web | Chamadas de função, grounding de busca, execução de código e outras ferramentas integradas |
| Preços de API publicados | QwenCloud: $0.15 entrada / $0.47 saída por 1M tokens | Dependente de região e endpoint | Preço introdutório do Google: $0.75 entrada / $3.75 saída por 1M tokens até 31 de dezembro de 2026 |
| Melhor adequação | Agentes de mídia e análise | Conversação Omni e saída de fala | Amplos fluxos de trabalho multimodais, de programação e de agentes autônomos |
Qwen3.5-Omni-Plus permanece relevante quando é necessária geração de fala. Qwen3.8-Omni-Flash está mais claramente otimizado para compreensão eficiente de áudio e vídeo, além de execução orientada a ferramentas.
Em comparação com o Gemini 3.8 Flash, a avaliação da Qwen é mista: Qwen3.8-Omni-Flash é competitivo em áudio, processamento de múltiplos falantes, grounding e vários workflows agênticos, enquanto o Gemini lidera alguns testes estáticos de raciocínio em vídeo. A comparação sensata é específica ao workload.
Desenvolvedores que avaliam acesso unificado podem comparar a API Gemini 3.8 Flash na CometAPI, API Qwen3.8-Flash na CometAPI e API Qwen3.8-Flash-Next na CometAPI fora da tabela, para que links de fonte técnica e de acesso ao produto permaneçam distintos.
Limitações do Qwen3.8-Omni-Flash
- Saída apenas em texto: entende áudio e vídeo, mas não gera fala como modalidade de resposta.
- Implantação hospedada: pesos abertos não foram anunciados para o Qwen3.8-Omni-Flash no lançamento.
- Benchmarks recentes: as comparações de destaque são principalmente resultados de primeira parte e precisam de replicação independente.
- Efeitos do arcabouço de agente: algumas pontuações incluem recuperação, ambientes de ferramentas ou inspeção iterativa e não devem ser confundidas com resultados de modelo bruto apenas.
- Custo dependente do fluxo de trabalho: vídeos longos ainda podem se tornar caros se o aplicativo reprocessar repetidamente grandes segmentos em vez de usar retrieval, cache ou inspeção direcionada.
Quem deve usar o Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash é mais interessante quando áudio ou vídeo faz parte da própria tarefa, e não um anexo que precisa apenas ser resumido. Casos de uso adequados incluem inteligência de reuniões, busca em mídia de forma longa, pipelines de tradução de vídeo, workflows de tutoriais para notas, agentes de produção de mídia e acervos audiovisuais.
Para chat de texto convencional, um modelo Flash dedicado a texto pode continuar sendo mais simples. Para aplicações com saída de fala, um modelo Omni com geração de áudio explícita pode ser mais adequado. Para workflows que combinam ver, ouvir, raciocinar e agir, o Qwen3.8-Omni-Flash é a opção mais distintiva na linha da Qwen.
Conclusão
Qwen3.8-Omni-Flash deve ser entendido como um modelo agêntico de áudio e vídeo, não apenas mais um lançamento Flash multimodal. Sua janela de 1M de contexto, raciocínio nativo sobre áudio e vídeo, capacidades de múltiplos falantes e áudio espacial, raciocínio ajustável, chamadas de função, busca e ecossistema Qwen-MM-Plugins visam a mesma transição: permitir que um sistema de IA passe de entender multimídia para trabalhar com multimídia.
Os dados de lançamento indicam uma melhoria geracional substancial sobre o Qwen3.5-Omni-Plus, particularmente em workflows agênticos e cenários de áudio complexos. Em relação ao Gemini 3.8 Flash, os números da própria Qwen são mais equilibrados. A questão importante, portanto, não é qual modelo vence uma tabela, mas qual combinação de modelo e arcabouço completa o workflow-alvo com precisão e economicidade.
