GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/Pesquisa CometAPI

O que é o Qwen3.8-Omni-Flash e como acessar?

Saiba o que é o Qwen3.8-Omni-Flash, incluindo seus agentes de áudio e vídeo, arquitetura, benchmarks, preços, limitações e acesso à API.

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 21, 2026 13 min de leitura
O que é o Qwen3.8-Omni-Flash e como acessar?
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Resumo

Qwen3.8-Omni-Flash é o modelo onimodal nativo da Qwen (Alibaba) para compreensão de texto, imagem, áudio e vídeo, tendo texto como modalidade de saída. Anunciado em 18 de setembro de 2026, combina uma janela de contexto de 1M tokens, raciocínio nativo sobre áudio e vídeo, raciocínio ajustável, chamadas de função, pesquisa na web, compreensão de áudio espacial e uso de ferramentas.

A mudança mais importante não é apenas melhor compreensão de vídeo. A Qwen descreve o modelo como seu primeiro modelo onimodal construído em torno de capacidades agênticas: ele entende o que vê e ouve, planeja o que fazer em seguida, invoca ferramentas e executa tarefas mais longas, como edição de vlogs, tradução de vídeos, produção de resumos de filmes, análise de reuniões e pesquisa multimídia.

No lançamento, a Qwen reportou uma melhora média de mais de 25% em 29 avaliações em comparação ao Qwen3.5-Omni-Plus. São resultados reportados pelo fornecedor no lançamento, e não avaliações independentes.

Principais pontos

  • Entrada onimodal nativa: Qwen3.8-Omni-Flash aceita texto, imagem, áudio e vídeo, retornando atualmente texto.
  • Workflows de mídia agênticos: combina compreensão de mídia com planejamento, chamadas de função e pesquisa na web.
  • Contexto longo e profundidade de áudio: o modelo hospedado oferece janela de contexto de 1M tokens e suporta áudio multilíngue, estéreo e ambisônico de primeira ordem.
  • Ganhos de benchmark reportados pelo fornecedor: as maiores melhorias aparecem em agentes multimodais, compreensão de áudio longo, diarização de falantes e grounding de áudio.
  • Disponibilidade hospedada: o modelo está disponível por APIs hospedadas; Qwen-MM-Plugins é open source separadamente para workflows de agentes multimodais.

Desenvolvedores podem acessar a API Qwen3.8-Omni-Flash na CometAPI por meio de um fluxo de API unificado.

O que é o Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash é a próxima geração de modelo onimodal nativo da Qwen. Em vez de tratar áudio ou vídeo apenas como artefatos de pré-processamento, ele raciocina sobre texto, quadros visuais, fala, som ambiente e relações temporais dentro de um único workflow. Suas entradas suportadas são texto, imagens, áudio e vídeo; sua saída atual é texto.

Essa distinção de saída importa. A documentação oficial da Alibaba Cloud posiciona o Qwen3.8-Omni-Flash para compreensão multimodal e execução agêntica, enquanto casos de uso com saída de fala continuam melhor atendidos por variantes Omni que suportam geração de áudio.

O enquadramento do lançamento desloca-se de “perceber a mídia” para “entender, planejar, executar e entregar”. Isso torna o modelo relevante para edição de vídeo, pesquisa multimídia, análise de reuniões, processamento de vídeos instrucionais e outros workflows em que o modelo precisa fazer algo com a mídia, e não apenas resumi-la.

Especificações do Qwen3.8-Omni-Flash

A tabela de especificações abaixo baseia-se nas páginas oficiais da Alibaba Cloud e QwenCloud; limites e preços podem variar por região e devem ser verificados novamente antes de publicação ou implantação.

EspecificaçãoQwen3.8-Omni-Flash — página oficial do modelo
DesenvolvedorAlibaba Qwen
LançamentoSeptember 18, 2026
Tipo de modeloModelo onimodal nativo
Entrada / saídaTexto, imagem, áudio, vídeo / texto
Janela de contexto1,000,000 tokens
Entrada máxima991,808 tokens normal; 983,616 tokens em modo de raciocínio
Saída máxima131,072 tokens
Limite máximo de raciocínioAté 262K tokens no QwenCloud
RaciocínioAtivado por padrão; esforço de raciocínio configurável
Ferramentas e cacheChamadas de função, pesquisa na web, cache implícito e cache de sessão
Áudio113 idiomas e dialetos; estéreo e FOA de quatro canais
Estilos de APIChat Completions e Responses
Preço no QwenCloud$0.15 entrada, $0.47 saída e $0.016 entrada via cache implícito por 1M tokens
Pesos abertosNão anunciados para este modelo no lançamento

Como o Qwen3.8-Omni-Flash funciona?

O QwenCloud afirma que o Qwen3.8-Omni-Flash é construído sobre a arquitetura Qwen3.8-Flash-Next. Isso fornece contexto arquitetural, mas as contagens de parâmetros publicadas para o Flash-Next não devem ser automaticamente apresentadas como a especificação exata de parâmetros do modelo Omni, a menos que a Qwen confirme esse mapeamento.

Gated DeltaNet + Qwen Sparse Attention

A base do Flash-Next combina Gated DeltaNet com Qwen Sparse Attention. Em termos simplificados, o componente recorrente condensa a informação histórica em um estado compacto, enquanto a atenção esparsa recupera contexto de longo alcance selecionado em vez de aplicar atenção densa total a cada par de tokens. Isso é especialmente relevante para fluxos longos de áudio e vídeo, em que o comprimento da sequência pode dominar o custo computacional.

Percepção agêntica em vez de percepção estática

A mudança maior é no nível de sistema. A Qwen afirma que o modelo pode explorar ativamente vídeos longos e focar em momentos relevantes, em vez de gastar computação igualmente em cada segmento. Conceitualmente, o agente identifica onde é provável que estejam as evidências, inspeciona esses momentos com mais profundidade, raciocina sobre eles e então decide qual ferramenta ou operação deve ocorrer em seguida.

Quais são os principais recursos do Qwen3.8-Omni-Flash?

Raciocínio nativo sobre áudio e vídeo

Qwen3.8-Omni-Flash raciocina conjuntamente sobre os fluxos visual e de áudio de um vídeo. Isso é importante quando a resposta depende de ambas as modalidades: identificar quem disse algo, decidir se um som ocorreu antes ou depois de uma ação, interpretar música ou áudio ambiente, ou conectar instruções faladas ao que aparece na tela.

Compreensão de áudio espacial e de múltiplos falantes

A API suporta áudio multicanais, incluindo estéreo de dois canais e ambisônico de primeira ordem com quatro canais. Preservar a informação direcional pode ajudar em análise de reuniões, agentes incorporados, eventos gravados, ambientes com múltiplos falantes e grounding de áudio.

Esforço de raciocínio ajustável

O raciocínio vem ativado por padrão. Desenvolvedores podem configurar o esforço de raciocínio para equilibrar latência e consumo de tokens com um raciocínio mais profundo em tarefas multimídia complexas.

Chamadas de função e pesquisa na web

Chamadas de função e pesquisa na web são centrais para o posicionamento agêntico. Após entender um vídeo, imagem ou arquivo de áudio, o modelo pode passar argumentos estruturados para uma ferramenta externa, recuperar informações adicionais ou continuar um workflow fora do modelo.

Qwen-MM-Plugins

A Qwen também lançou o Qwen-MM-Plugins, um toolkit Apache-2.0 para harnesses nativos multimodais de agentes. Seus workflows incluem produção de vídeo, conversão de vídeo para notas, aprendizado de habilidades reutilizáveis a partir de vídeos de demonstração e memória audiovisual.

Quão bom é o Qwen3.8-Omni-Flash em benchmarks?

O Qwen3.8-Omni-Flash ainda é bom em texto e programação?

Os resultados de lançamento da Qwen indicam que o modelo Omni permanece próximo ao modelo de texto relacionado (Flash) em várias avaliações de programação e raciocínio. A Qwen reporta 92.6 no LiveCodeBench v6, 63.3 no SWE-bench Pro e 91.0 no GPQA Diamond. São resultados reportados pelo fornecedor sob a configuração de lançamento da Qwen e devem ser validados em relação às tarefas de programação e ao arcabouço de agente usados em produção.

A Qwen reporta mais de 25% de melhoria média em 29 avaliações em comparação com o Qwen3.5-Omni-Plus. As tabelas a seguir resumem os resultados oficiais de benchmark do lançamento. São resultados de primeira parte e ainda não haviam sido reproduzidos independentemente na publicação.

Condições de avaliação: Linhas estáticas medem uma única execução do modelo sob a configuração de lançamento da Qwen. Linhas rotuladas “+ agent” incluem um arcabouço de agente ao redor, recuperação (retrieval) ou inspeção iterativa de mídia. Os materiais oficiais de lançamento devem ser consultados para templates de prompt, configurações de amostragem, pré-processamento de mídia e versões do arcabouço; onde esses detalhes não são divulgados, o resultado deve ser tratado como reportado pelo fornecedor, e não como reprodutível independentemente.

O significado maior é a mudança de compreensão multimodal para execução multimodal. Pipelines anteriores frequentemente transcreviam áudio, amostravam quadros de vídeo, enviavam esses artefatos para um LLM, produziam uma resposta e então se apoiavam em lógica de aplicação separada para a tarefa real. O Qwen3.8-Omni-Flash foi projetado para condensar mais desse ciclo em um único sistema de agente.

Um agente de produção de mídia pode inspecionar as filmagens e o áudio antes de planejar edições. Um agente de reuniões pode combinar identidade do falante com conteúdo falado e visuais de apresentação. Um agente de pesquisa pode localizar momentos relevantes em horas de material audiovisual e então buscar contexto externo. Nesse enquadramento, áudio e vídeo tornam-se contexto de trabalho para um agente, e não anexos passivos.

Agentes de áudio e vídeo

Benchmark — fonte oficial do lançamentoQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71.034.558.9
UniClawBench69.667.169.0
AgenticVBench36.814.545.0
OmniGAIA74.078.6
StreamingBench80.857.179.9

O maior salto geracional é no WildClawBench-MM, onde a Qwen reporta uma subida de 34.5 para 71.0. O AgenticVBench também melhora acentuadamente, enquanto o Gemini 3.8 Flash permanece à frente nesse benchmark. O padrão, portanto, não é um resultado universal de “um único modelo vence tudo”.

Compreensão e raciocínio de áudio e vídeo

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63.453.865.2
OmniVideoBench + Qwen Code agent67.865.2
Video-MME-v265.071.0
Video-MME-v2 + agent71.371.0
LVOmniBench63.370.7
LVOmniBench + agent73.670.7
JointAVBench75.970.4

As linhas estáticas são mistas. O Gemini lidera vários testes convencionais de raciocínio em vídeo, mas o resultado da Qwen geralmente sobe dentro de um loop agêntico. Essa distinção só importa quando a aplicação em produção usa retrieval, ferramentas ou inspeção iterativa comparáveis.

Compreensão de áudio e de múltiplos falantes

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82.774.479.3
AliMeeting DER ↓3.488.172.6
AliMeeting cpWER ↓17.289.653.1
FLEURS-ASR WER ↓9.37.27.9
VoiceBench91.692.992.3

As linhas de reunião são o destaque, enquanto FLEURS-ASR e VoiceBench não melhoram sobre o predecessor. Os resultados do lançamento, portanto, apontam para uma compreensão mais rica de áudio de múltiplos falantes, espacial e de contexto longo, em vez de uma vitória uniforme em reconhecimento de fala.

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

A tabela combina informações oficiais de produto da Qwen com a especificação oficial do Gemini 3.8 Flash do Google. As comparações de benchmark continuam executadas pela Qwen e não devem ser tratadas como rankings neutros de terceiros.

DimensãoQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
ArquiteturaBase Qwen3.8-Flash-Next; mapeamento exato de parâmetros do Omni não divulgadoGeração Omni anterior da QwenArquitetura proprietária Gemini do Google
Janela de contexto1M tokensLimites de implantação menores1,048,576 tokens de entrada
RaciocínioEsforço de raciocínio ajustável; raciocínio ativado por padrãoSem modo de raciocínio “ativado por padrão” equivalente na implantação citadaNíveis de raciocínio baixo, médio e alto
Entrada multimodalTexto, imagem, áudio, vídeoTexto, imagem, áudio, vídeoTexto, imagem, vídeo, áudio e PDF
SaídaTextoTexto e fluxos de trabalho com saída de fala suportadosTexto
ProgramaçãoFortes pontuações de programação reportadas; não é seu principal diferencialNão é o principal posicionamentoProjetado para engenharia de software de longo horizonte e agentes
Disponibilidade da APIChat Completions e Responses; API hospedadaAPIs hospedadas da QwenGemini API; disponibilidade geral
FerramentasChamadas de função e pesquisa na webChamadas de função e pesquisa na webChamadas de função, grounding de busca, execução de código e outras ferramentas integradas
Preços de API publicadosQwenCloud: $0.15 entrada / $0.47 saída por 1M tokensDependente de região e endpointPreço introdutório do Google: $0.75 entrada / $3.75 saída por 1M tokens até 31 de dezembro de 2026
Melhor adequaçãoAgentes de mídia e análiseConversação Omni e saída de falaAmplos fluxos de trabalho multimodais, de programação e de agentes autônomos

Qwen3.5-Omni-Plus permanece relevante quando é necessária geração de fala. Qwen3.8-Omni-Flash está mais claramente otimizado para compreensão eficiente de áudio e vídeo, além de execução orientada a ferramentas.

Em comparação com o Gemini 3.8 Flash, a avaliação da Qwen é mista: Qwen3.8-Omni-Flash é competitivo em áudio, processamento de múltiplos falantes, grounding e vários workflows agênticos, enquanto o Gemini lidera alguns testes estáticos de raciocínio em vídeo. A comparação sensata é específica ao workload.

Desenvolvedores que avaliam acesso unificado podem comparar a API Gemini 3.8 Flash na CometAPI, API Qwen3.8-Flash na CometAPI e API Qwen3.8-Flash-Next na CometAPI fora da tabela, para que links de fonte técnica e de acesso ao produto permaneçam distintos.

Limitações do Qwen3.8-Omni-Flash

  • Saída apenas em texto: entende áudio e vídeo, mas não gera fala como modalidade de resposta.
  • Implantação hospedada: pesos abertos não foram anunciados para o Qwen3.8-Omni-Flash no lançamento.
  • Benchmarks recentes: as comparações de destaque são principalmente resultados de primeira parte e precisam de replicação independente.
  • Efeitos do arcabouço de agente: algumas pontuações incluem recuperação, ambientes de ferramentas ou inspeção iterativa e não devem ser confundidas com resultados de modelo bruto apenas.
  • Custo dependente do fluxo de trabalho: vídeos longos ainda podem se tornar caros se o aplicativo reprocessar repetidamente grandes segmentos em vez de usar retrieval, cache ou inspeção direcionada.

Quem deve usar o Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash é mais interessante quando áudio ou vídeo faz parte da própria tarefa, e não um anexo que precisa apenas ser resumido. Casos de uso adequados incluem inteligência de reuniões, busca em mídia de forma longa, pipelines de tradução de vídeo, workflows de tutoriais para notas, agentes de produção de mídia e acervos audiovisuais.

Para chat de texto convencional, um modelo Flash dedicado a texto pode continuar sendo mais simples. Para aplicações com saída de fala, um modelo Omni com geração de áudio explícita pode ser mais adequado. Para workflows que combinam ver, ouvir, raciocinar e agir, o Qwen3.8-Omni-Flash é a opção mais distintiva na linha da Qwen.

Conclusão

Qwen3.8-Omni-Flash deve ser entendido como um modelo agêntico de áudio e vídeo, não apenas mais um lançamento Flash multimodal. Sua janela de 1M de contexto, raciocínio nativo sobre áudio e vídeo, capacidades de múltiplos falantes e áudio espacial, raciocínio ajustável, chamadas de função, busca e ecossistema Qwen-MM-Plugins visam a mesma transição: permitir que um sistema de IA passe de entender multimídia para trabalhar com multimídia.

Os dados de lançamento indicam uma melhoria geracional substancial sobre o Qwen3.5-Omni-Plus, particularmente em workflows agênticos e cenários de áudio complexos. Em relação ao Gemini 3.8 Flash, os números da própria Qwen são mais equilibrados. A questão importante, portanto, não é qual modelo vence uma tabela, mas qual combinação de modelo e arcabouço completa o workflow-alvo com precisão e economicidade.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Sep 21, 2026
Última atualização Sep 21, 2026
3 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais