TLDR A equipe Qwen da Alibaba lançou oficialmente o Qwen3.8-Max em 3 de agosto de 2026 — um modelo esparso de Mistura de Especialistas (MoE) com 2,4 trilhões de parâmetros totais (95 bilhões ativos), uma janela de contexto de 1 milhão de tokens e suporte multimodal nativo (texto + imagem + vídeo).
É o primeiro modelo Qwen da classe Max programado para ter pesos abertos (previstos para a semana seguinte). Com preço agressivo de $2 por milhão de tokens de entrada e $6 por milhão de tokens de saída, oferece resultados fortes em tarefas agentivas de longo horizonte, engenharia de software autônoma (incluindo um projeto documentado de codificação autoevolutiva de 16 dias), reprodução de pesquisas e benchmarks multimodais. Compete de perto com modelos como o Kimi K3 e posiciona-se acima de opções mais leves como o DeepSeek V4 Flash em capacidade, permanecendo muito mais econômico que os principais modelos de ponta ocidentais em cargas de trabalho com grande volume de saída. Desenvolvedores podem acessá-lo hoje via QwenCloud / Alibaba Cloud Model Studio e por plataformas unificadas como a CometAPI.
Principais destaques
- Escala e eficiência: Arquitetura MoE de 2,4T totais / 95B ativos construída sobre os fundamentos do Qwen 3.5 permite desempenho de fronteira com custo de inferência prático.
- Força em longos horizontes: Demonstra codificação autônoma de múltiplos dias (265 commits, 127 PRs ao longo de ~16 dias sem intervenção humana), reprodução + melhoria de artigos de pesquisa e operações de e-commerce simuladas por um ano.
- Destaques de benchmark: PaperBench 93.0 (líder), Terminal Bench 2.1 86.6, pontuações fortes em multimodal e documentos; competitivo, mas não dominante, em todos os placares de agentes puramente de codificação frente a Claude Fable 5 ou GPT-5.6 Sol.
- Vantagem de preço: Taxa fixa de $2 / $6 por 1M de tokens em toda a janela de 1M (entrada em cache ~$0.25), abaixo do Kimi K3 na saída e de muitos modelos ocidentais.
- Disponibilidade: No ar no QwenCloud e Alibaba Cloud Model Studio (APIs compatíveis com OpenAI e Anthropic); pesos abertos planejados; já listado na CometAPI como
qwen3.8-maxpara acesso unificado junto com 500+ outros modelos. Pesos abertos chegando em breve; variante menor Qwen3.8-27B também planejada para implantação prática local/de borda. - Vantagem prática: Sobressai na produção de entregáveis fim a fim em vez de respostas de uma única rodada — ideal para agentes de codificação, pipelines de pesquisa, fluxos de trabalho de escritório e loops de agentes sustentados.
O que é o Qwen3.8-Max?
Qwen3.8-Max é o mais recente e mais capaz modelo carro-chefe da série Qwen da Alibaba, lançado oficialmente em 3 de agosto de 2026 (após um preview em meados de julho na World AI Conference em Xangai). Representa uma mudança deliberada rumo a modelos que conseguem concluir tarefas complexas, de múltiplos dias, de ponta a ponta com supervisão mínima e produzir entregáveis prontos para produção.
Arquiteturalmente, é um modelo esparso de Mistura de Especialistas (MoE) escalando para 2,4 trilhões de parâmetros totais, dos quais aproximadamente 95 bilhões são ativados por token. Esse design, construído sobre a base do Qwen 3.5, equilibra enorme capacidade com eficiência de inferência. O modelo suporta uma janela de contexto de 1 milhão de tokens (máximo de entrada documentado em torno de 991K tokens e máximo de saída em torno de 131K tokens), entradas multimodais nativas (texto, imagens e vídeo) e saída em texto. Inclui controles de esforço de raciocínio (xhigh / medium / low) e suporta protocolos compatíveis tanto com OpenAI Chat Completions quanto com Anthropic, tornando-o compatível como substituição direta com frameworks de agentes populares como Claude Code, Codex, Qoder CLI, Qwen Code e OpenClaw.
Diferente de modelos anteriores da classe Max que permaneceram fechados, a Alibaba se comprometeu a liberar os pesos do Qwen3.8-Max (e de uma variante menor Qwen3.8-27B) na semana após o lançamento via Hugging Face e ModelScope — a primeira vez que um modelo Qwen de nível Max ficará abertamente disponível.
O modelo é direcionado a agentes de codificação, trabalho profissional no mundo real (“cowork”), pesquisa, planejamento de longo horizonte e loops de agentes multimodais. Demos oficiais enfatizam comportamento autoevolutivo: o modelo cria issues, as atribui a si mesmo, escreve e testa código, itera com base no feedback e melhora suas próprias ferramentas ao longo de períodos prolongados.
Fontes: Blog oficial da Qwen e anúncios da Alibaba Cloud (agosto de 2026); ficha de modelo da Artificial Analysis; reviews independentes resumindo o GA.
O que há de novo no Qwen3.8-Max?
Em comparação com seu predecessor Qwen3.7-Max, a geração 3.8 traz ganhos substanciais em codificação agentiva, confiabilidade em longos horizontes, raciocínio multimodal e desempenho em documentos/escritório. Inovações-chave incluem:
Autonomia real de longo horizonte:
O modelo consegue sustentar aprendizado adaptativo em loop fechado por centenas de turnos ou múltiplos dias. Exemplos documentados incluem um projeto de engenharia de software autônoma de 16 dias que produziu uma ferramenta de CLI autoevolutiva (oh-my-cli) com 265 commits, 127 pull requests e 151 issues inteiramente sem intervenção humana; reprodução e aprimoramento da metodologia de um artigo de pesquisa (incluindo loops de treinamento em GPU e ganhos mensuráveis de benchmark); e um ano inteiro simulado de operações de e-commerce que superou significativamente as linhas de base.
Multimodal como um loop contínuo de feedback:
Visão não é apenas um modal de entrada. O modelo usa compreensão visual para planejamento, monitoramento de execução e autocorreção — permitindo tarefas como recriação de captura de tela para código, geração interativa de jogos/animações e visualização de 2D para 3D.
O modelo ocupa posições altas na Text Arena (quinta reportada) e na Vision Arena (segunda reportada) em dados iniciais pós-lançamento.


Foco em entregáveis de ponta a ponta:
Ênfase em produzir resultados com qualidade de produção em centenas de profissões, em vez de respostas isoladas.
Modos Thinking e de Inferência Rápida
Dois modos: modo de thinking e modo de inferência rápida. O modo de thinking é para raciocínio mais profundo e planejamento complexo. O modo rápido é para respostas com menor latência quando a tarefa é simples. OpenCode da Alibaba Cloud mostra thinking habilitado para as rotas do Qwen3.8 e lista controles de raciocínio para a rota de preview, incluindo xhigh, medium e low.
Essa divisão é valiosa para design de produto. As equipes não devem usar o modo de raciocínio mais pesado para cada solicitação. Um bot de suporte pode classificar um ticket simples de forma econômica, resumir com um modelo mais rápido e escalar para o modo de thinking do Qwen3.8-Max apenas quando o usuário pedir uma decisão de política complicada, análise de causa raiz, revisão de contrato ou plano de migração de código.
Essas capacidades foram validadas por meio de experimentos internos de longa duração e um conjunto abrangente de benchmarks cobrindo agentes de codificação, agentes gerais, raciocínio multimodal, compreensão de documentos e tarefas de percepção/grounding.
Benchmarking: desempenho em quantização de dados
A Alibaba publicou um extenso conjunto de benchmarks internos no GA. A verificação independente (Artificial Analysis Intelligence Index, LMArena, etc.) ainda estava em progresso nos dias imediatamente após o lançamento; dados iniciais da Artificial Analysis colocaram o Qwen3.8-Max em um Intelligence Index de 53 (posição ~16/186 no conjunto acompanhado), com observada alta verbosidade e velocidade relativamente menor.
Pontuações oficiais/reportadas selecionadas (Qwen3.8-Max vs pares selecionados):
| Benchmark | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
O Qwen3.8-Max frequentemente lidera ou fica próximo ao topo em raciocínio multimodal, tarefas de documentos/escritório e certos métricas de agentes de codificação/pesquisa, enquanto fica atrás dos modelos fechados mais fortes em alguns conjuntos de agentes puramente de engenharia de software. O salto geracional no FrontierSWE e no DeepSWE é especialmente notável. Trate os números do fornecedor como direcionais; execuções independentes e avaliação específica à carga de trabalho permanecem essenciais.
Preços de API do Qwen3.8-Max
Preços oficiais do Alibaba Cloud Model Studio / QwenCloud para o Qwen3.8-Max (valores GA no início de agosto de 2026):
- Entrada: $2.00 por 1 milhão de tokens
- Saída: $6.00 por 1 milhão de tokens (inclui tokens de thinking/raciocínio)
- Entrada em cache: aproximadamente $0.25 por 1 milhão de tokens (economia significativa para contextos longos repetidos)
A precificação é plana em toda a janela de 1M de tokens — uma vantagem notável frente a muitos concorrentes que aplicam sobretaxas para contextos longos. Descontos por lote e outros podem se aplicar dependendo da região de implantação e do plano.
Contexto de comparação (preços de tabela aproximados no mesmo período):
- Kimi K3: ~$3 / $15
- Modelos de fronteira Claude / GPT de nível superior: frequentemente $5+ / $15–25+
- Variantes do DeepSeek V4 Flash: substancialmente mais baixas (frequentemente abaixo de $0.50 combinados para muitos casos)
Para equipes que já usam múltiplos provedores, gateways agregadores como a CometAPI normalmente oferecem ~20% de desconto em relação às taxas oficiais, um endpoint compatível com OpenAI, faturamento unificado e fácil troca de modelo ou failover. Isso torna a experimentação com o Qwen3.8-Max (e comparação simultânea com o DeepSeek V4 Flash, Kimi models ou outros) operacionalmente mais simples e frequentemente mais barata. Verifique as páginas de preços atuais da CometAPI e ofertas de créditos gratuitos para as taxas efetivas mais recentes.
Como o Qwen3.8-Max compara com Kimi K3 e DeepSeek V4 Flash
| Dimensão | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| Parâmetros total / ativos | 2.4T / ~95B | ~2.8T / ~104B | 284B / 13B |
| Contexto | 1M | 1M | 1M |
| Multimodal | Texto + Imagem + Vídeo | Texto + Imagem + Vídeo | Somente texto |
| Preço (entrada/saída) | $2 / $6 | $3 / $15 | ~$0.14 / $0.28 (muito mais barato) |
| Pesos abertos | Planejados (próxima semana) | Já liberados | MIT, disponíveis |
| Pontos fortes | Autonomia de longo horizonte, multimodal, PaperBench, preço na saída | Pontuações independentes fortes, liderança em frontend coding Arena | Excelente relação custo-benefício; capacidade absoluta menor |
| Posição relativa | Competitivo / líder em vários benchmarks de agente e multimodal | Leve vantagem em alguns índices de inteligência auditados | Excelente valor; menor capacidade absoluta |
O Qwen3.8-Max geralmente iguala ou supera o Kimi K3 em relação custo-capacidade para trabalhos intensivos em saída e tarefas multimodais, enquanto o DeepSeek V4 Flash continua sendo o rei do orçamento para cargas de trabalho de texto em alto volume onde a capacidade máxima é secundária. Muitas equipes usarão os três via um gateway unificado, roteando tráfego simples para modelos da classe Flash e sessões de agentes complexas para o Qwen3.8-Max ou Kimi K3.
O Qwen3.8-Max iguala o Kimi K3?
Em alguns aspectos, sim. Igual a faixa de 1M de contexto, tem posicionamento multimodal forte e é mais barato na precificação oficial de entrada/saída. Não iguala a contagem total de parâmetros de 2,8T do Kimi K3, e a documentação pública do Kimi atualmente fornece orientações especialmente detalhadas sobre ferramentas, cache de contexto, saída estruturada e visão.
O Qwen3.8-Max iguala o DeepSeek V4 Flash?
Compete em contexto de 1M e arquitetura MoE, mas os produtos se destinam a trabalhos diferentes. O DeepSeek V4 Flash é a rota econômica e rápida. O Qwen3.8-Max é a rota maior e de alta capacidade para trabalhos onde compreensão multimodal, raciocínio avançado e produtividade empresarial importam mais do que o menor preço por token.
O que o Qwen3.8-Max pode fazer?
Codificação e Engenharia de Software
O Qwen3.8-Max é um forte candidato para desenvolvimento full-stack, revisão de código, compreensão de repositórios, planejamento de migração, design de APIs, depuração, raciocínio de testes e arquitetura de software. Seu longo contexto ajuda quando o modelo precisa manter muitos arquivos, logs e requisitos à vista. Use-o para tarefas difíceis de código, não para cada autocompletar ou explicação simples de lint.
Escritório e Trabalho do Conhecimento
O posicionamento "Cowork" do modelo importa. Funcionários de empresas não fazem apenas perguntas em chat. Eles comparam PDFs, resumem reuniões, revisam slides, interpretam planilhas, verificam contratos, escrevem relatórios e preparam decisões a partir de evidências desestruturadas. O design multimodal e de longo contexto do Qwen3.8-Max o torna adequado para fluxos de trabalho de escritório em que texto, documentos, capturas de tela e dados estruturados precisam ser raciocinados em conjunto.
Fluxos de Trabalho Agentivos
O Qwen3.8-Max é útil para planejamento de agentes: dividir uma meta em etapas, decidir qual ferramenta chamar, avaliar resultados e revisar o plano. Na CometAPI, isso se torna mais prático porque o mesmo aplicativo pode rotear etapas simples a modelos mais baratos e reservar o Qwen3.8-Max para planejamento ou verificação.
Primeiros passos e dicas de integração com a CometAPI
- Acesso direto: Use QwenCloud ou Alibaba Cloud Model Studio com o ID de modelo
qwen3.8-max. São suportados endpoints compatíveis com OpenAI e Anthropic. - Acesso unificado via CometAPI: Cadastre-se em CometAPI.com, obtenha uma chave de API, defina
base_urlparahttps://api.cometapi.com/v1e chamemodel="qwen3.8-max". A mesma chave funciona para DeepSeek V4 Flash, Kimi K3, Claude, GPT e centenas de outros modelos — ideal para experimentação, controle de custos e roteamento em produção. A CometAPI enfatiza preços competitivos, baixa latência e adição rápida de novos modelos (o Qwen3.8-Max foi listado pouco após o lançamento). - Frameworks de agentes: Conecte diretamente ao Claude Code, OpenClaw ou harnesses customizados. Habilite maior esforço de raciocínio para trabalhos complexos de longo horizonte.
- Pesos abertos: Monitore o Hugging Face / ModelScope para o lançamento iminente, caso você precise de implantações on-premise ou ajustadas (fine-tuned).
