Gemini 3.6 Flash and 3.5 Flash Lite are now live on CometAPI →

Qwen 3.7 Max: Com 2.4 trilhões de parâmetros, mais do que o Kimi K3?

CometAPI
AnnaJul 21, 2026
Qwen 3.7 Max: Com 2.4 trilhões de parâmetros, mais do que o Kimi K3?

TLDR: O Qwen3.8-Max da Alibaba (prévia, 2.4 trilhões de parâmetros, multimodal com entrada de imagem/vídeo/documento) enfrenta o Kimi K3 da Moonshot AI (2.8T parâmetros, pesos abertos em breve, contexto de 1M). O Qwen3.8-Max se destaca em tarefas multimodais e de produtividade, com preços de prévia em ~10% das tarifas padrão, enquanto o Kimi K3 lidera em alguns benchmarks abertos e em abertura bruta.

Ambos são modelos de ponta acessíveis hoje via APIs. Para integração confiável e econômica, a CometAPI oferece acesso perfeito ao Qwen com endpoints compatíveis com OpenAI, preços competitivos e fácil escalabilidade para desenvolvedores e empresas.

Principais pontos:

  • Escala e capacidades: Segundo o post no X, o Qwen3.8-Max traz multimodalidade nativa (imagens, vídeo, documentos) para um modelo com 2.4T parâmetros; o Qwen3.7-Max se destaca em programação orientada a agentes e tarefas de longo horizonte.
  • Preços e acesso: O Qwen3.8-Max tem tarifas de API competitivas (~$2.50/$7.50 por 1M entrada/saída, frequentemente com desconto); visualize o Qwen 3.8 a preços reduzidos via Token Plan/Qoder.
  • Vs. Kimi K3: O Kimi K3 (2.8T, pesos abertos em 27 de julho de 2026) frequentemente supera benchmarks, mas o Qwen oferece integração multimodal e de ecossistema mais forte; o Qwen é mais barato em muitos cenários de API.
  • Acesso hoje: Prévia no Alibaba Cloud/Token Plan/Qoder com tarifas descontadas; compatível com APIs OpenAI/Anthropic.
  • Vantagens práticas: Superior para desenvolvimento full-stack, automação de escritório, análise de vídeo e fluxos de trabalho com agentes.

O que é o Qwen 3.8 Max?

O Qwen 3.8 Max, oficialmente apresentado como Qwen3.8-Max-Preview, é o mais recente modelo de linguagem grande (LLM) de ponta da equipe Qwen da Alibaba. Anunciado na World AI Conference em Xangai por volta de 19 de julho de 2026, representa um salto massivo em escala em relação à série Qwen 3.7.

Especificações principais

  • Parâmetros: 2.4 trilhões no total — tornando-o um dos maiores modelos discutidos publicamente, perdendo apenas para o Kimi K3 da Moonshot AI com ~2.8T.
  • Arquitetura: Sparse Mixture-of-Experts (MoE). Apenas um subconjunto de parâmetros é ativado por token, equilibrando potência e eficiência (a contagem exata de parâmetros ativos ainda não foi divulgada — um detalhe-chave para custos de inferência).
  • Capacidades multimodais: Processa texto, imagens, vídeos e documentos de forma nativa. Este é o primeiro modelo do Qwen a exceder 1 trilhão de parâmetros com suporte multimodal robusto.
  • Janela de contexto: Até 1 milhão de tokens, herdada e refinada a partir do Qwen 3.7 Max.
  • Variantes: Flagship de 2.4T Max mais uma variante menor de ~27B para casos de uso mais leves.

Como o Qwen 3.8 Max funciona: inovações e vantagem técnica

O Qwen3.8-Max aproveita décadas de expertise em escala da Alibaba:

  1. Escala maciça com eficiência: 2.4T parâmetros via MoE — apenas um subconjunto é ativado por token, equilibrando potência e custo de inferência (semelhante a MoEs anteriores do Qwen como 235B-A22B).
  2. Raciocínio híbrido: Herda modos “Thinking/Non-Thinking” para controle flexível sobre profundidade, velocidade e custo. Perfeito para tarefas orientadas a agentes que exigem planejamento em múltiplas etapas.
  3. Integração multimodal: Processamento unificado de texto + visão + vídeo. Possibilita apps mais ricos como análise de documentos com imagens ou raciocínio baseado em vídeo.
  4. Foco em longo contexto e agentes: Otimizado para tarefas de longo horizonte (por exemplo, clonagem de apps completos, fluxos complexos). Suporta uso avançado de ferramentas, RAG e chamadas de função.
  5. Avanços de treinamento: Construído sobre vastos dados multilíngues (119+ idiomas), embeddings posicionais aprimorados e técnicas que reduzem alucinações enquanto impulsionam STEM/codificação.

Como funciona na prática:

  • Entrada → Tokenizer + embeddings → o roteador MoE seleciona especialistas → camadas Transformer processam → geração de saída.
  • Suporta codificação orientada a agentes (por exemplo, projetos full-stack), pipelines de análise de dados e automação de escritório.

Testes da comunidade no Reddit mostram poder bruto promissor em codificação e consultas complexas, embora alguns apontem loops de “pensamento” ocasionais na prévia inicial.

Para desenvolvedores: Combine com ferramentas como a CometAPI para acesso unificado e confiável entre provedores, reduzindo latência e custos enquanto testa o Qwen ao lado de Claude, GPT etc.

Preços e acesso: o que você pode realmente usar hoje

Disponibilidade da prévia (em julho de 2026):

  • Alibaba Token Plan: Assinatura baseada em créditos.
    • Lite: $6 por 2,500 créditos/semana.
    • Pro: $68 por 40,000 créditos/semana (suporta 6-8 agentes simultâneos).
  • Desconto: 10% dos preços padrão durante a prévia.
  • Plataformas: Qwen Chat, Alibaba Cloud, Qoder (codificação), QoderWork (produtividade).
  • API: Compatível com OpenAI/Anthropic. Ainda sem tarifas por token publicadas para o 3.8-Max (antecessor: ~$1.25/M entrada, $3.75/M saída).

Pesos abertos: Prometidos “em breve” — enorme para self-hosting/afinação, embora as exigências de hardware sejam extremas (~1.2TB em 4 bits).

Recomendação CometAPI: Para produção, evite gerenciar fornecedores diretamente. A CometAPI fornece uma única chave de API para 500+ modelos, incluindo a série Qwen. Faturamento, endpoints e confiabilidade unificados — ideal para A/B testar o Qwen 3.8 Max versus outros sem reescrever código. Perfeito para usuários da Cometapi.com que estão criando apps de IA. Cadastre-se em cometapi.com para integração perfeita.

Isso torna o Qwen acessível sem compromisso com o Alibaba Cloud, excelente para startups e desenvolvedores globais.

O Qwen3.8 Max supera o Kimi K3?

Em contagem de parâmetros: não

Se a pergunta é “o Qwen3.8 Max tem mais parâmetros que o Kimi K3?”, a resposta é direta: não. O Qwen3.8-Max-Preview é reportado pelo Qoder como um modelo de 2.4T parâmetros. O Kimi K3 é documentado pela Moonshot como um modelo de 2.8T parâmetros. Somente em parâmetros totais, o Kimi K3 é maior por 400 bilhões de parâmetros.

Isso não torna automaticamente o Kimi K3 melhor em toda tarefa. A contagem de parâmetros não é um placar por si só. Dados de treinamento, arquitetura, roteamento de especialistas, parâmetros ativos por token, pós-treinamento, pilha de inferência, integrações de ferramentas e gerenciamento de contexto influenciam o desempenho real. Um modelo menor pode superar um maior em algumas tarefas se tiver melhores dados, melhor pós-treinamento, melhores ferramentas ou melhor raciocínio em tempo de inferência.

Em evidências públicas: Kimi K3 está à frente agora

O Kimi K3 atualmente tem o melhor pacote de evidências públicas. O guia e o blog técnico do Kimi K3 da Moonshot divulgam arquitetura, contexto, visão, ativação de especialistas, limites de API e planos de lançamento. A página do Kimi K3 da OpenLM espelha uma tabela detalhada de benchmarks em codificação, trabalho com agentes, raciocínio, trabalho de conhecimento e visão. O resultado do Kimi K3 no Frontend Code Arena de 1,679 pontos e o resumo do modelo com contexto de 1M, ativação de especialistas 16/896 e sinais de preço.

O Qwen3.8-Max-Preview é muito importante, mas a prévia é menos documentada. As fontes mais fortes atuais são a página de lançamento do Qoder e a configuração OpenCode do Alibaba Cloud Model Studio. São valiosas, mas ainda não oferecem o mesmo nível de detalhes de benchmarks, divulgação de parâmetros ativos, explicação de arquitetura, termos de licença ou detalhes de rota de produção via CometAPI que o Kimi K3 possui.

AspectoQwen3.8-Max (Prévia)Qwen3.7-MaxKimi K3 (Moonshot)
Parâmetros2.4T~1T+ (anterior)2.8T
MultimodalSim (img/vídeo/docs)Limitado/Foco em textoSim (visão nativa/3D)
Janela de contextoGrande (multimodal)262K+1M tokens
Pontos fortesAgentes, codificação, produtividade, multimodalAgentes de longo horizonte, raciocínioPesos abertos, arenas de codificação, raciocínio
Benchmarks (Exemplos)Forte no KingBench (~2º), topo internoGPQA 92.4, SWE-Pro 60.6Lidera muitos (Frontend Arena), competitivo no geral
Preços (API aprox.)Prévia ~10% do padrãoCompetitivo (~$1-5/M combinado)$3 entrada / $15 saída por 1M
AcessoPrévia Alibaba + CometAPIAlibaba + CometAPIAPI agora, pesos abertos em breve
Melhor paraFluxos multimodais corporativosEstruturas de agentes, devSelf-host, customização

Diferenças principais:

  • Abertura: Kimi K3 vence com pesos totalmente abertos iminentes para self-hosting/afinação. Qwen3.8-Max em prévia agora, aberto em breve.
  • Multimodal: Ambos fortes; o Qwen3.8 enfatiza integração de vídeo/documentos.
  • Desempenho: Kimi K3 frequentemente lidera benchmarks brutos (por exemplo, GPQA, arenas de codificação); Qwen competitivo ou superior em estruturas de produtividade/agents e tarefas específicas como planilhas/otimização de kernel. Qwen mais barato no uso de API (por exemplo, 3x em algumas comparações).
  • Contexto e velocidade: Kimi com 1M de contexto; Qwen com longo contexto forte (262K+ anteriormente). Qwen frequentemente mais rápido na saída.
  • Casos de uso: Qwen para ecossistema integrado da Alibaba, automação de escritório, multimodal corporativo. Kimi para entusiastas de open-source e máxima customização.

Conclusão: Você deve adotar o Qwen 3.8 Max?

Sim para experimentação e necessidades de codificação/multimodal — especialmente via plataformas acessíveis como a CometAPI. Ainda não é um substituto completo para fronteiras fechadas, mas é uma opção poderosa e acessível que impulsiona o ecossistema. Acompanhe os benchmarks e o lançamento completo.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais