GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →

Blog Qwen3

Como implantar o Qwen 3.8 Max localmente: guia de hardware, vLLM, SGLang e quantização
Sep 25, 2026
qwen 3.8 Max
qwen3.8 max

Como implantar o Qwen 3.8 Max localmente: guia de hardware, vLLM, SGLang e quantização

Como implantar localmente o Qwen 3.8 Max com os pesos abertos Qwen3.8-2.4T-A95B, requisitos de GPU, FP8/FP4, vLLM, SGLang, contexto de 1M e otimização para produção.

Preços da API Qwen 3.8 Max: $2 entrada, $6 saída, 1M de contexto
Sep 3, 2026
qwen 3.8 Max

Preços da API Qwen 3.8 Max: $2 entrada, $6 saída, 1M de contexto

- Preço base do Qwen 3.8 Max - Entrada: $2 por 1M tokens ($0,002 por 1k). - Saída: $6 por 1M tokens ($0,006 por 1k). - Cache: como pensar custos e economias - Tipos comuns: - Cache do provedor (prompt/prefix caching): reutiliza prefixos/trechos estáticos do prompt/histórico. - Cache no cliente/aplicação: deduplicação de prompts, memoização de respostas, RAG com store de embeddings. - Cobrança (varia por provedor; confirme na documentação do Qwen/DashScope): - Em geral no mercado, gravação do cache é cobrada à tarifa normal de entrada; leituras podem ser cobradas entre 0% e ~25% da tarifa de entrada. Trate os números abaixo como exemplo hipotético para planejamento. - Boas práticas para maximizar economia: - Separar prefixos estáveis (instruções, guias de estilo, schema de funções) do conteúdo variável. - Versionar prompts e configurar TTL de cache para evitar invalidações acidentais. - Manter prefixos concisos; comprimir descrições longas; evitar JSON/schema verboso. - Em RAG, use cache de resultados de retrieval e de respostas para perguntas repetidas. - Exemplo de cálculo (hipotético): - Prefixo estático: 800 tokens; parte variável por chamada: 200 tokens; saída média: 200 tokens; 1.000 chamadas. - Sem cache: por chamada = 1.000 in ($0,002) + 200 out ($0,0012) = $0,0032; 1.000 chamadas = $3,20. - Com cache do provedor (leitura a 25% do preço de entrada): - 1ª chamada (gravação do cache): 800 in ($0,0016) + 200 in ($0,0004) + 200 out ($0,0012) = $0,0032. - Demais 999 chamadas: leitura cache 800 in a 25% ($0,0004) + 200 in ($0,0004) + 200 out ($0,0012) = $0,002 cada → ~$1,998. - Total ≈ $2,00 (economia ~37,5%). Ajuste conforme a política real de cache. - Ferramentas (function calling, tool use) e custos - Em geral, não há tarifa separada por “ativar” ferramentas; o custo vem dos tokens adicionais: - Schema/descrição de função enviado ao modelo (entrada). - Mensagens de chamada de função geradas (saída). - Respostas das ferramentas devolvidas ao modelo (entrada). - APIs externas (busca, bancos, scraping, execução de código) têm cobrança própria fora do modelo. - Otimização de custo: - Mantenha schemas compactos (nomes curtos, descrições objetivas). - Evite listar enumerações longas no prompt; valide no runtime. - Trunque/compacte payloads de retorno das ferramentas antes de reenviá-los ao modelo. - Exemplo de sobrecarga de tokens: - Schema + retorno de tool adicionam 2.000 tokens de entrada → 2.000 × $0,002/1k = $0,004. - Mensagem de chamada de função com 120 tokens de saída → 120 × $0,006/1k ≈ $0,00072. - Total extra ≈ $0,00472 nessa rodada. - Exemplos numéricos de custo (com as tarifas fornecidas) - Chat curto: 700 in + 300 out → 0,7k×$0,002 + 0,3k×$0,006 = $0,0014 + $0,0018 = $0,0032 por chamada. - RAG moderado: 4.000 in + 800 out → 4k×$0,002 + 0,8k×$0,006 = $0,008 + $0,0048 = $0,0128 por chamada. - Batch com alto reaproveitamento (hipotético, como no cenário de cache acima): 1.000 chamadas idênticas → sem cache ~$3,20; com cache (25% leitura) ≈ $2,00. - Limites: pontos a verificar e como contornar - Janela de contexto (máx. tokens por requisição): verifique o limite do Qwen 3.8 Max; ajuste truncamento e sumarização de histórico. - Máx. de tokens de saída: defina max_output_tokens para controlar custo e evitar cortes abruptos. - Rate limits (RPM/TPM) e concorrência: projete filas/backoff; use lote e streaming quando fizer sentido. - Tamanhos de payload e anexos multimodais: entradas de imagem/áudio podem ter regras/pricing próprios; valide antes de enviar grandes anexos ao modelo. - Comprimento de ferramentas (schema/retornos): pode “estourar” contexto; normalize e compacte. - Práticas de mitigação: - Janela deslizante do chat com sumarização. - RAG com top_k enxuto e respostas citadas. - Checagens de comprimento no cliente e abort/continue automático. - Migração do Qwen 3.7 para 3.8: guia rápido - Compatibilidade de API/SDK: - Atualize nomes de modelo/endpoints e versões do SDK; verifique mudanças em parâmetros (p. ex., temperature, top_p, max_tokens). - Confirme diferenças de tokenizer e contagem de tokens (impacta custo e limites). - Comportamento de geração: - Avalie aderência a JSON/“modo estruturado” e tool calling (formato dos argumentos, escaping). - Revise prompts de sistema; modelos mais novos podem interpretar instruções com nuances diferentes. - Ajuste temperaturas/penalidades para manter estilo e variação esperados. - Ferramentas e agentes: - Revalide schemas de função (tipos, campos obrigatórios, limites de tamanho). - Teste mensagens de tool result longas; imponha truncamentos. - Segurança e filtros: - Compare saídas em categorias sensíveis; atualize políticas/“guardrails” conforme necessário. - Desempenho e custo: - Reexecute benchmarks com seus dados: latência, tokens médios in/out, taxa de erro de ferramenta. - Monitore custos por rota; verifique se 3.8 mantém ou reduz tokens gerados vs 3.7. - Confiabilidade e rollout: - Testes de regressão com seeds/templatização para comparabilidade. - Canary release + shadow traffic; fallback automático para 3.7 em casos críticos. - Observabilidade: registre prompts/saídas (com redação), contadores de tokens e motivos de erro. - Checklist final: - Troca do nome do modelo aplicada. - Limites ajustados (contexto, max_output_tokens). - Prompts e schemas revisados/compactados. - Alertas de custo e de latência configurados. - Plano de rollback validado. Observação - Para cache e limites específicos do Qwen 3.8 Max, consulte a documentação oficial do provedor que você usa (p. ex., DashScope/Alibaba Cloud), pois políticas de cache, janelas de contexto e rate limits podem variar por região/versão.

Como usar a API do Qwen 3.5
Sep 3, 2026
Qwen 3.5

Como usar a API do Qwen 3.5

Na véspera do Ano-Novo Lunar (16–17 de fevereiro de 2026), o Alibaba Group lançou seu modelo de próxima geração, o Qwen 3.5 — um modelo multimodal, com capacidades de agente, posicionado para o que a empresa chama de "agentic AI". A cobertura do setor destacou alegações de grandes ganhos em eficiência e custo, e suporte rápido de fornecedores de hardware e nuvem. O CometAPI é uma opção para desenvolvedores que desejam acesso hospedado à API ou uma integração compatível com a OpenAI, enquanto a AMD anunciou suporte de GPU no Day-0 para o modelo em sua linha Instinct. A ByteDance é um dos principais concorrentes domésticos que lançou atualizações no mesmo período de feriado. A OpenAI continua sendo um ponto de referência para comparação em benchmarks e no estilo de integração.

Qwen-3.5 no Ano Novo Lunar — supera a elite de código fechado em 2026?
Sep 3, 2026
Qwen 3.5

Qwen-3.5 no Ano Novo Lunar — supera a elite de código fechado em 2026?

O novo Qwen3.5 da Alibaba é um grande avanço — reduz a lacuna em relação a, e em algumas cargas de trabalho orientadas a agentes / multimodais afirma alcançar paridade ou vantagem sobre, certos modelos de ponta de código fechado em diversos benchmarks públicos e testes internos. No entanto, “superar” depende da carga de trabalho: no uso de ferramentas orientadas a agentes, na compreensão multimodal de documentos/vídeos e no custo por inferência, relata-se que o Qwen3.5 é extremamente competitivo (e, em alguns gráficos de fornecedores, está à frente). A conclusão prática: o Qwen3.5 parece ser um genuíno concorrente de ponta no início de 2026 — para muitos casos de uso empresariais orientados a agentes e multimodais, ele agora é viável como opção principal.

Como usar Qwen3-max thinking
Sep 3, 2026
qwen3-max

Como usar Qwen3-max thinking

A Qwen3-Max-Thinking da Alibaba — a variante “thinking” da vasta família Qwen3 — tornou-se uma das manchetes em IA este ano: um carro-chefe com mais de um trilhão de parâmetros, ajustado para raciocínio profundo, compreensão de contextos longos e fluxos de trabalho orientados a agentes. Em suma, é a iniciativa do fornecedor para oferecer às aplicações um modo de pensamento “System-2” mais lento e mais rastreável: o modelo não apenas responde; ele pode mostrar (e usar) etapas, ferramentas e verificações intermediárias de forma controlada.

Alibaba AI revela Qwen3-Max: modelo Qwen de trilhões de parâmetros, com suporte para CometAPI
Sep 3, 2026
qwen3-max

Alibaba AI revela Qwen3-Max: modelo Qwen de trilhões de parâmetros, com suporte para CometAPI

A equipe Qwen do Alibaba lançou o Qwen3-Max-Preview (Instruct) — o maior modelo da empresa até o momento, com mais de 1 trilhão de parâmetros — e o tornou

API de pré-visualização do Qwen3-Max
Sep 3, 2026
qwen3-max

API de pré-visualização do Qwen3-Max

Qwen3-Max-Preview é o mais recente modelo de pré-visualização da família Qwen3 do Alibaba — um modelo com mais de um trilhão de parâmetros, no estilo Mixture-of-Experts (MoE), com uma janela de contexto de token ultralonga de 262 mil, lançado em versão prévia para uso corporativo/nuvem. Ele visa raciocínio profundo, compreensão de documentos longos, codificação e fluxos de trabalho agênticos.

Qwen3-Coder: Desempenho, Arquitetura e Acesso
Sep 3, 2026
Qwen3-Coder

Qwen3-Coder: Desempenho, Arquitetura e Acesso

O mais recente avanço da Alibaba em inteligência artificial, o Qwen3-Coder, representa um marco significativo no cenário em rápida evolução do software baseado em IA