Wan3.0, GLM-5.3 Flash, and Qwen3.8 Flash are now live on CometAPI →

Blog Qwen

O que é Qwen3.8 Max?
Aug 30, 2026
qwen3.8 max

O que é Qwen3.8 Max?

Qwen3.8-Max explicado: recursos, benchmarks e comparação com Kimi K3 e DeepSeek V4 Flash

Preços da API Qwen 3.8 Max: $2 entrada, $6 saída, 1M de contexto
Aug 30, 2026
qwen 3.8 Max

Preços da API Qwen 3.8 Max: $2 entrada, $6 saída, 1M de contexto

- Preço base do Qwen 3.8 Max - Entrada: $2 por 1M tokens ($0,002 por 1k). - Saída: $6 por 1M tokens ($0,006 por 1k). - Cache: como pensar custos e economias - Tipos comuns: - Cache do provedor (prompt/prefix caching): reutiliza prefixos/trechos estáticos do prompt/histórico. - Cache no cliente/aplicação: deduplicação de prompts, memoização de respostas, RAG com store de embeddings. - Cobrança (varia por provedor; confirme na documentação do Qwen/DashScope): - Em geral no mercado, gravação do cache é cobrada à tarifa normal de entrada; leituras podem ser cobradas entre 0% e ~25% da tarifa de entrada. Trate os números abaixo como exemplo hipotético para planejamento. - Boas práticas para maximizar economia: - Separar prefixos estáveis (instruções, guias de estilo, schema de funções) do conteúdo variável. - Versionar prompts e configurar TTL de cache para evitar invalidações acidentais. - Manter prefixos concisos; comprimir descrições longas; evitar JSON/schema verboso. - Em RAG, use cache de resultados de retrieval e de respostas para perguntas repetidas. - Exemplo de cálculo (hipotético): - Prefixo estático: 800 tokens; parte variável por chamada: 200 tokens; saída média: 200 tokens; 1.000 chamadas. - Sem cache: por chamada = 1.000 in ($0,002) + 200 out ($0,0012) = $0,0032; 1.000 chamadas = $3,20. - Com cache do provedor (leitura a 25% do preço de entrada): - 1ª chamada (gravação do cache): 800 in ($0,0016) + 200 in ($0,0004) + 200 out ($0,0012) = $0,0032. - Demais 999 chamadas: leitura cache 800 in a 25% ($0,0004) + 200 in ($0,0004) + 200 out ($0,0012) = $0,002 cada → ~$1,998. - Total ≈ $2,00 (economia ~37,5%). Ajuste conforme a política real de cache. - Ferramentas (function calling, tool use) e custos - Em geral, não há tarifa separada por “ativar” ferramentas; o custo vem dos tokens adicionais: - Schema/descrição de função enviado ao modelo (entrada). - Mensagens de chamada de função geradas (saída). - Respostas das ferramentas devolvidas ao modelo (entrada). - APIs externas (busca, bancos, scraping, execução de código) têm cobrança própria fora do modelo. - Otimização de custo: - Mantenha schemas compactos (nomes curtos, descrições objetivas). - Evite listar enumerações longas no prompt; valide no runtime. - Trunque/compacte payloads de retorno das ferramentas antes de reenviá-los ao modelo. - Exemplo de sobrecarga de tokens: - Schema + retorno de tool adicionam 2.000 tokens de entrada → 2.000 × $0,002/1k = $0,004. - Mensagem de chamada de função com 120 tokens de saída → 120 × $0,006/1k ≈ $0,00072. - Total extra ≈ $0,00472 nessa rodada. - Exemplos numéricos de custo (com as tarifas fornecidas) - Chat curto: 700 in + 300 out → 0,7k×$0,002 + 0,3k×$0,006 = $0,0014 + $0,0018 = $0,0032 por chamada. - RAG moderado: 4.000 in + 800 out → 4k×$0,002 + 0,8k×$0,006 = $0,008 + $0,0048 = $0,0128 por chamada. - Batch com alto reaproveitamento (hipotético, como no cenário de cache acima): 1.000 chamadas idênticas → sem cache ~$3,20; com cache (25% leitura) ≈ $2,00. - Limites: pontos a verificar e como contornar - Janela de contexto (máx. tokens por requisição): verifique o limite do Qwen 3.8 Max; ajuste truncamento e sumarização de histórico. - Máx. de tokens de saída: defina max_output_tokens para controlar custo e evitar cortes abruptos. - Rate limits (RPM/TPM) e concorrência: projete filas/backoff; use lote e streaming quando fizer sentido. - Tamanhos de payload e anexos multimodais: entradas de imagem/áudio podem ter regras/pricing próprios; valide antes de enviar grandes anexos ao modelo. - Comprimento de ferramentas (schema/retornos): pode “estourar” contexto; normalize e compacte. - Práticas de mitigação: - Janela deslizante do chat com sumarização. - RAG com top_k enxuto e respostas citadas. - Checagens de comprimento no cliente e abort/continue automático. - Migração do Qwen 3.7 para 3.8: guia rápido - Compatibilidade de API/SDK: - Atualize nomes de modelo/endpoints e versões do SDK; verifique mudanças em parâmetros (p. ex., temperature, top_p, max_tokens). - Confirme diferenças de tokenizer e contagem de tokens (impacta custo e limites). - Comportamento de geração: - Avalie aderência a JSON/“modo estruturado” e tool calling (formato dos argumentos, escaping). - Revise prompts de sistema; modelos mais novos podem interpretar instruções com nuances diferentes. - Ajuste temperaturas/penalidades para manter estilo e variação esperados. - Ferramentas e agentes: - Revalide schemas de função (tipos, campos obrigatórios, limites de tamanho). - Teste mensagens de tool result longas; imponha truncamentos. - Segurança e filtros: - Compare saídas em categorias sensíveis; atualize políticas/“guardrails” conforme necessário. - Desempenho e custo: - Reexecute benchmarks com seus dados: latência, tokens médios in/out, taxa de erro de ferramenta. - Monitore custos por rota; verifique se 3.8 mantém ou reduz tokens gerados vs 3.7. - Confiabilidade e rollout: - Testes de regressão com seeds/templatização para comparabilidade. - Canary release + shadow traffic; fallback automático para 3.7 em casos críticos. - Observabilidade: registre prompts/saídas (com redação), contadores de tokens e motivos de erro. - Checklist final: - Troca do nome do modelo aplicada. - Limites ajustados (contexto, max_output_tokens). - Prompts e schemas revisados/compactados. - Alertas de custo e de latência configurados. - Plano de rollback validado. Observação - Para cache e limites específicos do Qwen 3.8 Max, consulte a documentação oficial do provedor que você usa (p. ex., DashScope/Alibaba Cloud), pois políticas de cache, janelas de contexto e rate limits podem variar por região/versão.

Qwen3.8 Max Preview API: Guia de acesso, disponibilidade e migração
Aug 30, 2026
Qwen‑TTS

Qwen3.8 Max Preview API: Guia de acesso, disponibilidade e migração

Short answer: I can’t verify live availability or pricing. As of my last update (Oct 2024), “Qwen3.8 Max” was not publicly documented; Qwen’s “Max/Plus/Turbo” tiers were offered via Alibaba Cloud DashScope. Use the checks below to confirm current status and decide on migration. How to confirm availability - DashScope console: Model catalog lists current “Max” tiers; search for a model ID likely similar to qwen-3.8-max (naming may vary). - OpenAI-compatible /models endpoint (DashScope compatible mode): List models and look for a 3.8 Max variant. - Qwen official channels: Qwen site/GitHub and Alibaba Cloud announcements for versioned releases and change logs. Pricing status (what to check and where) - DashScope pricing page: Look for per-1K-token rates (separate input/output), currency (often CNY), and any regional differences. - Quotas/free tier: Trial credits and per-minute rate limits for the “Max” tier. - Enterprise plans: Committed-use discounts and overage policies. - Compare against Qwen3.7 Max: Note any change in input/output token rates, free quotas, and rate limits. Access methods (typical for Qwen Max tiers) - Native DashScope REST API and SDKs (Python/JS/Java, etc.). - OpenAI-compatible API mode (chat/completions style), including: - Authorization via Bearer API key. - Streaming responses (SSE). - Tool/function calling and JSON/object modes (verify exact feature flags). - Regions/endpoints: Confirm the correct regional endpoint and ICP/compliance notes if applicable. Key specifications to verify for “Qwen3.8 Max” - Context window: Total tokens supported and recommended safe limits. - Modalities: Text-only vs. multimodal (vision/audio). - Output control: JSON mode or JSON schema support; function/tool calling schema limits. - Length/throughput: Max output tokens, typical latency, tokens/sec, batch support. - Safety/filters: Changes to content moderation or refusal behavior. - Compatibility: Response format, role messages, system prompts, tool call object structure. - Rate limits: Requests/minute and tokens/minute per key/account. - Versioning: Stable model ID vs. alias that may roll forward. Migration guidance from Qwen3.7 Max - Drop-in feasibility - If API is OpenAI-compatible and schemas are unchanged, you can often swap model: qwen-3.7-max → qwen-3.8-max. - Verify tokenizer differences that could affect prompt token counts. - Prompt and tool-call validation - Re-run golden tests for key workflows (function calling, JSON outputs, long-context prompts). - Check any system prompts relying on model-specific formatting. - Quality and behavior drift - A/B test responses for accuracy, safety, and determinism (with temperature/top_p held constant). - Validate long-context retrieval and citation behavior if you rely on RAG. - Cost and performance - Recalculate unit economics with new input/output token prices and throughput. - Ensure rate-limit headroom matches production peaks. - Rollout plan - Start with a canary slice, add fallback to Qwen3.7 Max on error or quality regression. - Monitor JSON validity rate, tool-call argument correctness, and user KPIs. - Compliance and logging - Confirm any new data handling or regional hosting changes. - Update observability dashboards for new model IDs. Recommendation - If Qwen3.8 Max is available and offers equal-or-better quality, similar or lower cost per token, and at least the same context/rate limits, migrate via a controlled canary and retain fallback to Qwen3.7 Max for 1–2 release cycles. - If pricing is higher or behavior changes are material (JSON/tool-call breaks), keep Qwen3.7 Max in production and run a limited pilot while adjusting prompts and validators. Where to look next - DashScope console: model list, pricing, quotas, and API keys. - OpenAI-compatible /models listing in DashScope to confirm exact model IDs. - Qwen official release notes/changelogs for “3.8 Max” specifications and migration notes.

Preços da API Qwen3.7 Plus em 2026: Custos, Cache & Processamento em Lote
Aug 30, 2026
Qwen

Preços da API Qwen3.7 Plus em 2026: Custos, Cache & Processamento em Lote

Veja como os custos da API Qwen3.7 Plus variam conforme a rota da Alibaba, o comprimento de contexto, o uso de cache e os trabalhos em lote, com os preços da CometAPI incluídos para comparação.

Como conectar o Open WebUI a modelos de IA usando o CometAPI
Aug 30, 2026
GPT-5.5
Claude Opus 4.7
Qwen
deepseek

Como conectar o Open WebUI a modelos de IA usando o CometAPI

Saiba como conectar o Open WebUI a 500+ modelos de IA usando a CometAPI. Configure o gateway compatível com OpenAI para economizar 20-40% nos custos de API em produção.

O que é o Qwen 3.5-Max? Faz uma estreia impressionante: salta para o quinto lugar no ranking global
Aug 30, 2026
Qwen3.5-Max

O que é o Qwen 3.5-Max? Faz uma estreia impressionante: salta para o quinto lugar no ranking global

Qwen 3.5-Max é um modelo de linguagem grande (LLM) de próxima geração desenvolvido pela Alibaba, pertencente à família Qwen 3.5. Ele aproveita a arquitetura de Mistura de Especialistas (MoE), capacidades avançadas de raciocínio e recursos de IA agentiva para oferecer desempenho de ponta em programação, matemática, raciocínio multimodal e execução autônoma de tarefas. Avaliações iniciais mostram que ele supera muitos modelos concorrentes e figura entre os principais sistemas globais de IA em 2026.

Qwen image 2.0: Funcionalidade, benchmarks de desempenho & prompts práticos (2026)
Aug 30, 2026
Qwen Image 2.0

Qwen image 2.0: Funcionalidade, benchmarks de desempenho & prompts práticos (2026)

O modelo de imagem de próxima geração da Alibaba — Qwen Image 2.0 — chegou como um passo pragmático e voltado para a produção nos modelos base multimodais: geração 2K nativa, renderização de texto com qualidade profissional e uma arquitetura que unifica geração e edição para simplificar os pipelines. O objetivo: oferecer a designers, equipes de produto e engenheiros um único modelo capaz de criar peças gráficas prontas para publicação (infográficos, pôsteres, slides de PPT) e também realizar edição de alta fidelidade — sem precisar combinar três ou quatro modelos separados.

Como usar a API do Qwen 3.5
Aug 30, 2026
Qwen 3.5

Como usar a API do Qwen 3.5

Na véspera do Ano-Novo Lunar (16–17 de fevereiro de 2026), o Alibaba Group lançou seu modelo de próxima geração, o Qwen 3.5 — um modelo multimodal, com capacidades de agente, posicionado para o que a empresa chama de "agentic AI". A cobertura do setor destacou alegações de grandes ganhos em eficiência e custo, e suporte rápido de fornecedores de hardware e nuvem. O CometAPI é uma opção para desenvolvedores que desejam acesso hospedado à API ou uma integração compatível com a OpenAI, enquanto a AMD anunciou suporte de GPU no Day-0 para o modelo em sua linha Instinct. A ByteDance é um dos principais concorrentes domésticos que lançou atualizações no mesmo período de feriado. A OpenAI continua sendo um ponto de referência para comparação em benchmarks e no estilo de integração.