GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Pesquisa CometAPI

Preços da API Qwen 3.8 Max: $2 entrada, $6 saída, 1M de contexto

- Preço base do Qwen 3.8 Max - Entrada: $2 por 1M tokens ($0,002 por 1k). - Saída: $6 por 1M tokens ($0,006 por 1k). - Cache: como pensar custos e economias - Tipos comuns: - Cache do provedor (prompt/prefix caching): reutiliza prefixos/trechos estáticos do prompt/histórico. - Cache no cliente/aplicação: deduplicação de prompts, memoização de respostas, RAG com store de embeddings. - Cobrança (varia por provedor; confirme na documentação do Qwen/DashScope): - Em geral no mercado, gravação do cache é cobrada à tarifa normal de entrada; leituras podem ser cobradas entre 0% e ~25% da tarifa de entrada. Trate os números abaixo como exemplo hipotético para planejamento. - Boas práticas para maximizar economia: - Separar prefixos estáveis (instruções, guias de estilo, schema de funções) do conteúdo variável. - Versionar prompts e configurar TTL de cache para evitar invalidações acidentais. - Manter prefixos concisos; comprimir descrições longas; evitar JSON/schema verboso. - Em RAG, use cache de resultados de retrieval e de respostas para perguntas repetidas. - Exemplo de cálculo (hipotético): - Prefixo estático: 800 tokens; parte variável por chamada: 200 tokens; saída média: 200 tokens; 1.000 chamadas. - Sem cache: por chamada = 1.000 in ($0,002) + 200 out ($0,0012) = $0,0032; 1.000 chamadas = $3,20. - Com cache do provedor (leitura a 25% do preço de entrada): - 1ª chamada (gravação do cache): 800 in ($0,0016) + 200 in ($0,0004) + 200 out ($0,0012) = $0,0032. - Demais 999 chamadas: leitura cache 800 in a 25% ($0,0004) + 200 in ($0,0004) + 200 out ($0,0012) = $0,002 cada → ~$1,998. - Total ≈ $2,00 (economia ~37,5%). Ajuste conforme a política real de cache. - Ferramentas (function calling, tool use) e custos - Em geral, não há tarifa separada por “ativar” ferramentas; o custo vem dos tokens adicionais: - Schema/descrição de função enviado ao modelo (entrada). - Mensagens de chamada de função geradas (saída). - Respostas das ferramentas devolvidas ao modelo (entrada). - APIs externas (busca, bancos, scraping, execução de código) têm cobrança própria fora do modelo. - Otimização de custo: - Mantenha schemas compactos (nomes curtos, descrições objetivas). - Evite listar enumerações longas no prompt; valide no runtime. - Trunque/compacte payloads de retorno das ferramentas antes de reenviá-los ao modelo. - Exemplo de sobrecarga de tokens: - Schema + retorno de tool adicionam 2.000 tokens de entrada → 2.000 × $0,002/1k = $0,004. - Mensagem de chamada de função com 120 tokens de saída → 120 × $0,006/1k ≈ $0,00072. - Total extra ≈ $0,00472 nessa rodada. - Exemplos numéricos de custo (com as tarifas fornecidas) - Chat curto: 700 in + 300 out → 0,7k×$0,002 + 0,3k×$0,006 = $0,0014 + $0,0018 = $0,0032 por chamada. - RAG moderado: 4.000 in + 800 out → 4k×$0,002 + 0,8k×$0,006 = $0,008 + $0,0048 = $0,0128 por chamada. - Batch com alto reaproveitamento (hipotético, como no cenário de cache acima): 1.000 chamadas idênticas → sem cache ~$3,20; com cache (25% leitura) ≈ $2,00. - Limites: pontos a verificar e como contornar - Janela de contexto (máx. tokens por requisição): verifique o limite do Qwen 3.8 Max; ajuste truncamento e sumarização de histórico. - Máx. de tokens de saída: defina max_output_tokens para controlar custo e evitar cortes abruptos. - Rate limits (RPM/TPM) e concorrência: projete filas/backoff; use lote e streaming quando fizer sentido. - Tamanhos de payload e anexos multimodais: entradas de imagem/áudio podem ter regras/pricing próprios; valide antes de enviar grandes anexos ao modelo. - Comprimento de ferramentas (schema/retornos): pode “estourar” contexto; normalize e compacte. - Práticas de mitigação: - Janela deslizante do chat com sumarização. - RAG com top_k enxuto e respostas citadas. - Checagens de comprimento no cliente e abort/continue automático. - Migração do Qwen 3.7 para 3.8: guia rápido - Compatibilidade de API/SDK: - Atualize nomes de modelo/endpoints e versões do SDK; verifique mudanças em parâmetros (p. ex., temperature, top_p, max_tokens). - Confirme diferenças de tokenizer e contagem de tokens (impacta custo e limites). - Comportamento de geração: - Avalie aderência a JSON/“modo estruturado” e tool calling (formato dos argumentos, escaping). - Revise prompts de sistema; modelos mais novos podem interpretar instruções com nuances diferentes. - Ajuste temperaturas/penalidades para manter estilo e variação esperados. - Ferramentas e agentes: - Revalide schemas de função (tipos, campos obrigatórios, limites de tamanho). - Teste mensagens de tool result longas; imponha truncamentos. - Segurança e filtros: - Compare saídas em categorias sensíveis; atualize políticas/“guardrails” conforme necessário. - Desempenho e custo: - Reexecute benchmarks com seus dados: latência, tokens médios in/out, taxa de erro de ferramenta. - Monitore custos por rota; verifique se 3.8 mantém ou reduz tokens gerados vs 3.7. - Confiabilidade e rollout: - Testes de regressão com seeds/templatização para comparabilidade. - Canary release + shadow traffic; fallback automático para 3.7 em casos críticos. - Observabilidade: registre prompts/saídas (com redação), contadores de tokens e motivos de erro. - Checklist final: - Troca do nome do modelo aplicada. - Limites ajustados (contexto, max_output_tokens). - Prompts e schemas revisados/compactados. - Alertas de custo e de latência configurados. - Plano de rollback validado. Observação - Para cache e limites específicos do Qwen 3.8 Max, consulte a documentação oficial do provedor que você usa (p. ex., DashScope/Alibaba Cloud), pois políticas de cache, janelas de contexto e rate limits podem variar por região/versão.

CometAPI
Mia MarenEquipe de pesquisa de modelos e API de IA
Atualizado Sep 3, 2026 12 min de leitura
Preços da API Qwen 3.8 Max: $2 entrada, $6 saída, 1M de contexto
Use este padrão

Faça a primeira chamada à API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max custa $2 por 1 milhão de tokens de entrada e $6 por 1 milhão de tokens de saída no QwenCloud. As tarifas de cache específicas do modelo são $0.25/M para entrada em cache implícita, $2.50/M para criação explícita de cache e $0.17/M para leituras explícitas de cache.

As mesmas tarifas padrão por token se aplicam em toda a janela de contexto de 1M de tokens suportada pelo modelo. Prompts maiores custam mais porque contêm mais tokens, não por entrarem em uma categoria de preços de contexto longo mais alta.

Pelo preço de tabela, o Qwen 3.8 Max é 20% mais barato que o Qwen 3.7 Max. No entanto, o Qwen 3.7 Max é mais barato enquanto sua promoção atual de 50% permanecer ativa. A melhor escolha em produção depende do custo por tarefa aceita, incluindo raciocínio, acertos de cache, ferramentas, novas tentativas, latência e revisão humana.

Preços da API do Qwen 3.8 Max em um relance

ItemValor oficial atual
ID do modelo de produçãoqwen3.8-max
Data de lançamento oficialAugust 3, 2026
Arquitetura2.4T parâmetros totais; 95B parâmetros ativos
Preço padrão de entrada$2 / 1M tokens
Preço padrão de saída$6 / 1M tokens
Entrada em cache implícita$0.25 / 1M tokens
Criação de cache explícito$2.50 / 1M tokens
Leitura de cache explícito$0.17 / 1M tokens
Janela de contexto1M tokens
Entrada máxima991K sem raciocínio; 983K com raciocínio
Saída máxima131K
Raciocínio máximo262K
Modalidades de entradaTexto, imagem e vídeo
Modalidade de saídaTexto
Limites de referência do QwenCloud2M TPM e 15K RPM

A página do modelo do QwenCloud é a fonte mais direta para o ID de modelo atual, preços, tarifas de cache, limites de contexto e modalidades. As cotas específicas de conta e região podem diferir, portanto use os limites exibidos no seu próprio console ao definir a concorrência de produção.

A versão de produção também substitui o identificador de prévia por qwen3.8-max e adiciona uma tabela de preços específica do modelo. Os materiais de lançamento da Qwen descrevem configurações de esforço de raciocínio low, medium e xhigh, mas o comportamento em produção deve ser verificado no endpoint e na referência de API que você realmente usa.

Nota sensível ao tempo: A Qwen anunciou que pesos abertos viriam após o lançamento da API. Em August 4, 2026, não descreva o Qwen 3.8 Max como baixável ou auto-hospedável até que um checkpoint e uma licença oficiais sejam publicados.

Como funcionam os preços do Qwen 3.8 Max

O QwenCloud atualmente lista uma tarifa padrão fixa de $2 por 1M de tokens de entrada e $6 por 1M de tokens de saída em toda a janela de contexto de 1M de tokens suportada pelo Qwen 3.8 Max. A foto oficial de preços abaixo foi capturada em August 4, 2026; sempre consulte a página do modelo ao vivo antes de tomar decisões de orçamento de produção.

Preços da API Qwen 3.8 Max: $2 entrada, $6 saída, 1M de contexto

Fonte***:*** QwenCloud, “Qwen3.8-Max” official

Item de cobrançaPreço por 1M tokensQuando se aplica
Entrada padrão$2.00Novo conteúdo de prompt, definições de ferramenta e contexto não em cache
Saída padrão$6.00Saída gerada e uso de raciocínio faturado
Acerto de cache implícito$0.25Prefixos de prompt reutilizados automaticamente; acertos não são garantidos
Criação de cache explícito$2.50Criação de um prefixo de prompt reutilizável marcado
Leitura de cache explícito$0.17Reutilização de um bloco de cache explícito válido

Uma solicitação de 900K tokens, portanto, custa mais do que uma de 100K tokens porque processa nove vezes mais tokens de entrada — não porque cruza para uma faixa de preço mais alta.

O raciocínio pode aumentar o custo de saída

Uma resposta visível curta nem sempre é uma resposta de baixo custo. Chamadas com raciocínio podem gerar tokens adicionais de raciocínio, então estimativas de produção devem usar os campos de uso retornados pela API em vez do comprimento visível da resposta.

Onde seu endpoint oferecer controles de raciocínio para qwen3.8-max, compare as configurações disponíveis no mesmo conjunto de avaliação. Não presuma que os padrões da prévia sejam mantidos no modelo GA.

As economias de cache dependem da estabilidade do prompt

A página do modelo do Qwen 3.8 Max publica tarifas de cache específicas do modelo. Use essas tarifas — não proporções genéricas de cache — ao estimar gastos.

Entradas de cache explícito têm um período de validade de cinco minutos, e um acerto bem-sucedido reinicia esse período. O cache implícito é automático, mas um acerto não é garantido. O cache é mais útil quando prompts de sistema, definições de ferramentas, contexto de repositório ou documentos grandes permanecem estáveis em chamadas frequentes.

Ferramentas integradas geram cobranças separadas

O QwenCloud atualmente lista as seguintes taxas de ferramentas além do uso de tokens:

Ferramenta integradaTaxa atual
Web Search$10 / 1K chamadas
Image Search$8 / 1K chamadas
Web ExtractorGrátis por tempo limitado
Code InterpreterGrátis por tempo limitado

Chamadas de função e MCP não têm taxas de ferramenta separadas, mas as descrições das ferramentas ainda contam como tokens de entrada. Promoções de ferramentas gratuitas podem mudar, então verifique o guia de preços do QwenCloud antes de finalizar um orçamento de produção.

Por exemplo, uma solicitação com 20K tokens de entrada, 2K tokens de saída e duas chamadas de Web Search custa aproximadamente:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Neste exemplo, as duas chamadas de pesquisa respondem por cerca de 27.8% do custo total da solicitação.

Exemplos de custo do mundo real do Qwen 3.8 Max

Estes exemplos usam as tarifas específicas do modelo atuais do QwenCloud. Excluem impostos, novas tentativas, fallbacks e sobretaxas específicas de provedor.

Exemplo 1: Solicitação de agente média

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Uma primeira tentativa bem-sucedida custa cerca de $0.13. Uma nova tentativa completa elevaria o custo do modelo para aproximadamente $0.26.

Exemplo 2: Análise de documento longo

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

O modelo não aplica uma sobretaxa separada de contexto longo em sua tabela de preços atual, mas prompts grandes ainda geram custo absoluto substancial.

Exemplo 3: Sessão de agente com cache

Considere um prefixo reutilizável de 100K tokens, 10K novos tokens de entrada, 5K tokens de saída e 50 chamadas enquanto o cache explícito permanece válido:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Economia estimada = $8.917, ou 71.3%

A economia estimada depende de acertos de cache bem-sucedidos e de um prefixo estável. Intervalos longos ou mudanças frequentes em prompts de sistema e esquemas de ferramentas reduzirão o benefício.

Qwen 3.8 Max vs Qwen 3.7 Max:Comparação de preços

O Qwen 3.8 Max é 20% mais barato que o Qwen 3.7 Max pelo preço de tabela, mas o Qwen 3.7 Max é 37.5% mais barato enquanto sua promoção atual de 50% estiver ativa.

Modelo e status de preçoEntrada / 1MSaída / 1MContexto
qwen3.8-max preço padrão$2.00$6.001M
qwen3.7-max preço de tabela$2.50$7.501M
qwen3.7-max promoção atual$1.25$3.751M

Mantenha a página do modelo Qwen3.7 Max da CometAPI disponível como fallback enquanto testa o novo modelo.

O preço por token é apenas uma parte da decisão. O Qwen 3.8 Max ainda pode ser mais econômico se melhorar o sucesso na primeira passada, usar ferramentas com mais confiabilidade, reduzir novas tentativas ou exigir menos correção humana.

Use esta métrica de produção:

Custo por tarefa aceita =

(tokens do modelo + chamadas de ferramenta + novas tentativas + gasto com fallback + custo de revisão)

÷ saídas aceitas

Ganhos de benchmark relatados pelo fornecedor são um motivo para retestar fluxos de trabalho exigentes de codificação e profissionais, não prova de que toda a carga do Qwen 3.7 deva migrar.

Como migrar para o Qwen 3.8 Max

Alterar a string do modelo é necessário, mas não é uma migração de produção completa.

1. Teste o ID do modelo de produção

Substitua o identificador de prévia por qwen3.8-max em um ambiente de teste. Não presuma que aliases de prévia, padrões, latência ou comportamento de resposta permanecerão inalterados.

Uma requisição mínima compatível com OpenAI pode ser assim:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Comece com a requisição mínima documentada. Adicione controles de raciocínio apenas quando a referência de API atual para seu endpoint os suportar explicitamente.

2. Reestabeleça a linha de base de telemetria de custo e desempenho

Registre pelo menos:

  • tokens de entrada, saída e de raciocínio
  • acertos de cache e tokens de criação de cache
  • tempo até o primeiro token e latência total
  • chamadas de ferramenta, novas tentativas e fallbacks
  • saídas aceitas versus rejeitadas
  • tempo de correção humana

3. Reteste a interface que seu aplicativo usa

Valide eventos de streaming, payloads multimodais, esquemas de ferramentas, saída estruturada, motivos de término, campos de uso, tratamento de erros e comportamento multiturno. A página do modelo de produção documenta o acesso via DashScope e compatível com OpenAI; verifique qualquer camada adicional de compatibilidade antes de depender dela.

4. Respeite os limites práticos de contexto

Uma janela de contexto de 1M não é o mesmo que um prompt do usuário de 1M tokens. O QwenCloud lista entrada máxima de 991K sem raciocínio e 983K com raciocínio. Adicione uma margem de segurança para que a requisição ainda tenha espaço para saída e raciocínio.

5. Execute Qwen 3.7 e Qwen 3.8 lado a lado

Use prompts, ferramentas, validadores, regras de nova tentativa e conjuntos de dados idênticos. Compare custo por tarefa aceita e latência em vez de julgar respostas isoladas “no olho”.

Como avaliar e rotear o Qwen 3.8 Max

Use cargas de trabalho reais em vez de médias amplas de benchmarks.

Carga de trabalhoTarefas sugeridasSinal primário de aceitação
Codificação em repositório4Os testes passam sem correções humanas
Análise de documento longo3As afirmações são sustentadas pelas evidências fornecidas
Análise multimodal2Detalhes relevantes de imagem ou vídeo são usados corretamente
Agentes que usam ferramentas3Seleção correta de ferramenta e argumentos válidos
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Use Qwen 3.8 Max para trabalho difícil em repositórios, agentes de horizonte longo, análise multimodal e fluxos de trabalho onde o Qwen 3.7 falha em testes de aceitação. Mantenha o Qwen 3.7 Max quando a promoção reduzir materialmente o custo e o modelo existente já atender sua meta de qualidade.

Verifique a página de preços da CometAPI e as informações de roteamento ao vivo antes de travar limites, porque a disponibilidade do provedor e os preços roteados podem mudar independentemente do preço de tabela direto do QwenCloud. O CometAPI Cookbook pode ajudar você a construir requisições reproduzíveis e um arcabouço de avaliação consistente.

FAQ

Quanto custa a API do Qwen 3.8 Max?

O QwenCloud atualmente lista o Qwen 3.8 Max a $2 por 1 milhão de tokens de entrada e $6 por 1 milhão de tokens de saída. O uso de cache e as ferramentas integradas têm tarifas separadas.

O Qwen 3.8 Max custa mais acima de 128K tokens?

Nenhuma faixa separada de contexto longo é mostrada na tabela de preços específica do modelo atual. Solicitações longas custam mais porque contêm mais tokens, não porque cruzam para uma camada de preço unitário mais alta.

Tokens de raciocínio do Qwen 3.8 Max são faturados?

O raciocínio pode aumentar o uso gerado e o custo total. Use os campos de tokens de raciocínio e de saída retornados pelo endpoint em vez de estimar pelo tamanho visível da resposta.

O Qwen 3.8 Max é open source?

A Qwen anunciou que pesos abertos viriam após o lançamento da API. Não descreva o modelo como baixável ou auto-hospedável até que um checkpoint e uma licença oficiais estejam disponíveis.

Usuários do Qwen 3.7 Max devem migrar imediatamente?

Não automaticamente. O Qwen 3.8 Max tem um preço de lista padrão mais baixo, enquanto o Qwen 3.7 Max é mais barato durante sua promoção atual. Migre quando seus próprios dados de qualidade, latência, comportamento de cache e custo por tarefa aceita sustentarem a mudança.

Teste o Qwen 3.8 Max com a CometAPI

Use o Quickstart da CometAPI para configurar um cliente compatível com a OpenAI. Antes de enviar tráfego de produção, confirme que qwen3.8-max está ativo na sua conta e verifique o preço roteado exibido ali.

Compare com sua linha de base do Qwen 3.7 usando prompts, validadores, políticas de nova tentativa e telemetria idênticos. Isso mantém a avaliação focada no modelo em vez de mudanças no arcabouço de teste.

Continuar aprendendo

Conecte este artigo à próxima decisão.

Ver todos os tópicos
Publicado em Aug 4, 2026
Última atualização Sep 3, 2026
199 visualizações
Revisado para maior clareza, atribuição de fontes e terminologia de API atual.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais