GPT-5.6 Luna price down 80%, Terra down 20% →

Qwen 3.8 Max Preços da API: $2 Entrada, $6 Saída, 1M de contexto

CometAPI
Mia MarenAug 4, 2026
Qwen 3.8 Max Preços da API: $2 Entrada, $6 Saída, 1M de contexto

Preços da API Qwen 3.8 Max: $2 Entrada, $6 Saída, 1M de Contexto

TL;DR

Qwen 3.8 Max custa $2 por 1 milhão de tokens de entrada e $6 por 1 milhão de tokens de saída no QwenCloud. As tarifas de cache específicas do modelo são $0,25/M para entrada em cache implícita, $2,50/M para criação explícita de cache e $0,17/M para leituras explícitas de cache.

As mesmas tarifas padrão por token se aplicam à janela de contexto suportada de 1M tokens do modelo. Prompts maiores custam mais porque contêm mais tokens, não porque entram em um nível de preços diferenciado para contexto longo.

Ao preço de tabela, Qwen 3.8 Max é 20% mais barato que Qwen 3.7 Max. No entanto, Qwen 3.7 Max é mais barato enquanto sua promoção atual de 50% permanecer ativa. A melhor escolha em produção depende do custo por tarefa aceita, incluindo raciocínio, acertos de cache, ferramentas, novas tentativas, latência e revisão humana.

Preços da API Qwen 3.8 Max em um Relance

ItemValor oficial atual
Production model IDqwen3.8-max
Official release dateAugust 3, 2026
Architecture2.4T total parameters; 95B active parameters
Standard input price$2 / 1M tokens
Standard output price$6 / 1M tokens
Implicit cached input$0.25 / 1M tokens
Explicit cache creation$2.50 / 1M tokens
Explicit cache read$0.17 / 1M tokens
Context window1M tokens
Maximum input991K without thinking; 983K with thinking
Maximum output131K
Maximum reasoning262K
Input modalitiesTexto, imagem e vídeo
Output modalityTexto
QwenCloud reference limits2M TPM and 15K RPM

A página do modelo no QwenCloud (https://www.qwencloud.com/models/qwen3.8-max) é a fonte mais direta para o ID do modelo atual, preços, tarifas de cache, limites de contexto e modalidades. As cotas específicas de conta e região podem diferir, portanto, use os limites exibidos no seu próprio console ao definir a simultaneidade de produção.

A versão de produção também substitui o identificador de prévia por qwen3.8-max e adiciona uma tabela de tarifas específica do modelo completa. Os materiais de lançamento da Qwen descrevem configurações de esforço de raciocínio low, medium e xhigh, mas o comportamento em produção deve ser verificado no endpoint e na referência da API que você realmente usa.

Observação sensível ao tempo: a Qwen anunciou que os pesos abertos seriam disponibilizados após o lançamento da API. Em 4 de agosto de 2026, não descreva o Qwen 3.8 Max como baixável ou auto-hospedável até que um checkpoint e uma licença oficiais sejam publicados.

Como Funcionam os Preços do Qwen 3.8 Max

O QwenCloud atualmente lista uma tarifa padrão fixa de $2 por 1M de tokens de entrada e $6 por 1M de tokens de saída em toda a janela de contexto de 1M tokens suportada pelo Qwen 3.8 Max. A captura oficial de preços abaixo foi feita em 4 de agosto de 2026; sempre verifique a página do modelo em tempo real antes de tomar decisões de orçamento de produção.

Qwen 3.8 Max Preços da API: $2 Entrada, $6 Saída, 1M de contexto

Fonte***:*** QwenCloud, “Qwen3.8-Max” oficial

Item de cobrançaPreço por 1M tokensQuando se aplica
Standard input$2.00Novo conteúdo de prompt, definições de ferramentas e contexto não em cache
Standard output$6.00Saída gerada e uso de raciocínio faturado
Implicit cache hit$0.25Prefixos de prompt reutilizados automaticamente; acertos não são garantidos
Explicit cache creation$2.50Criação de um prefixo de prompt reutilizável marcado
Explicit cache read$0.17Reutilização de um bloco de cache explícito válido

Uma solicitação de 900K tokens, portanto, custa mais do que uma de 100K tokens porque processa nove vezes mais tokens de entrada — não porque cruza para um nível de preço mais alto.

O raciocínio pode aumentar o custo de saída

Uma resposta visível curta nem sempre é uma resposta de baixo custo. Chamadas com raciocínio ativado podem gerar tokens de raciocínio adicionais, então estimativas de produção devem usar os campos de uso retornados pela API, e não o comprimento visível da resposta.

Onde seu endpoint oferecer controles de raciocínio para qwen3.8-max, compare as configurações disponíveis no mesmo conjunto de avaliação. Não presuma que os padrões da prévia migrem para o modelo GA.

As economias de cache dependem da estabilidade do prompt

A página do modelo do Qwen 3.8 Max publica tarifas de cache específicas do modelo. Use essas tarifas — não proporções genéricas de cache — ao estimar gastos.

Entradas de cache explícitas têm um período de validade de cinco minutos, e um acerto bem-sucedido reinicia esse período. O cache implícito é automático, mas um acerto não é garantido. O cache é mais útil quando prompts de sistema, definições de ferramentas, contexto de repositório ou documentos grandes permanecem estáveis em chamadas frequentes.

Ferramentas integradas geram cobranças separadas

O QwenCloud atualmente lista as seguintes tarifas de ferramentas além do uso de tokens:

Built-in toolTarifa atual
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web ExtractorGratuito por tempo limitado
Code InterpreterGratuito por tempo limitado

Chamadas de função e MCP não têm tarifas de ferramentas separadas, mas as descrições das ferramentas ainda contam como tokens de entrada. Promoções de ferramentas gratuitas podem mudar, portanto, verifique o guia de preços do QwenCloud (https://docs.qwencloud.com/developer-guides/getting-started/pricing) antes de finalizar um orçamento de produção.

Por exemplo, uma solicitação com 20K tokens de entrada, 2K tokens de saída e duas chamadas de Web Search custa aproximadamente:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Neste exemplo, as duas chamadas de pesquisa representam cerca de 27,8% do custo total da solicitação.

Exemplos Reais de Custo do Qwen 3.8 Max

Estes exemplos usam as tarifas específicas do modelo atuais do QwenCloud. Excluem impostos, novas tentativas, alternativas e acréscimos específicos do provedor.

Exemplo 1: Solicitação de agente média

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Uma primeira tentativa bem-sucedida custa cerca de $0,13. Uma nova tentativa completa elevaria o custo do modelo para aproximadamente $0,26.

Exemplo 2: Análise de documento longo

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

O modelo não aplica uma sobretaxa separada de contexto longo em sua tabela de tarifas atual, mas prompts grandes ainda geram um custo absoluto significativo.

Exemplo 3: Sessão de agente em cache

Assuma um prefixo reutilizável de 100K tokens, 10K novos tokens de entrada, 5K tokens de saída e 50 chamadas enquanto o cache explícito permanece válido:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Economia estimada = $8.917, ou 71,3%

A economia estimada depende de acertos de cache bem-sucedidos e de um prefixo estável. Grandes intervalos ou alterações frequentes em prompts de sistema e esquemas de ferramentas reduzirão o benefício.

Qwen 3.8 Max vs Qwen 3.7 Max: Comparação de Preços

Qwen 3.8 Max é 20% mais barato que Qwen 3.7 Max ao preço de tabela, mas Qwen 3.7 Max é 37,5% mais barato enquanto sua promoção atual de 50% estiver ativa.

Modelo e status de preçoEntrada / 1MSaída / 1MContexto
qwen3.8-max preço padrão$2.00$6.001M
qwen3.7-max preço de tabela$2.50$7.501M
qwen3.7-max promoção atual$1.25$3.751M

Mantenha a página do modelo Qwen3.7 Max da CometAPI (https://www.cometapi.com/models/aliyun/qwen3-7-max/) disponível como alternativa enquanto testa o novo modelo.

O preço por token é apenas uma parte da decisão. Qwen 3.8 Max ainda pode ser mais econômico se melhorar o sucesso na primeira tentativa, usar ferramentas com mais confiabilidade, reduzir novas tentativas ou exigir menos correção humana.

Use esta métrica de produção:

Custo por tarefa aceita =

(tokens do modelo + chamadas de ferramentas + novas tentativas + gastos com alternativas + custo de revisão)

÷ saídas aceitas

Os ganhos de benchmark reportados pelo fornecedor são um motivo para retestar fluxos de trabalho exigentes de codificação e profissionais, não prova de que todas as cargas de trabalho do Qwen 3.7 devem migrar.

Como Migrar para o Qwen 3.8 Max

Alterar a string do modelo é necessário, mas não constitui uma migração completa para produção.

1. Teste o ID do modelo de produção

Substitua o identificador de prévia por qwen3.8-max em um ambiente de teste. Não presuma que aliases, padrões, latência ou comportamento de resposta da prévia permanecerão inalterados.

Uma solicitação mínima compatível com OpenAI pode ser assim:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Comece com a solicitação mínima documentada. Adicione controles de raciocínio apenas quando a referência de API atual do seu endpoint os suportar explicitamente.

2. Reestabeleça a telemetria de custo e desempenho

Registre pelo menos:

  • tokens de entrada, saída e raciocínio
  • acertos de cache e tokens de criação de cache
  • tempo até o primeiro token e latência total
  • chamadas de ferramentas, novas tentativas e alternativas
  • saídas aceitas versus rejeitadas
  • tempo de correção humana

3. Reteste a interface que sua aplicação usa

Valide eventos de streaming, cargas multimodais, esquemas de ferramentas, saída estruturada, motivos de término, campos de uso, tratamento de erros e comportamento multi-turno. A página do modelo em produção documenta acesso via DashScope e compatível com OpenAI; verifique qualquer camada de compatibilidade adicional antes de depender dela.

4. Respeite os limites práticos de contexto

Uma janela de contexto de 1M não é o mesmo que um prompt de usuário de 1M tokens. O QwenCloud lista entrada máxima de 991K sem raciocínio e 983K com raciocínio. Adicione uma margem de segurança para que a solicitação ainda tenha espaço para saída e raciocínio.

5. Execute Qwen 3.7 e Qwen 3.8 lado a lado

Use prompts, ferramentas, validadores, regras de nova tentativa e conjuntos de dados idênticos. Compare custo por tarefa aceita e latência em vez de julgar respostas isoladas “no olho”.

Como Avaliar e Roteiar o Qwen 3.8 Max

Use cargas de trabalho reais em vez de médias amplas de benchmark.

Carga de trabalhoTarefas sugeridasSinal principal de aceitação
Codificação em repositório4Testes passam sem correções humanas
Análise de documentos longos3As afirmações são respaldadas pelas evidências fornecidas
Análise multimodal2Detalhes relevantes de imagem ou vídeo são usados corretamente
Agentes que usam ferramentas3Seleção correta de ferramentas e argumentos válidos
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Use o Qwen 3.8 Max para trabalho difícil em repositórios, agentes de longo horizonte, análises multimodais e fluxos de trabalho onde o Qwen 3.7 falha nos testes de aceitação. Mantenha o Qwen 3.7 Max quando a promoção reduzir materialmente o custo e o modelo existente já atingir sua meta de qualidade.

Verifique a página de preços da CometAPI (https://www.cometapi.com/pricing/) e as informações de roteamento em tempo real antes de bloquear limites, pois a disponibilidade do provedor e os preços roteados podem mudar independentemente do preço direto do QwenCloud. O CometAPI Cookbook (https://github.com/cometapi-dev/cometapi-cookbook) pode ajudar você a construir solicitações reproduzíveis e um arcabouço de avaliação consistente.

Perguntas Frequentes

Quanto custa a API do Qwen 3.8 Max?

O QwenCloud atualmente lista o Qwen 3.8 Max a $2 por 1 milhão de tokens de entrada e $6 por 1 milhão de tokens de saída. O uso de cache e as ferramentas integradas têm tarifas separadas.

O Qwen 3.8 Max custa mais acima de 128K tokens?

Nenhum nível separado de contexto longo é mostrado na tabela de tarifas específica do modelo atual. Solicitações longas custam mais porque contêm mais tokens, não porque cruzam para um nível de preço unitário mais alto.

Tokens de raciocínio do Qwen 3.8 Max são faturados?

O raciocínio pode aumentar o uso gerado e o custo total. Use os campos de tokens de raciocínio e de saída retornados pelo endpoint em vez de estimar pelo tamanho visível da resposta.

O Qwen 3.8 Max é de código aberto?

A Qwen anunciou que pesos abertos seguiriam o lançamento da API. Não descreva o modelo como baixável ou auto-hospedável até que um checkpoint e uma licença oficiais estejam disponíveis.

Usuários do Qwen 3.7 Max devem migrar imediatamente?

Não automaticamente. Qwen 3.8 Max tem um preço padrão de tabela mais baixo, enquanto o Qwen 3.7 Max é mais barato durante sua promoção atual. Migre quando seus próprios dados de qualidade, latência, comportamento de cache e custo por tarefa aceita sustentarem a mudança.

Teste o Qwen 3.8 Max com a CometAPI

Use o Quickstart da CometAPI (https://www.cometapi.com/quickstart/) para configurar um cliente compatível com OpenAI. Antes de enviar tráfego de produção, confirme que qwen3.8-max está ativo na sua conta e verifique o preço roteado exibido ali.

Compare com sua linha de base do Qwen 3.7 usando prompts, validadores, políticas de nova tentativa e telemetria idênticos. Isso mantém a avaliação focada no modelo, e não em mudanças na aparelhagem de teste.

Pronto para reduzir os custos de desenvolvimento de IA em 20%?

Comece gratuitamente em minutos. Créditos de avaliação gratuita incluídos. Não é necessário cartão de crédito.

Leia Mais