TL;DR Qwen 3.8 Max custa $2 por 1 milhão de tokens de entrada e $6 por 1 milhão de tokens de saída no QwenCloud. As tarifas de cache específicas do modelo são $0.25/M para entrada em cache implícita, $2.50/M para criação explícita de cache e $0.17/M para leituras explícitas de cache.
As mesmas tarifas padrão por token se aplicam em toda a janela de contexto de 1M de tokens suportada pelo modelo. Prompts maiores custam mais porque contêm mais tokens, não por entrarem em uma categoria de preços de contexto longo mais alta.
Pelo preço de tabela, o Qwen 3.8 Max é 20% mais barato que o Qwen 3.7 Max. No entanto, o Qwen 3.7 Max é mais barato enquanto sua promoção atual de 50% permanecer ativa. A melhor escolha em produção depende do custo por tarefa aceita, incluindo raciocínio, acertos de cache, ferramentas, novas tentativas, latência e revisão humana.
Preços da API do Qwen 3.8 Max em um relance
| Item | Valor oficial atual |
|---|---|
| ID do modelo de produção | qwen3.8-max |
| Data de lançamento oficial | August 3, 2026 |
| Arquitetura | 2.4T parâmetros totais; 95B parâmetros ativos |
| Preço padrão de entrada | $2 / 1M tokens |
| Preço padrão de saída | $6 / 1M tokens |
| Entrada em cache implícita | $0.25 / 1M tokens |
| Criação de cache explícito | $2.50 / 1M tokens |
| Leitura de cache explícito | $0.17 / 1M tokens |
| Janela de contexto | 1M tokens |
| Entrada máxima | 991K sem raciocínio; 983K com raciocínio |
| Saída máxima | 131K |
| Raciocínio máximo | 262K |
| Modalidades de entrada | Texto, imagem e vídeo |
| Modalidade de saída | Texto |
| Limites de referência do QwenCloud | 2M TPM e 15K RPM |
A página do modelo do QwenCloud é a fonte mais direta para o ID de modelo atual, preços, tarifas de cache, limites de contexto e modalidades. As cotas específicas de conta e região podem diferir, portanto use os limites exibidos no seu próprio console ao definir a concorrência de produção.
A versão de produção também substitui o identificador de prévia por qwen3.8-max e adiciona uma tabela de preços específica do modelo. Os materiais de lançamento da Qwen descrevem configurações de esforço de raciocínio low, medium e xhigh, mas o comportamento em produção deve ser verificado no endpoint e na referência de API que você realmente usa.
Nota sensível ao tempo: A Qwen anunciou que pesos abertos viriam após o lançamento da API. Em August 4, 2026, não descreva o Qwen 3.8 Max como baixável ou auto-hospedável até que um checkpoint e uma licença oficiais sejam publicados.
Como funcionam os preços do Qwen 3.8 Max
O QwenCloud atualmente lista uma tarifa padrão fixa de $2 por 1M de tokens de entrada e $6 por 1M de tokens de saída em toda a janela de contexto de 1M de tokens suportada pelo Qwen 3.8 Max. A foto oficial de preços abaixo foi capturada em August 4, 2026; sempre consulte a página do modelo ao vivo antes de tomar decisões de orçamento de produção.

Fonte***:*** QwenCloud, “Qwen3.8-Max” official
| Item de cobrança | Preço por 1M tokens | Quando se aplica |
|---|---|---|
| Entrada padrão | $2.00 | Novo conteúdo de prompt, definições de ferramenta e contexto não em cache |
| Saída padrão | $6.00 | Saída gerada e uso de raciocínio faturado |
| Acerto de cache implícito | $0.25 | Prefixos de prompt reutilizados automaticamente; acertos não são garantidos |
| Criação de cache explícito | $2.50 | Criação de um prefixo de prompt reutilizável marcado |
| Leitura de cache explícito | $0.17 | Reutilização de um bloco de cache explícito válido |
Uma solicitação de 900K tokens, portanto, custa mais do que uma de 100K tokens porque processa nove vezes mais tokens de entrada — não porque cruza para uma faixa de preço mais alta.
O raciocínio pode aumentar o custo de saída
Uma resposta visível curta nem sempre é uma resposta de baixo custo. Chamadas com raciocínio podem gerar tokens adicionais de raciocínio, então estimativas de produção devem usar os campos de uso retornados pela API em vez do comprimento visível da resposta.
Onde seu endpoint oferecer controles de raciocínio para qwen3.8-max, compare as configurações disponíveis no mesmo conjunto de avaliação. Não presuma que os padrões da prévia sejam mantidos no modelo GA.
As economias de cache dependem da estabilidade do prompt
A página do modelo do Qwen 3.8 Max publica tarifas de cache específicas do modelo. Use essas tarifas — não proporções genéricas de cache — ao estimar gastos.
Entradas de cache explícito têm um período de validade de cinco minutos, e um acerto bem-sucedido reinicia esse período. O cache implícito é automático, mas um acerto não é garantido. O cache é mais útil quando prompts de sistema, definições de ferramentas, contexto de repositório ou documentos grandes permanecem estáveis em chamadas frequentes.
Ferramentas integradas geram cobranças separadas
O QwenCloud atualmente lista as seguintes taxas de ferramentas além do uso de tokens:
| Ferramenta integrada | Taxa atual |
|---|---|
| Web Search | $10 / 1K chamadas |
| Image Search | $8 / 1K chamadas |
| Web Extractor | Grátis por tempo limitado |
| Code Interpreter | Grátis por tempo limitado |
Chamadas de função e MCP não têm taxas de ferramenta separadas, mas as descrições das ferramentas ainda contam como tokens de entrada. Promoções de ferramentas gratuitas podem mudar, então verifique o guia de preços do QwenCloud antes de finalizar um orçamento de produção.
Por exemplo, uma solicitação com 20K tokens de entrada, 2K tokens de saída e duas chamadas de Web Search custa aproximadamente:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Neste exemplo, as duas chamadas de pesquisa respondem por cerca de 27.8% do custo total da solicitação.
Exemplos de custo do mundo real do Qwen 3.8 Max
Estes exemplos usam as tarifas específicas do modelo atuais do QwenCloud. Excluem impostos, novas tentativas, fallbacks e sobretaxas específicas de provedor.
Exemplo 1: Solicitação de agente média
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Uma primeira tentativa bem-sucedida custa cerca de $0.13. Uma nova tentativa completa elevaria o custo do modelo para aproximadamente $0.26.
Exemplo 2: Análise de documento longo
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
O modelo não aplica uma sobretaxa separada de contexto longo em sua tabela de preços atual, mas prompts grandes ainda geram custo absoluto substancial.
Exemplo 3: Sessão de agente com cache
Considere um prefixo reutilizável de 100K tokens, 10K novos tokens de entrada, 5K tokens de saída e 50 chamadas enquanto o cache explícito permanece válido:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Economia estimada = $8.917, ou 71.3%
A economia estimada depende de acertos de cache bem-sucedidos e de um prefixo estável. Intervalos longos ou mudanças frequentes em prompts de sistema e esquemas de ferramentas reduzirão o benefício.
Qwen 3.8 Max vs Qwen 3.7 Max:Comparação de preços
O Qwen 3.8 Max é 20% mais barato que o Qwen 3.7 Max pelo preço de tabela, mas o Qwen 3.7 Max é 37.5% mais barato enquanto sua promoção atual de 50% estiver ativa.
| Modelo e status de preço | Entrada / 1M | Saída / 1M | Contexto |
|---|---|---|---|
| qwen3.8-max preço padrão | $2.00 | $6.00 | 1M |
| qwen3.7-max preço de tabela | $2.50 | $7.50 | 1M |
| qwen3.7-max promoção atual | $1.25 | $3.75 | 1M |
Mantenha a página do modelo Qwen3.7 Max da CometAPI disponível como fallback enquanto testa o novo modelo.
O preço por token é apenas uma parte da decisão. O Qwen 3.8 Max ainda pode ser mais econômico se melhorar o sucesso na primeira passada, usar ferramentas com mais confiabilidade, reduzir novas tentativas ou exigir menos correção humana.
Use esta métrica de produção:
Custo por tarefa aceita =
(tokens do modelo + chamadas de ferramenta + novas tentativas + gasto com fallback + custo de revisão)
÷ saídas aceitas
Ganhos de benchmark relatados pelo fornecedor são um motivo para retestar fluxos de trabalho exigentes de codificação e profissionais, não prova de que toda a carga do Qwen 3.7 deva migrar.
Como migrar para o Qwen 3.8 Max
Alterar a string do modelo é necessário, mas não é uma migração de produção completa.
1. Teste o ID do modelo de produção
Substitua o identificador de prévia por qwen3.8-max em um ambiente de teste. Não presuma que aliases de prévia, padrões, latência ou comportamento de resposta permanecerão inalterados.
Uma requisição mínima compatível com OpenAI pode ser assim:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Comece com a requisição mínima documentada. Adicione controles de raciocínio apenas quando a referência de API atual para seu endpoint os suportar explicitamente.
2. Reestabeleça a linha de base de telemetria de custo e desempenho
Registre pelo menos:
- tokens de entrada, saída e de raciocínio
- acertos de cache e tokens de criação de cache
- tempo até o primeiro token e latência total
- chamadas de ferramenta, novas tentativas e fallbacks
- saídas aceitas versus rejeitadas
- tempo de correção humana
3. Reteste a interface que seu aplicativo usa
Valide eventos de streaming, payloads multimodais, esquemas de ferramentas, saída estruturada, motivos de término, campos de uso, tratamento de erros e comportamento multiturno. A página do modelo de produção documenta o acesso via DashScope e compatível com OpenAI; verifique qualquer camada adicional de compatibilidade antes de depender dela.
4. Respeite os limites práticos de contexto
Uma janela de contexto de 1M não é o mesmo que um prompt do usuário de 1M tokens. O QwenCloud lista entrada máxima de 991K sem raciocínio e 983K com raciocínio. Adicione uma margem de segurança para que a requisição ainda tenha espaço para saída e raciocínio.
5. Execute Qwen 3.7 e Qwen 3.8 lado a lado
Use prompts, ferramentas, validadores, regras de nova tentativa e conjuntos de dados idênticos. Compare custo por tarefa aceita e latência em vez de julgar respostas isoladas “no olho”.
Como avaliar e rotear o Qwen 3.8 Max
Use cargas de trabalho reais em vez de médias amplas de benchmarks.
| Carga de trabalho | Tarefas sugeridas | Sinal primário de aceitação |
|---|---|---|
| Codificação em repositório | 4 | Os testes passam sem correções humanas |
| Análise de documento longo | 3 | As afirmações são sustentadas pelas evidências fornecidas |
| Análise multimodal | 2 | Detalhes relevantes de imagem ou vídeo são usados corretamente |
| Agentes que usam ferramentas | 3 | Seleção correta de ferramenta e argumentos válidos |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Use Qwen 3.8 Max para trabalho difícil em repositórios, agentes de horizonte longo, análise multimodal e fluxos de trabalho onde o Qwen 3.7 falha em testes de aceitação. Mantenha o Qwen 3.7 Max quando a promoção reduzir materialmente o custo e o modelo existente já atender sua meta de qualidade.
Verifique a página de preços da CometAPI e as informações de roteamento ao vivo antes de travar limites, porque a disponibilidade do provedor e os preços roteados podem mudar independentemente do preço de tabela direto do QwenCloud. O CometAPI Cookbook pode ajudar você a construir requisições reproduzíveis e um arcabouço de avaliação consistente.
FAQ
Quanto custa a API do Qwen 3.8 Max?
O QwenCloud atualmente lista o Qwen 3.8 Max a $2 por 1 milhão de tokens de entrada e $6 por 1 milhão de tokens de saída. O uso de cache e as ferramentas integradas têm tarifas separadas.
O Qwen 3.8 Max custa mais acima de 128K tokens?
Nenhuma faixa separada de contexto longo é mostrada na tabela de preços específica do modelo atual. Solicitações longas custam mais porque contêm mais tokens, não porque cruzam para uma camada de preço unitário mais alta.
Tokens de raciocínio do Qwen 3.8 Max são faturados?
O raciocínio pode aumentar o uso gerado e o custo total. Use os campos de tokens de raciocínio e de saída retornados pelo endpoint em vez de estimar pelo tamanho visível da resposta.
O Qwen 3.8 Max é open source?
A Qwen anunciou que pesos abertos viriam após o lançamento da API. Não descreva o modelo como baixável ou auto-hospedável até que um checkpoint e uma licença oficiais estejam disponíveis.
Usuários do Qwen 3.7 Max devem migrar imediatamente?
Não automaticamente. O Qwen 3.8 Max tem um preço de lista padrão mais baixo, enquanto o Qwen 3.7 Max é mais barato durante sua promoção atual. Migre quando seus próprios dados de qualidade, latência, comportamento de cache e custo por tarefa aceita sustentarem a mudança.
Teste o Qwen 3.8 Max com a CometAPI
Use o Quickstart da CometAPI para configurar um cliente compatível com a OpenAI. Antes de enviar tráfego de produção, confirme que qwen3.8-max está ativo na sua conta e verifique o preço roteado exibido ali.
Compare com sua linha de base do Qwen 3.7 usando prompts, validadores, políticas de nova tentativa e telemetria idênticos. Isso mantém a avaliação focada no modelo em vez de mudanças no arcabouço de teste.
