Precios de la API de Qwen 3.8 Max: $2 Entrada, $6 Salida, 1M de contexto
TL;DR
Qwen 3.8 Max cuesta $2 por cada 1 millón de tokens de entrada y $6 por cada 1 millón de tokens de salida en QwenCloud. Las tarifas de caché específicas del modelo son $0.25/M para entrada con caché implícita, $2.50/M para creación explícita de caché y $0.17/M para lecturas explícitas de caché.
Se aplican las mismas tarifas estándar por token a lo largo de la ventana de contexto compatible de 1M tokens del modelo. Los prompts más grandes cuestan más porque contienen más tokens, no porque entren en un nivel de precios de contexto largo más alto.
A precio de lista, Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max. Sin embargo, Qwen 3.7 Max es más barato mientras su promoción actual del 50% siga activa. La mejor opción en producción depende del costo por tarea aceptada, incluyendo razonamiento, aciertos de caché, herramientas, reintentos, latencia y revisión humana.
Precios de la API de Qwen 3.8 Max de un vistazo
| Elemento | Valor oficial actual |
|---|---|
| ID del modelo de producción | qwen3.8-max |
| Fecha de lanzamiento oficial | 3 de agosto de 2026 |
| Arquitectura | 2.4T parámetros totales; 95B parámetros activos |
| Precio estándar de entrada | $2 / 1M tokens |
| Precio estándar de salida | $6 / 1M tokens |
| Entrada con caché implícita | $0.25 / 1M tokens |
| Creación de caché explícita | $2.50 / 1M tokens |
| Lectura de caché explícita | $0.17 / 1M tokens |
| Ventana de contexto | 1M tokens |
| Entrada máxima | 991K sin razonamiento; 983K con razonamiento |
| Salida máxima | 131K |
| Razonamiento máximo | 262K |
| Modalidades de entrada | Texto, imagen y video |
| Modalidad de salida | Texto |
| Límites de referencia de QwenCloud | 2M TPM and 15K RPM |
La página del modelo en QwenCloud (https://www.qwencloud.com/models/qwen3.8-max) es la fuente más directa para el ID de modelo actual, precios, tarifas de caché, límites de contexto y modalidades. Las cuotas específicas de cuenta y región pueden diferir, así que usa los límites mostrados en tu propia consola al configurar la concurrencia de producción.
El lanzamiento de producción también reemplaza el identificador de vista previa por qwen3.8-max y agrega una tarifa específica del modelo completa. Los materiales de lanzamiento de Qwen describen configuraciones de esfuerzo de razonamiento low, medium y xhigh, pero el comportamiento en producción debe verificarse contra el endpoint y la referencia de API que realmente uses.
Nota temporal: Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. A 4 de agosto de 2026, no describas Qwen 3.8 Max como descargable o autoalojable hasta que se publique un checkpoint y una licencia oficiales.
Cómo funcionan los precios de Qwen 3.8 Max
QwenCloud actualmente muestra una tarifa estándar plana de $2 por 1M tokens de entrada y $6 por 1M tokens de salida en toda la ventana de contexto de 1M tokens compatible con Qwen 3.8 Max. La instantánea de precios oficial a continuación se capturó el 4 de agosto de 2026; consulta siempre la página del modelo en vivo antes de tomar decisiones de presupuesto de producción.

Fuente***:*** QwenCloud, “Qwen3.8-Max” oficial
| Elemento de facturación | Precio por 1M tokens | Cuándo se aplica |
|---|---|---|
| Entrada estándar | $2.00 | Contenido nuevo del prompt, definiciones de herramientas y contexto sin caché |
| Salida estándar | $6.00 | Salida generada y uso de razonamiento facturado |
| Acierto de caché implícita | $0.25 | Prefijos de prompt reutilizados automáticamente; los aciertos no están garantizados |
| Creación de caché explícita | $2.50 | Creación de un prefijo de prompt reutilizable marcado |
| Lectura de caché explícita | $0.17 | Reutilización de un bloque de caché explícito válido |
Por lo tanto, una solicitud de 900K tokens cuesta más que una de 100K tokens porque procesa nueve veces más tokens de entrada, no porque cruce a un nivel de precios más alto.
El razonamiento puede aumentar el costo de salida
Una respuesta visible corta no siempre es de bajo costo. Las llamadas con razonamiento habilitado pueden generar tokens de razonamiento adicionales, por lo que las estimaciones de producción deben usar los campos de uso devueltos por la API en lugar de la longitud visible de la respuesta.
Donde tu endpoint admita controles de razonamiento para qwen3.8-max, compara los ajustes disponibles en el mismo conjunto de evaluación. No asumas que los valores predeterminados de la vista previa se mantienen en el modelo GA.
El ahorro de caché depende de la estabilidad del prompt
La página del modelo de Qwen 3.8 Max publica tarifas de caché específicas del modelo. Usa esas tarifas, no proporciones genéricas de caché, al estimar el gasto.
Las entradas de caché explícita tienen un periodo de validez de cinco minutos, y un acierto exitoso restablece ese periodo. La caché implícita es automática, pero un acierto no está garantizado. La caché es más útil cuando los prompts del sistema, las definiciones de herramientas, el contexto del repositorio o los documentos grandes permanecen estables a través de llamadas frecuentes.
Las herramientas integradas generan cargos separados
QwenCloud actualmente lista las siguientes tarifas de herramientas además del uso de tokens:
| Herramienta integrada | Tarifa actual |
|---|---|
| Web Search | $10 / 1K llamadas |
| Image Search | $8 / 1K llamadas |
| Web Extractor | Gratis por tiempo limitado |
| Code Interpreter | Gratis por tiempo limitado |
Function calling y MCP no tienen tarifas de herramienta separadas, pero las descripciones de herramientas aún cuentan como tokens de entrada. Las promociones de herramientas gratuitas pueden cambiar, así que revisa la guía de precios de QwenCloud (https://docs.qwencloud.com/developer-guides/getting-started/pricing) antes de finalizar un presupuesto de producción.
Por ejemplo, una solicitud con 20K tokens de entrada, 2K tokens de salida y dos llamadas a Web Search cuesta aproximadamente:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
En este ejemplo, las dos llamadas de búsqueda representan aproximadamente el 27.8% del costo total de la solicitud.
Ejemplos de costo real de Qwen 3.8 Max
Estos ejemplos usan las tarifas específicas del modelo actuales de QwenCloud. Excluyen impuestos, reintentos, fallbacks y recargos del proveedor.
Ejemplo 1: Solicitud de agente mediana
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Un primer intento exitoso cuesta alrededor de $0.13. Un reintento completo elevaría el costo del modelo a aproximadamente $0.26.
Ejemplo 2: Análisis de documento largo
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
El modelo no aplica un recargo separado por contexto largo en su tarifa actual, pero los prompts grandes aún generan un costo absoluto sustancial.
Ejemplo 3: Sesión de agente con caché
Supón un prefijo reutilizable de 100K tokens, 10K tokens de entrada nuevos, 5K tokens de salida y 50 llamadas mientras la caché explícita sigue siendo válida:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Ahorro estimado = $8.917, o 71.3%
El ahorro estimado depende de aciertos de caché exitosos y de un prefijo estable. Las pausas largas o cambios frecuentes en los prompts del sistema y los esquemas de herramientas reducirán el beneficio.
Qwen 3.8 Max vs Qwen 3.7 Max: Comparación de precios
Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max a precio de lista, pero Qwen 3.7 Max es 37.5% más barato mientras su promoción actual del 50% esté activa.
| Modelo y estado de precio | Entrada / 1M | Salida / 1M | Contexto |
|---|---|---|---|
| qwen3.8-max precio estándar | $2.00 | $6.00 | 1M |
| qwen3.7-max precio de lista | $2.50 | $7.50 | 1M |
| qwen3.7-max promoción actual | $1.25 | $3.75 | 1M |
Mantén disponible la página del modelo CometAPI Qwen3.7 Max (https://www.cometapi.com/models/aliyun/qwen3-7-max/) como fallback mientras pruebas el nuevo modelo.
El precio por token es solo una parte de la decisión. Qwen 3.8 Max aún puede ser más económico si mejora el éxito al primer intento, usa herramientas con mayor fiabilidad, reduce reintentos o requiere menos corrección humana.
Usa esta métrica de producción:
Costo por tarea aceptada =
(tokens del modelo + llamadas a herramientas + reintentos + gasto de fallback + costo de revisión)
÷ salidas aceptadas
Las mejoras de benchmark reportadas por el proveedor son un motivo para volver a probar workflows exigentes de codificación y profesionales, no una prueba de que toda carga de trabajo de Qwen 3.7 deba migrar.
Cómo migrar a Qwen 3.8 Max
Cambiar la cadena del modelo es necesario, pero no constituye una migración de producción completa.
1. Prueba el ID del modelo de producción
Reemplaza el identificador de vista previa con qwen3.8-max en un entorno de prueba. No asumas que los alias de vista previa, los valores predeterminados, la latencia o el comportamiento de respuesta permanecerán sin cambios.
Una solicitud mínima compatible con OpenAI puede verse así:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Comienza con la solicitud mínima documentada. Agrega controles de razonamiento solo cuando la referencia de API actual para tu endpoint los admita explícitamente.
2. Restablece la línea base de costo y rendimiento
Registra al menos:
- tokens de entrada, salida y razonamiento
- aciertos de caché y tokens de creación de caché
- tiempo hasta el primer token y latencia total
- llamadas a herramientas, reintentos y fallbacks
- salidas aceptadas frente a rechazadas
- tiempo de corrección humana
3. Vuelve a probar la interfaz que usa tu aplicación
Valida eventos de streaming, cargas multimodales, esquemas de herramientas, salida estructurada, motivos de finalización, campos de uso, manejo de errores y comportamiento multi-turno. La página del modelo de producción documenta acceso compatible con DashScope y OpenAI; verifica cualquier capa de compatibilidad adicional antes de depender de ella.
4. Respeta los límites prácticos del contexto
Una ventana de contexto de 1M no es lo mismo que un prompt de usuario de 1M tokens. QwenCloud lista una entrada máxima de 991K sin razonamiento y 983K con razonamiento. Agrega un margen de seguridad para que la solicitud aún tenga espacio para salida y razonamiento.
5. Ejecuta Qwen 3.7 y Qwen 3.8 en paralelo
Usa prompts, herramientas, validadores, reglas de reintento y datasets idénticos. Compara el costo por tarea aceptada y la latencia en lugar de juzgar respuestas aisladas a simple vista.
Cómo evaluar y enrutar Qwen 3.8 Max
Usa cargas de trabajo reales en lugar de promedios amplios de benchmarks.
| Carga de trabajo | Tareas sugeridas | Señal primaria de aceptación |
|---|---|---|
| Codificación de repositorios | 4 | Las pruebas pasan sin parches humanos |
| Análisis de documentos largos | 3 | Las afirmaciones están respaldadas por evidencia suministrada |
| Análisis multimodal | 2 | Se usan correctamente detalles relevantes de imagen o video |
| Agentes con herramientas | 3 | Selección correcta de herramientas y argumentos válidos |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Usa Qwen 3.8 Max para trabajo difícil en repositorios, agentes de horizonte largo, análisis multimodal y workflows donde Qwen 3.7 falla en las pruebas de aceptación. Mantén Qwen 3.7 Max cuando la promoción reduzca materialmente el costo y el modelo existente ya cumpla tu objetivo de calidad.
Consulta la página de precios de CometAPI (https://www.cometapi.com/pricing/) y la información de enrutamiento en vivo antes de fijar umbrales, porque la disponibilidad del proveedor y los precios enrutados pueden cambiar independientemente del precio de lista directo de QwenCloud. El CometAPI Cookbook (https://github.com/cometapi-dev/cometapi-cookbook) puede ayudarte a construir solicitudes repetibles y un arnés de evaluación consistente.
Preguntas frecuentes
¿Cuánto cuesta la API de Qwen 3.8 Max?
QwenCloud actualmente lista Qwen 3.8 Max a $2 por cada 1 millón de tokens de entrada y $6 por cada 1 millón de tokens de salida. El uso de caché y las herramientas integradas tienen tarifas separadas.
¿Qwen 3.8 Max cuesta más por encima de 128K tokens?
No se muestra un nivel separado de contexto largo en la tarifa específica del modelo actual. Las solicitudes largas cuestan más porque contienen más tokens, no porque crucen a un nivel de precio unitario más alto.
¿Se facturan los tokens de razonamiento de Qwen 3.8 Max?
El razonamiento puede aumentar el uso generado y el costo total. Usa los campos de tokens de razonamiento y de salida devueltos por el endpoint en lugar de estimar a partir de la respuesta visible.
¿Es Qwen 3.8 Max de código abierto?
Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. No describas el modelo como descargable o autoalojable hasta que haya un checkpoint y una licencia oficiales disponibles.
¿Deben migrar de inmediato los usuarios de Qwen 3.7 Max?
No automáticamente. Qwen 3.8 Max tiene un precio de lista estándar más bajo, mientras que Qwen 3.7 Max es más barato durante su promoción actual. Migra cuando tus propios datos de calidad, latencia, comportamiento de caché y costo por tarea aceptada respalden el cambio.
Prueba Qwen 3.8 Max con CometAPI
Usa el CometAPI Quickstart (https://www.cometapi.com/quickstart/) para configurar un cliente compatible con OpenAI. Antes de enviar tráfico de producción, confirma que qwen3.8-max está activo en tu cuenta y verifica el precio enrutado que se muestra allí.
Compáralo con tu línea base de Qwen 3.7 usando prompts, validadores, políticas de reintento y telemetría idénticos. Esto mantiene la evaluación centrada en el modelo en lugar de cambios en el arnés de prueba.
