TL;DR Qwen 3.8 Max cuesta $2 por 1 millón de tokens de entrada y $6 por 1 millón de tokens de salida en QwenCloud. Las tarifas de caché específicas del modelo son $0.25/M para entrada en caché implícita, $2.50/M para creación explícita de caché y $0.17/M para lecturas explícitas de caché.
Las mismas tarifas estándar por token aplican en toda la ventana de contexto de 1M tokens admitida por el modelo. Los prompts más grandes cuestan más porque contienen más tokens, no porque entren en un nivel de precios de contexto largo más alto.
A precio de lista, Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max. Sin embargo, Qwen 3.7 Max es más barato mientras su promoción actual del 50% siga activa. La mejor elección para producción depende del costo por tarea aceptada, incluyendo razonamiento, aciertos de caché, herramientas, reintentos, latencia y revisión humana.
Precios de la API de Qwen 3.8 Max de un vistazo
| Elemento | Valor oficial actual |
|---|---|
| ID de modelo de producción | qwen3.8-max |
| Fecha de lanzamiento oficial | August 3, 2026 |
| Arquitectura | 2.4T parámetros totales; 95B parámetros activos |
| Precio estándar de entrada | $2 / 1M tokens |
| Precio estándar de salida | $6 / 1M tokens |
| Entrada en caché implícita | $0.25 / 1M tokens |
| Creación de caché explícita | $2.50 / 1M tokens |
| Lectura de caché explícita | $0.17 / 1M tokens |
| Ventana de contexto | 1M tokens |
| Entrada máxima | 991K sin razonamiento; 983K con razonamiento |
| Salida máxima | 131K |
| Razonamiento máximo | 262K |
| Modalidades de entrada | Texto, imagen y video |
| Modalidad de salida | Texto |
| Límites de referencia de QwenCloud | 2M TPM and 15K RPM |
La página del modelo en QwenCloud es la fuente más directa para el ID de modelo actual, precios, tarifas de caché, límites de contexto y modalidades. Las cuotas específicas por cuenta y región pueden diferir, así que usa los límites que aparecen en tu propia consola al configurar la concurrencia en producción.
La versión de producción también reemplaza el identificador de vista previa con qwen3.8-max y añade una tabla de precios específica del modelo completa. Los materiales de lanzamiento de Qwen describen configuraciones de esfuerzo de razonamiento low, medium y xhigh, pero el comportamiento en producción debe verificarse contra el endpoint y la referencia de API que realmente uses.
Nota sensible al tiempo: Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. A partir del 4 de agosto de 2026, no describas Qwen 3.8 Max como descargable o autoalojable hasta que se publique oficialmente un checkpoint y licencia.
Cómo funcionan los precios de Qwen 3.8 Max
QwenCloud actualmente muestra una tarifa estándar plana de $2 por 1M tokens de entrada y $6 por 1M tokens de salida en la ventana de contexto de 1M tokens admitida por Qwen 3.8 Max. La captura oficial de precios siguiente se realizó el 4 de agosto de 2026; verifica siempre la página del modelo en vivo antes de tomar decisiones de presupuesto de producción.

Fuente***:*** QwenCloud, “Qwen3.8-Max” oficial
| Elemento de facturación | Precio por 1M tokens | Cuándo aplica |
|---|---|---|
| Entrada estándar | $2.00 | Contenido nuevo del prompt, definiciones de herramientas y contexto no en caché |
| Salida estándar | $6.00 | Salida generada y uso de razonamiento facturado |
| Acierto de caché implícito | $0.25 | Prefijos de prompt reutilizados automáticamente; los aciertos no están garantizados |
| Creación de caché explícita | $2.50 | Creación de un prefijo de prompt reutilizable marcado |
| Lectura de caché explícita | $0.17 | Reutilización de un bloque de caché explícito válido |
Una solicitud de 900K tokens cuesta más que una de 100K tokens porque procesa nueve veces más tokens de entrada, no porque cruce a un nivel de precio más alto.
El razonamiento puede aumentar el costo de salida
Una respuesta visible corta no siempre es de bajo costo. Las llamadas con razonamiento pueden generar tokens de razonamiento adicionales, así que las estimaciones de producción deben usar los campos de uso devueltos por la API en lugar de la longitud visible de la respuesta.
Donde tu endpoint admita controles de razonamiento para qwen3.8-max, compara las configuraciones disponibles en el mismo conjunto de evaluación. No asumas que los valores predeterminados de vista previa se trasladan al modelo GA.
El ahorro por caché depende de la estabilidad del prompt
La página del modelo de Qwen 3.8 Max publica tarifas de caché específicas del modelo. Usa esas tarifas, no proporciones genéricas de caché, al estimar el gasto.
Las entradas de caché explícitas tienen un periodo de validez de cinco minutos, y un acierto exitoso restablece ese periodo. El almacenamiento en caché es automático en el modo implícito, pero un acierto no está garantizado. El caché es más útil cuando prompts del sistema, definiciones de herramientas, contexto de repositorio o documentos grandes permanecen estables en llamadas frecuentes.
Las herramientas integradas generan cargos separados
QwenCloud actualmente lista las siguientes tarifas de herramientas además del uso de tokens:
| Herramienta integrada | Tarifa actual |
|---|---|
| Búsqueda web | $10 / 1K llamadas |
| Búsqueda de imágenes | $8 / 1K llamadas |
| Extractor web | Gratis por tiempo limitado |
| Intérprete de código | Gratis por tiempo limitado |
La invocación de funciones y MCP no tienen tarifas de herramientas separadas, pero las descripciones de herramientas aún cuentan como tokens de entrada. Las promociones de herramientas gratuitas pueden cambiar, así que revisa la guía de precios de QwenCloud antes de finalizar un presupuesto de producción.
Por ejemplo, una solicitud con 20K tokens de entrada, 2K tokens de salida y dos llamadas de Búsqueda web cuesta aproximadamente:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
En este ejemplo, las dos llamadas de búsqueda representan alrededor del 27.8% del costo total de la solicitud.
Ejemplos de costo de Qwen 3.8 Max en el mundo real
Estos ejemplos usan las tarifas específicas del modelo actuales de QwenCloud. Excluyen impuestos, reintentos, alternativas y recargos específicos del proveedor.
Ejemplo 1: Solicitud de agente mediana
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Un primer intento exitoso cuesta aproximadamente $0.13. Un reintento completo elevaría el costo del modelo a aproximadamente $0.26.
Ejemplo 2: Análisis de documento largo
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
El modelo no aplica un recargo separado por contexto largo en su tabla de precios actual, pero los prompts grandes siguen creando un costo absoluto considerable.
Ejemplo 3: Sesión de agente con caché
Supón un prefijo reutilizable de 100K tokens, 10K tokens nuevos de entrada, 5K tokens de salida y 50 llamadas mientras el caché explícito sigue siendo válido:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Ahorro estimado = $8.917, o 71.3%
El ahorro estimado depende de aciertos de caché exitosos y de un prefijo estable. Las pausas largas o los cambios frecuentes en prompts del sistema y esquemas de herramientas reducirán el beneficio.
Qwen 3.8 Max vs Qwen 3.7 Max:Comparación de precios
Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max a precio de lista, pero Qwen 3.7 Max es 37.5% más barato mientras su promoción actual del 50% está activa.
| Modelo y estado de precios | Entrada / 1M | Salida / 1M | Contexto |
|---|---|---|---|
| qwen3.8-max precio estándar | $2.00 | $6.00 | 1M |
| qwen3.7-max precio de lista | $2.50 | $7.50 | 1M |
| qwen3.7-max promoción actual | $1.25 | $3.75 | 1M |
Mantén disponible la página del modelo Qwen3.7 Max de CometAPI como alternativa mientras pruebas el nuevo modelo.
El precio por token es solo una parte de la decisión. Qwen 3.8 Max aún puede ser más económico si mejora el éxito en el primer intento, usa herramientas más fiablemente, reduce reintentos o requiere menos corrección humana.
Usa esta métrica de producción:
Costo por tarea aceptada =
(tokens del modelo + llamadas de herramientas + reintentos + gasto de alternativas + costo de revisión)
÷ salidas aceptadas
Las mejoras de referencia reportadas por el proveedor son una razón para volver a probar flujos de trabajo exigentes de programación y profesionales, no una prueba de que todas las cargas de Qwen 3.7 deban migrar.
Cómo migrar a Qwen 3.8 Max
Cambiar la cadena del modelo es necesario, pero no es una migración de producción completa.
1. Prueba el ID de modelo de producción
Reemplaza el identificador de vista previa con qwen3.8-max en un entorno de prueba. No asumas que los alias de vista previa, valores predeterminados, latencia o comportamiento de respuesta permanecerán sin cambios.
Una solicitud mínima compatible con OpenAI puede verse así:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Comienza con la solicitud mínima documentada. Añade controles de razonamiento solo cuando la referencia de la API actual para tu endpoint los admita explícitamente.
2. Reestablece la telemetría de costos y rendimiento
Registra al menos:
- tokens de entrada, salida y razonamiento
- aciertos de caché y tokens de creación de caché
- tiempo hasta el primer token y latencia total
- llamadas de herramientas, reintentos y alternativas
- salidas aceptadas frente a rechazadas
- tiempo de corrección humana
3. Vuelve a probar la interfaz que usa tu aplicación
Valida eventos de streaming, cargas multimodales, esquemas de herramientas, salida estructurada, razones de finalización, campos de uso, manejo de errores y comportamiento multivuelta. La página del modelo de producción documenta el acceso compatible con DashScope y OpenAI; verifica cualquier capa adicional de compatibilidad antes de depender de ella.
4. Respeta los límites prácticos de contexto
Una ventana de contexto de 1M no es lo mismo que un prompt de usuario de 1M tokens. QwenCloud lista una entrada máxima de 991K sin razonamiento y 983K con razonamiento. Añade un margen de seguridad para que la solicitud aún tenga espacio para salida y razonamiento.
5. Ejecuta Qwen 3.7 y Qwen 3.8 en paralelo
Usa prompts, herramientas, validadores, reglas de reintentos y conjuntos de datos idénticos. Compara costo por tarea aceptada y latencia en lugar de juzgar respuestas aisladas a simple vista.
Cómo evaluar y enrutar Qwen 3.8 Max
Usa cargas de trabajo reales en lugar de promedios de benchmarks generales.
| Carga de trabajo | Tareas sugeridas | Señal principal de aceptación |
|---|---|---|
| Codificación de repositorios | 4 | Las pruebas pasan sin correcciones humanas |
| Análisis de documentos largos | 3 | Las afirmaciones están respaldadas por la evidencia suministrada |
| Análisis multimodal | 2 | Se usan correctamente detalles relevantes de imagen o video |
| Agentes que usan herramientas | 3 | Selección adecuada de herramientas y argumentos válidos |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Usa Qwen 3.8 Max para trabajo difícil en repositorios, agentes de largo horizonte, análisis multimodal y flujos donde Qwen 3.7 falla en las pruebas de aceptación. Mantén Qwen 3.7 Max cuando la promoción reduzca materialmente el costo y el modelo existente ya cumpla tu objetivo de calidad.
Revisa la página de precios de CometAPI y la información de enrutamiento en vivo antes de fijar umbrales porque la disponibilidad del proveedor y los precios enrutados pueden cambiar independientemente del precio directo de QwenCloud. El Cookbook de CometAPI puede ayudarte a construir solicitudes repetibles y un arnés de evaluación consistente.
Preguntas frecuentes
¿Cuánto cuesta la API de Qwen 3.8 Max?
QwenCloud actualmente lista Qwen 3.8 Max a $2 por 1 millón de tokens de entrada y $6 por 1 millón de tokens de salida. El uso de caché y las herramientas integradas tienen tarifas separadas.
¿Qwen 3.8 Max cuesta más por encima de 128K tokens?
No se muestra un nivel separado para contexto largo en la tabla de precios específica del modelo actual. Las solicitudes largas cuestan más porque contienen más tokens, no porque crucen a un nivel de precio unitario más alto.
¿Se facturan los tokens de razonamiento de Qwen 3.8 Max?
El razonamiento puede aumentar el uso generado y el costo total. Usa los campos de tokens de razonamiento y salida devueltos por el endpoint en lugar de estimar a partir de la respuesta visible.
¿Qwen 3.8 Max es de código abierto?
Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. No describas el modelo como descargable o autoalojable hasta que haya un checkpoint y una licencia oficiales disponibles.
¿Los usuarios de Qwen 3.7 Max deben migrar de inmediato?
No automáticamente. Qwen 3.8 Max tiene un precio estándar de lista más bajo, mientras que Qwen 3.7 Max es más barato durante su promoción actual. Migra cuando tus propios datos de calidad, latencia, comportamiento de caché y costo por tarea aceptada respalden el cambio.
Prueba Qwen 3.8 Max con CometAPI
Usa el Quickstart de CometAPI para configurar un cliente compatible con OpenAI. Antes de enviar tráfico de producción, confirma que qwen3.8-max está activo en tu cuenta y verifica el precio enrutado que se muestra allí.
Compáralo con tu línea base de Qwen 3.7 usando prompts, validadores, políticas de reintentos y telemetría idénticos. Esto mantiene la evaluación enfocada en el modelo en lugar de cambios en el arnés de prueba.
