GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Investigación de CometAPI

Precios de la API de Qwen 3.8 Max: $2 entrada, $6 salida, 1M de contexto

Qwen 3.8 Max cuesta $2/M de entrada y $6/M de salida. Compara las tarifas de caché, los costos de herramientas, ejemplos reales, límites y recomendaciones de migración desde Qwen 3.7.

CometAPI
Mia MarenEquipo de investigación de modelos de IA y API
Actualizado Sep 3, 2026 12 min de lectura
Precios de la API de Qwen 3.8 Max: $2 entrada, $6 salida, 1M de contexto
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max cuesta $2 por 1 millón de tokens de entrada y $6 por 1 millón de tokens de salida en QwenCloud. Las tarifas de caché específicas del modelo son $0.25/M para entrada en caché implícita, $2.50/M para creación explícita de caché y $0.17/M para lecturas explícitas de caché.

Las mismas tarifas estándar por token aplican en toda la ventana de contexto de 1M tokens admitida por el modelo. Los prompts más grandes cuestan más porque contienen más tokens, no porque entren en un nivel de precios de contexto largo más alto.

A precio de lista, Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max. Sin embargo, Qwen 3.7 Max es más barato mientras su promoción actual del 50% siga activa. La mejor elección para producción depende del costo por tarea aceptada, incluyendo razonamiento, aciertos de caché, herramientas, reintentos, latencia y revisión humana.

Precios de la API de Qwen 3.8 Max de un vistazo

ElementoValor oficial actual
ID de modelo de producciónqwen3.8-max
Fecha de lanzamiento oficialAugust 3, 2026
Arquitectura2.4T parámetros totales; 95B parámetros activos
Precio estándar de entrada$2 / 1M tokens
Precio estándar de salida$6 / 1M tokens
Entrada en caché implícita$0.25 / 1M tokens
Creación de caché explícita$2.50 / 1M tokens
Lectura de caché explícita$0.17 / 1M tokens
Ventana de contexto1M tokens
Entrada máxima991K sin razonamiento; 983K con razonamiento
Salida máxima131K
Razonamiento máximo262K
Modalidades de entradaTexto, imagen y video
Modalidad de salidaTexto
Límites de referencia de QwenCloud2M TPM and 15K RPM

La página del modelo en QwenCloud es la fuente más directa para el ID de modelo actual, precios, tarifas de caché, límites de contexto y modalidades. Las cuotas específicas por cuenta y región pueden diferir, así que usa los límites que aparecen en tu propia consola al configurar la concurrencia en producción.

La versión de producción también reemplaza el identificador de vista previa con qwen3.8-max y añade una tabla de precios específica del modelo completa. Los materiales de lanzamiento de Qwen describen configuraciones de esfuerzo de razonamiento low, medium y xhigh, pero el comportamiento en producción debe verificarse contra el endpoint y la referencia de API que realmente uses.

Nota sensible al tiempo: Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. A partir del 4 de agosto de 2026, no describas Qwen 3.8 Max como descargable o autoalojable hasta que se publique oficialmente un checkpoint y licencia.

Cómo funcionan los precios de Qwen 3.8 Max

QwenCloud actualmente muestra una tarifa estándar plana de $2 por 1M tokens de entrada y $6 por 1M tokens de salida en la ventana de contexto de 1M tokens admitida por Qwen 3.8 Max. La captura oficial de precios siguiente se realizó el 4 de agosto de 2026; verifica siempre la página del modelo en vivo antes de tomar decisiones de presupuesto de producción.

Precios de la API de Qwen 3.8 Max: $2 entrada, $6 salida, 1M de contexto

Fuente***:*** QwenCloud, “Qwen3.8-Max” oficial

Elemento de facturaciónPrecio por 1M tokensCuándo aplica
Entrada estándar$2.00Contenido nuevo del prompt, definiciones de herramientas y contexto no en caché
Salida estándar$6.00Salida generada y uso de razonamiento facturado
Acierto de caché implícito$0.25Prefijos de prompt reutilizados automáticamente; los aciertos no están garantizados
Creación de caché explícita$2.50Creación de un prefijo de prompt reutilizable marcado
Lectura de caché explícita$0.17Reutilización de un bloque de caché explícito válido

Una solicitud de 900K tokens cuesta más que una de 100K tokens porque procesa nueve veces más tokens de entrada, no porque cruce a un nivel de precio más alto.

El razonamiento puede aumentar el costo de salida

Una respuesta visible corta no siempre es de bajo costo. Las llamadas con razonamiento pueden generar tokens de razonamiento adicionales, así que las estimaciones de producción deben usar los campos de uso devueltos por la API en lugar de la longitud visible de la respuesta.

Donde tu endpoint admita controles de razonamiento para qwen3.8-max, compara las configuraciones disponibles en el mismo conjunto de evaluación. No asumas que los valores predeterminados de vista previa se trasladan al modelo GA.

El ahorro por caché depende de la estabilidad del prompt

La página del modelo de Qwen 3.8 Max publica tarifas de caché específicas del modelo. Usa esas tarifas, no proporciones genéricas de caché, al estimar el gasto.

Las entradas de caché explícitas tienen un periodo de validez de cinco minutos, y un acierto exitoso restablece ese periodo. El almacenamiento en caché es automático en el modo implícito, pero un acierto no está garantizado. El caché es más útil cuando prompts del sistema, definiciones de herramientas, contexto de repositorio o documentos grandes permanecen estables en llamadas frecuentes.

Las herramientas integradas generan cargos separados

QwenCloud actualmente lista las siguientes tarifas de herramientas además del uso de tokens:

Herramienta integradaTarifa actual
Búsqueda web$10 / 1K llamadas
Búsqueda de imágenes$8 / 1K llamadas
Extractor webGratis por tiempo limitado
Intérprete de códigoGratis por tiempo limitado

La invocación de funciones y MCP no tienen tarifas de herramientas separadas, pero las descripciones de herramientas aún cuentan como tokens de entrada. Las promociones de herramientas gratuitas pueden cambiar, así que revisa la guía de precios de QwenCloud antes de finalizar un presupuesto de producción.

Por ejemplo, una solicitud con 20K tokens de entrada, 2K tokens de salida y dos llamadas de Búsqueda web cuesta aproximadamente:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

En este ejemplo, las dos llamadas de búsqueda representan alrededor del 27.8% del costo total de la solicitud.

Ejemplos de costo de Qwen 3.8 Max en el mundo real

Estos ejemplos usan las tarifas específicas del modelo actuales de QwenCloud. Excluyen impuestos, reintentos, alternativas y recargos específicos del proveedor.

Ejemplo 1: Solicitud de agente mediana

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Un primer intento exitoso cuesta aproximadamente $0.13. Un reintento completo elevaría el costo del modelo a aproximadamente $0.26.

Ejemplo 2: Análisis de documento largo

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

El modelo no aplica un recargo separado por contexto largo en su tabla de precios actual, pero los prompts grandes siguen creando un costo absoluto considerable.

Ejemplo 3: Sesión de agente con caché

Supón un prefijo reutilizable de 100K tokens, 10K tokens nuevos de entrada, 5K tokens de salida y 50 llamadas mientras el caché explícito sigue siendo válido:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Ahorro estimado = $8.917, o 71.3%

El ahorro estimado depende de aciertos de caché exitosos y de un prefijo estable. Las pausas largas o los cambios frecuentes en prompts del sistema y esquemas de herramientas reducirán el beneficio.

Qwen 3.8 Max vs Qwen 3.7 Max:Comparación de precios

Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max a precio de lista, pero Qwen 3.7 Max es 37.5% más barato mientras su promoción actual del 50% está activa.

Modelo y estado de preciosEntrada / 1MSalida / 1MContexto
qwen3.8-max precio estándar$2.00$6.001M
qwen3.7-max precio de lista$2.50$7.501M
qwen3.7-max promoción actual$1.25$3.751M

Mantén disponible la página del modelo Qwen3.7 Max de CometAPI como alternativa mientras pruebas el nuevo modelo.

El precio por token es solo una parte de la decisión. Qwen 3.8 Max aún puede ser más económico si mejora el éxito en el primer intento, usa herramientas más fiablemente, reduce reintentos o requiere menos corrección humana.

Usa esta métrica de producción:

Costo por tarea aceptada =

(tokens del modelo + llamadas de herramientas + reintentos + gasto de alternativas + costo de revisión)

÷ salidas aceptadas

Las mejoras de referencia reportadas por el proveedor son una razón para volver a probar flujos de trabajo exigentes de programación y profesionales, no una prueba de que todas las cargas de Qwen 3.7 deban migrar.

Cómo migrar a Qwen 3.8 Max

Cambiar la cadena del modelo es necesario, pero no es una migración de producción completa.

1. Prueba el ID de modelo de producción

Reemplaza el identificador de vista previa con qwen3.8-max en un entorno de prueba. No asumas que los alias de vista previa, valores predeterminados, latencia o comportamiento de respuesta permanecerán sin cambios.

Una solicitud mínima compatible con OpenAI puede verse así:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Comienza con la solicitud mínima documentada. Añade controles de razonamiento solo cuando la referencia de la API actual para tu endpoint los admita explícitamente.

2. Reestablece la telemetría de costos y rendimiento

Registra al menos:

  • tokens de entrada, salida y razonamiento
  • aciertos de caché y tokens de creación de caché
  • tiempo hasta el primer token y latencia total
  • llamadas de herramientas, reintentos y alternativas
  • salidas aceptadas frente a rechazadas
  • tiempo de corrección humana

3. Vuelve a probar la interfaz que usa tu aplicación

Valida eventos de streaming, cargas multimodales, esquemas de herramientas, salida estructurada, razones de finalización, campos de uso, manejo de errores y comportamiento multivuelta. La página del modelo de producción documenta el acceso compatible con DashScope y OpenAI; verifica cualquier capa adicional de compatibilidad antes de depender de ella.

4. Respeta los límites prácticos de contexto

Una ventana de contexto de 1M no es lo mismo que un prompt de usuario de 1M tokens. QwenCloud lista una entrada máxima de 991K sin razonamiento y 983K con razonamiento. Añade un margen de seguridad para que la solicitud aún tenga espacio para salida y razonamiento.

5. Ejecuta Qwen 3.7 y Qwen 3.8 en paralelo

Usa prompts, herramientas, validadores, reglas de reintentos y conjuntos de datos idénticos. Compara costo por tarea aceptada y latencia en lugar de juzgar respuestas aisladas a simple vista.

Cómo evaluar y enrutar Qwen 3.8 Max

Usa cargas de trabajo reales en lugar de promedios de benchmarks generales.

Carga de trabajoTareas sugeridasSeñal principal de aceptación
Codificación de repositorios4Las pruebas pasan sin correcciones humanas
Análisis de documentos largos3Las afirmaciones están respaldadas por la evidencia suministrada
Análisis multimodal2Se usan correctamente detalles relevantes de imagen o video
Agentes que usan herramientas3Selección adecuada de herramientas y argumentos válidos
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Usa Qwen 3.8 Max para trabajo difícil en repositorios, agentes de largo horizonte, análisis multimodal y flujos donde Qwen 3.7 falla en las pruebas de aceptación. Mantén Qwen 3.7 Max cuando la promoción reduzca materialmente el costo y el modelo existente ya cumpla tu objetivo de calidad.

Revisa la página de precios de CometAPI y la información de enrutamiento en vivo antes de fijar umbrales porque la disponibilidad del proveedor y los precios enrutados pueden cambiar independientemente del precio directo de QwenCloud. El Cookbook de CometAPI puede ayudarte a construir solicitudes repetibles y un arnés de evaluación consistente.

Preguntas frecuentes

¿Cuánto cuesta la API de Qwen 3.8 Max?

QwenCloud actualmente lista Qwen 3.8 Max a $2 por 1 millón de tokens de entrada y $6 por 1 millón de tokens de salida. El uso de caché y las herramientas integradas tienen tarifas separadas.

¿Qwen 3.8 Max cuesta más por encima de 128K tokens?

No se muestra un nivel separado para contexto largo en la tabla de precios específica del modelo actual. Las solicitudes largas cuestan más porque contienen más tokens, no porque crucen a un nivel de precio unitario más alto.

¿Se facturan los tokens de razonamiento de Qwen 3.8 Max?

El razonamiento puede aumentar el uso generado y el costo total. Usa los campos de tokens de razonamiento y salida devueltos por el endpoint en lugar de estimar a partir de la respuesta visible.

¿Qwen 3.8 Max es de código abierto?

Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. No describas el modelo como descargable o autoalojable hasta que haya un checkpoint y una licencia oficiales disponibles.

¿Los usuarios de Qwen 3.7 Max deben migrar de inmediato?

No automáticamente. Qwen 3.8 Max tiene un precio estándar de lista más bajo, mientras que Qwen 3.7 Max es más barato durante su promoción actual. Migra cuando tus propios datos de calidad, latencia, comportamiento de caché y costo por tarea aceptada respalden el cambio.

Prueba Qwen 3.8 Max con CometAPI

Usa el Quickstart de CometAPI para configurar un cliente compatible con OpenAI. Antes de enviar tráfico de producción, confirma que qwen3.8-max está activo en tu cuenta y verifica el precio enrutado que se muestra allí.

Compáralo con tu línea base de Qwen 3.7 usando prompts, validadores, políticas de reintentos y telemetría idénticos. Esto mantiene la evaluación enfocada en el modelo en lugar de cambios en el arnés de prueba.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Aug 4, 2026
Última actualización Sep 3, 2026
199 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más