GPT-5.6 Luna price down 80%, Terra down 20% →

Precios de la API Qwen 3.8 Max: $2 entrada, $6 salida, contexto de 1M

CometAPI
Mia MarenAug 4, 2026
Precios de la API Qwen 3.8 Max: $2 entrada, $6 salida, contexto de 1M

Precios de la API de Qwen 3.8 Max: $2 Entrada, $6 Salida, 1M de contexto

TL;DR

Qwen 3.8 Max cuesta $2 por cada 1 millón de tokens de entrada y $6 por cada 1 millón de tokens de salida en QwenCloud. Las tarifas de caché específicas del modelo son $0.25/M para entrada con caché implícita, $2.50/M para creación explícita de caché y $0.17/M para lecturas explícitas de caché.

Se aplican las mismas tarifas estándar por token a lo largo de la ventana de contexto compatible de 1M tokens del modelo. Los prompts más grandes cuestan más porque contienen más tokens, no porque entren en un nivel de precios de contexto largo más alto.

A precio de lista, Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max. Sin embargo, Qwen 3.7 Max es más barato mientras su promoción actual del 50% siga activa. La mejor opción en producción depende del costo por tarea aceptada, incluyendo razonamiento, aciertos de caché, herramientas, reintentos, latencia y revisión humana.

Precios de la API de Qwen 3.8 Max de un vistazo

ElementoValor oficial actual
ID del modelo de producciónqwen3.8-max
Fecha de lanzamiento oficial3 de agosto de 2026
Arquitectura2.4T parámetros totales; 95B parámetros activos
Precio estándar de entrada$2 / 1M tokens
Precio estándar de salida$6 / 1M tokens
Entrada con caché implícita$0.25 / 1M tokens
Creación de caché explícita$2.50 / 1M tokens
Lectura de caché explícita$0.17 / 1M tokens
Ventana de contexto1M tokens
Entrada máxima991K sin razonamiento; 983K con razonamiento
Salida máxima131K
Razonamiento máximo262K
Modalidades de entradaTexto, imagen y video
Modalidad de salidaTexto
Límites de referencia de QwenCloud2M TPM and 15K RPM

La página del modelo en QwenCloud (https://www.qwencloud.com/models/qwen3.8-max) es la fuente más directa para el ID de modelo actual, precios, tarifas de caché, límites de contexto y modalidades. Las cuotas específicas de cuenta y región pueden diferir, así que usa los límites mostrados en tu propia consola al configurar la concurrencia de producción.

El lanzamiento de producción también reemplaza el identificador de vista previa por qwen3.8-max y agrega una tarifa específica del modelo completa. Los materiales de lanzamiento de Qwen describen configuraciones de esfuerzo de razonamiento low, medium y xhigh, pero el comportamiento en producción debe verificarse contra el endpoint y la referencia de API que realmente uses.

Nota temporal: Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. A 4 de agosto de 2026, no describas Qwen 3.8 Max como descargable o autoalojable hasta que se publique un checkpoint y una licencia oficiales.

Cómo funcionan los precios de Qwen 3.8 Max

QwenCloud actualmente muestra una tarifa estándar plana de $2 por 1M tokens de entrada y $6 por 1M tokens de salida en toda la ventana de contexto de 1M tokens compatible con Qwen 3.8 Max. La instantánea de precios oficial a continuación se capturó el 4 de agosto de 2026; consulta siempre la página del modelo en vivo antes de tomar decisiones de presupuesto de producción.

Precios de la API Qwen 3.8 Max: $2 entrada, $6 salida, contexto de 1M

Fuente***:*** QwenCloud, “Qwen3.8-Max” oficial

Elemento de facturaciónPrecio por 1M tokensCuándo se aplica
Entrada estándar$2.00Contenido nuevo del prompt, definiciones de herramientas y contexto sin caché
Salida estándar$6.00Salida generada y uso de razonamiento facturado
Acierto de caché implícita$0.25Prefijos de prompt reutilizados automáticamente; los aciertos no están garantizados
Creación de caché explícita$2.50Creación de un prefijo de prompt reutilizable marcado
Lectura de caché explícita$0.17Reutilización de un bloque de caché explícito válido

Por lo tanto, una solicitud de 900K tokens cuesta más que una de 100K tokens porque procesa nueve veces más tokens de entrada, no porque cruce a un nivel de precios más alto.

El razonamiento puede aumentar el costo de salida

Una respuesta visible corta no siempre es de bajo costo. Las llamadas con razonamiento habilitado pueden generar tokens de razonamiento adicionales, por lo que las estimaciones de producción deben usar los campos de uso devueltos por la API en lugar de la longitud visible de la respuesta.

Donde tu endpoint admita controles de razonamiento para qwen3.8-max, compara los ajustes disponibles en el mismo conjunto de evaluación. No asumas que los valores predeterminados de la vista previa se mantienen en el modelo GA.

El ahorro de caché depende de la estabilidad del prompt

La página del modelo de Qwen 3.8 Max publica tarifas de caché específicas del modelo. Usa esas tarifas, no proporciones genéricas de caché, al estimar el gasto.

Las entradas de caché explícita tienen un periodo de validez de cinco minutos, y un acierto exitoso restablece ese periodo. La caché implícita es automática, pero un acierto no está garantizado. La caché es más útil cuando los prompts del sistema, las definiciones de herramientas, el contexto del repositorio o los documentos grandes permanecen estables a través de llamadas frecuentes.

Las herramientas integradas generan cargos separados

QwenCloud actualmente lista las siguientes tarifas de herramientas además del uso de tokens:

Herramienta integradaTarifa actual
Web Search$10 / 1K llamadas
Image Search$8 / 1K llamadas
Web ExtractorGratis por tiempo limitado
Code InterpreterGratis por tiempo limitado

Function calling y MCP no tienen tarifas de herramienta separadas, pero las descripciones de herramientas aún cuentan como tokens de entrada. Las promociones de herramientas gratuitas pueden cambiar, así que revisa la guía de precios de QwenCloud (https://docs.qwencloud.com/developer-guides/getting-started/pricing) antes de finalizar un presupuesto de producción.

Por ejemplo, una solicitud con 20K tokens de entrada, 2K tokens de salida y dos llamadas a Web Search cuesta aproximadamente:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

En este ejemplo, las dos llamadas de búsqueda representan aproximadamente el 27.8% del costo total de la solicitud.

Ejemplos de costo real de Qwen 3.8 Max

Estos ejemplos usan las tarifas específicas del modelo actuales de QwenCloud. Excluyen impuestos, reintentos, fallbacks y recargos del proveedor.

Ejemplo 1: Solicitud de agente mediana

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Un primer intento exitoso cuesta alrededor de $0.13. Un reintento completo elevaría el costo del modelo a aproximadamente $0.26.

Ejemplo 2: Análisis de documento largo

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

El modelo no aplica un recargo separado por contexto largo en su tarifa actual, pero los prompts grandes aún generan un costo absoluto sustancial.

Ejemplo 3: Sesión de agente con caché

Supón un prefijo reutilizable de 100K tokens, 10K tokens de entrada nuevos, 5K tokens de salida y 50 llamadas mientras la caché explícita sigue siendo válida:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Ahorro estimado = $8.917, o 71.3%

El ahorro estimado depende de aciertos de caché exitosos y de un prefijo estable. Las pausas largas o cambios frecuentes en los prompts del sistema y los esquemas de herramientas reducirán el beneficio.

Qwen 3.8 Max vs Qwen 3.7 Max: Comparación de precios

Qwen 3.8 Max es 20% más barato que Qwen 3.7 Max a precio de lista, pero Qwen 3.7 Max es 37.5% más barato mientras su promoción actual del 50% esté activa.

Modelo y estado de precioEntrada / 1MSalida / 1MContexto
qwen3.8-max precio estándar$2.00$6.001M
qwen3.7-max precio de lista$2.50$7.501M
qwen3.7-max promoción actual$1.25$3.751M

Mantén disponible la página del modelo CometAPI Qwen3.7 Max (https://www.cometapi.com/models/aliyun/qwen3-7-max/) como fallback mientras pruebas el nuevo modelo.

El precio por token es solo una parte de la decisión. Qwen 3.8 Max aún puede ser más económico si mejora el éxito al primer intento, usa herramientas con mayor fiabilidad, reduce reintentos o requiere menos corrección humana.

Usa esta métrica de producción:

Costo por tarea aceptada =

(tokens del modelo + llamadas a herramientas + reintentos + gasto de fallback + costo de revisión)

÷ salidas aceptadas

Las mejoras de benchmark reportadas por el proveedor son un motivo para volver a probar workflows exigentes de codificación y profesionales, no una prueba de que toda carga de trabajo de Qwen 3.7 deba migrar.

Cómo migrar a Qwen 3.8 Max

Cambiar la cadena del modelo es necesario, pero no constituye una migración de producción completa.

1. Prueba el ID del modelo de producción

Reemplaza el identificador de vista previa con qwen3.8-max en un entorno de prueba. No asumas que los alias de vista previa, los valores predeterminados, la latencia o el comportamiento de respuesta permanecerán sin cambios.

Una solicitud mínima compatible con OpenAI puede verse así:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Comienza con la solicitud mínima documentada. Agrega controles de razonamiento solo cuando la referencia de API actual para tu endpoint los admita explícitamente.

2. Restablece la línea base de costo y rendimiento

Registra al menos:

  • tokens de entrada, salida y razonamiento
  • aciertos de caché y tokens de creación de caché
  • tiempo hasta el primer token y latencia total
  • llamadas a herramientas, reintentos y fallbacks
  • salidas aceptadas frente a rechazadas
  • tiempo de corrección humana

3. Vuelve a probar la interfaz que usa tu aplicación

Valida eventos de streaming, cargas multimodales, esquemas de herramientas, salida estructurada, motivos de finalización, campos de uso, manejo de errores y comportamiento multi-turno. La página del modelo de producción documenta acceso compatible con DashScope y OpenAI; verifica cualquier capa de compatibilidad adicional antes de depender de ella.

4. Respeta los límites prácticos del contexto

Una ventana de contexto de 1M no es lo mismo que un prompt de usuario de 1M tokens. QwenCloud lista una entrada máxima de 991K sin razonamiento y 983K con razonamiento. Agrega un margen de seguridad para que la solicitud aún tenga espacio para salida y razonamiento.

5. Ejecuta Qwen 3.7 y Qwen 3.8 en paralelo

Usa prompts, herramientas, validadores, reglas de reintento y datasets idénticos. Compara el costo por tarea aceptada y la latencia en lugar de juzgar respuestas aisladas a simple vista.

Cómo evaluar y enrutar Qwen 3.8 Max

Usa cargas de trabajo reales en lugar de promedios amplios de benchmarks.

Carga de trabajoTareas sugeridasSeñal primaria de aceptación
Codificación de repositorios4Las pruebas pasan sin parches humanos
Análisis de documentos largos3Las afirmaciones están respaldadas por evidencia suministrada
Análisis multimodal2Se usan correctamente detalles relevantes de imagen o video
Agentes con herramientas3Selección correcta de herramientas y argumentos válidos
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Usa Qwen 3.8 Max para trabajo difícil en repositorios, agentes de horizonte largo, análisis multimodal y workflows donde Qwen 3.7 falla en las pruebas de aceptación. Mantén Qwen 3.7 Max cuando la promoción reduzca materialmente el costo y el modelo existente ya cumpla tu objetivo de calidad.

Consulta la página de precios de CometAPI (https://www.cometapi.com/pricing/) y la información de enrutamiento en vivo antes de fijar umbrales, porque la disponibilidad del proveedor y los precios enrutados pueden cambiar independientemente del precio de lista directo de QwenCloud. El CometAPI Cookbook (https://github.com/cometapi-dev/cometapi-cookbook) puede ayudarte a construir solicitudes repetibles y un arnés de evaluación consistente.

Preguntas frecuentes

¿Cuánto cuesta la API de Qwen 3.8 Max?

QwenCloud actualmente lista Qwen 3.8 Max a $2 por cada 1 millón de tokens de entrada y $6 por cada 1 millón de tokens de salida. El uso de caché y las herramientas integradas tienen tarifas separadas.

¿Qwen 3.8 Max cuesta más por encima de 128K tokens?

No se muestra un nivel separado de contexto largo en la tarifa específica del modelo actual. Las solicitudes largas cuestan más porque contienen más tokens, no porque crucen a un nivel de precio unitario más alto.

¿Se facturan los tokens de razonamiento de Qwen 3.8 Max?

El razonamiento puede aumentar el uso generado y el costo total. Usa los campos de tokens de razonamiento y de salida devueltos por el endpoint en lugar de estimar a partir de la respuesta visible.

¿Es Qwen 3.8 Max de código abierto?

Qwen anunció que los pesos abiertos seguirían al lanzamiento de la API. No describas el modelo como descargable o autoalojable hasta que haya un checkpoint y una licencia oficiales disponibles.

¿Deben migrar de inmediato los usuarios de Qwen 3.7 Max?

No automáticamente. Qwen 3.8 Max tiene un precio de lista estándar más bajo, mientras que Qwen 3.7 Max es más barato durante su promoción actual. Migra cuando tus propios datos de calidad, latencia, comportamiento de caché y costo por tarea aceptada respalden el cambio.

Prueba Qwen 3.8 Max con CometAPI

Usa el CometAPI Quickstart (https://www.cometapi.com/quickstart/) para configurar un cliente compatible con OpenAI. Antes de enviar tráfico de producción, confirma que qwen3.8-max está activo en tu cuenta y verifica el precio enrutado que se muestra allí.

Compáralo con tu línea base de Qwen 3.7 usando prompts, validadores, políticas de reintento y telemetría idénticos. Esto mantiene la evaluación centrada en el modelo en lugar de cambios en el arnés de prueba.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más