GPT-5.6 Luna price down 80%, Terra down 20% →

¿Te refieres a “Qwen3-8B” o a “Qwen Max”? - Qwen3-8B: un modelo de lenguaje de ~8 mil millones de parámetros de la serie Qwen3 (Tongyi Qianwen). - Qwen Max: el nivel/endpoint de mayor capacidad dentro de los servicios de Qwen en Alibaba Cloud (orientado a mejor calidad frente a Plus/Turbo). Si puedes precisar el contexto o el nombre exacto del modelo (p. ej., ID de API o la plataforma donde lo viste), puedo darte una descripción más exacta.

CometAPI
AnnaAug 4, 2026
¿Te refieres a “Qwen3-8B” o a “Qwen Max”?

- Qwen3-8B: un modelo de lenguaje de ~8 mil millones de parámetros de la serie Qwen3 (Tongyi Qianwen).
- Qwen Max: el nivel/endpoint de mayor capacidad dentro de los servicios de Qwen en Alibaba Cloud (orientado a mejor calidad frente a Plus/Turbo).

Si puedes precisar el contexto o el nombre exacto del modelo (p. ej., ID de API o la plataforma donde lo viste), puedo darte una descripción más exacta.

TLDR El equipo Qwen de Alibaba lanzó oficialmente Qwen3.8-Max el 3 de agosto de 2026 — un modelo disperso de Mixture-of-Experts con 2.4 billones de parámetros totales (95 mil millones activos), una ventana de contexto de 1 millón de tokens y compatibilidad multimodal nativa (texto + imagen + video).

Es el primer modelo Qwen de clase Max programado para pesos abiertos (previstos para la semana siguiente). Con un precio agresivo de $2 por millón de tokens de entrada y $6 por millón de tokens de salida, ofrece resultados sólidos en tareas agénticas de largo horizonte, ingeniería de software autónoma (incluido un proyecto documentado de codificación autoevolutiva de 16 días), reproducción de investigaciones y benchmarks multimodales. Compite de cerca con modelos como Kimi K3 y se sitúa por encima de opciones más ligeras como DeepSeek V4 Flash en capacidad, manteniéndose mucho más rentable que los principales modelos occidentales de frontera en cargas con gran volumen de salida. Los desarrolladores pueden acceder hoy a través de QwenCloud / Alibaba Cloud Model Studio y mediante plataformas unificadas como CometAPI.

Puntos clave

  • Escala y eficiencia: Arquitectura MoE de 2.4T totales / 95B activos construida sobre las bases de Qwen 3.5 que permite rendimiento de frontera con un costo de inferencia práctico.
  • Fortaleza en largo horizonte: Codificación autónoma de varios días demostrada (265 commits, 127 PRs durante ~16 días sin intervención humana), reproducción y mejora de artículos de investigación, y operaciones de comercio electrónico simuladas durante un año.
  • Aspectos destacados de benchmarks: PaperBench 93.0 (líder), Terminal Bench 2.1 86.6, puntuaciones sólidas en multimodal y documentos; competitiva pero no dominante en todos los rankings de agentes de codificación puros frente a Claude Fable 5 o GPT-5.6 Sol.
  • Ventaja de precio: Tarifa plana de $2 / $6 por 1M de tokens en toda la ventana de 1M de contexto (entrada en caché ~$0.25), por debajo de Kimi K3 en salida y de muchos modelos occidentales.
  • Disponibilidad: Disponible en QwenCloud y Alibaba Cloud Model Studio (APIs compatibles con OpenAI y Anthropic); pesos abiertos planificados; ya listado en CometAPI como qwen3.8-max para acceso unificado junto con 500+ modelos más. Pesos abiertos disponibles de forma inminente; también se planea una variante más pequeña Qwen3.8-27B para despliegues locales/de borde prácticos.
  • Ventaja práctica: Destaca en producción de entregables de extremo a extremo más que en respuestas de un solo turno — ideal para agentes de codificación, canalizaciones de investigación, flujos de trabajo de oficina y bucles de agentes sostenidos.

¿Qué es Qwen3.8-Max?

Qwen3.8-Max es el modelo insignia más reciente y capaz de Alibaba en la serie Qwen, lanzado oficialmente el 3 de agosto de 2026 (tras una vista previa a mediados de julio en la World AI Conference en Shanghái). Representa un cambio deliberado hacia modelos que pueden completar tareas complejas de varios días de extremo a extremo con mínima supervisión y producir entregables listos para producción.

Arquitectónicamente es un modelo disperso Mixture-of-Experts (MoE) que escala a 2.4 billones de parámetros totales, de los cuales solo aproximadamente 95 mil millones se activan por token. Este diseño, construido sobre la base de Qwen 3.5, equilibra una capacidad masiva con eficiencia en inferencia. El modelo admite una ventana de contexto de 1 millón de tokens (máximo de entrada documentado alrededor de 991K tokens y máximo de salida alrededor de 131K tokens), entradas multimodales nativas (texto, imágenes y video) y salida de texto. Incluye controles de esfuerzo de razonamiento (xhigh / medium / low) y admite tanto OpenAI Chat Completions como protocolos compatibles con Anthropic, lo que lo hace compatible de forma directa con marcos de agentes populares como Claude Code, Codex, Qoder CLI, Qwen Code y OpenClaw.

A diferencia de modelos anteriores de clase Max que permanecieron cerrados, Alibaba se ha comprometido a publicar los pesos de Qwen3.8-Max (y una variante más pequeña Qwen3.8-27B) la semana posterior al lanzamiento a través de Hugging Face y ModelScope — la primera vez que un modelo Qwen de nivel Max estará disponible abiertamente.

El modelo está orientado a agentes de codificación, trabajo profesional en el mundo real (“cowork”), investigación, planificación de largo horizonte y bucles de agentes multimodales. Las demostraciones oficiales enfatizan el comportamiento autoevolutivo: el modelo crea issues, se las asigna, escribe y prueba código, itera con feedback y mejora sus propias herramientas durante períodos prolongados.

Fuentes: Blog oficial de Qwen y anuncios de Alibaba Cloud (agosto de 2026); ficha de modelo de Artificial Analysis; reseñas independientes que resumen la disponibilidad general.

¿Qué hay de nuevo en Qwen3.8-Max?

Comparado con su predecesor Qwen3.7-Max, la generación 3.8 aporta mejoras sustanciales en codificación agéntica, fiabilidad a largo horizonte, razonamiento multimodal y rendimiento en documentos/oficina. Las innovaciones clave incluyen:

Autonomía real de largo horizonte:

El modelo puede sostener aprendizaje adaptativo en bucle cerrado a lo largo de cientos de turnos o varios días. Los ejemplos documentados incluyen un proyecto de ingeniería de software autónomo de 16 días que produjo una herramienta CLI autoevolutiva (oh-my-cli) con 265 commits, 127 pull requests y 151 issues totalmente sin intervención humana; reproducción y mejora de la metodología de un artículo de investigación (incluyendo bucles de entrenamiento en GPU y mejoras medibles en benchmarks); y un año completo de operaciones de comercio electrónico simuladas que superaron significativamente las líneas base.

Multimodal como bucle de retroalimentación continuo:

La visión no es solo una modalidad de entrada. El modelo utiliza la comprensión visual para la planificación, el monitoreo de la ejecución y la autocorrección, lo que permite tareas como recreación de captura de pantalla a código, generación interactiva de juegos/animaciones y visualización de 2D a 3D.

El modelo ocupa posiciones altas en Text Arena (quinto reportado) y Vision Arena (segundo reportado) en datos tempranos posteriores al lanzamiento.

¿Te refieres a “Qwen3-8B” o a “Qwen Max”?

- Qwen3-8B: un modelo de lenguaje de ~8 mil millones de parámetros de la serie Qwen3 (Tongyi Qianwen).
- Qwen Max: el nivel/endpoint de mayor capacidad dentro de los servicios de Qwen en Alibaba Cloud (orientado a mejor calidad frente a Plus/Turbo).

Si puedes precisar el contexto o el nombre exacto del modelo (p. ej., ID de API o la plataforma donde lo viste), puedo darte una descripción más exacta.

¿Te refieres a “Qwen3-8B” o a “Qwen Max”?

- Qwen3-8B: un modelo de lenguaje de ~8 mil millones de parámetros de la serie Qwen3 (Tongyi Qianwen).
- Qwen Max: el nivel/endpoint de mayor capacidad dentro de los servicios de Qwen en Alibaba Cloud (orientado a mejor calidad frente a Plus/Turbo).

Si puedes precisar el contexto o el nombre exacto del modelo (p. ej., ID de API o la plataforma donde lo viste), puedo darte una descripción más exacta.

Enfoque en entregables de extremo a extremo:

Énfasis en producir resultados de calidad de producción en cientos de profesiones en lugar de respuestas aisladas.

Modos de razonamiento y de inferencia rápida

Dos modos: modo de razonamiento y modo de inferencia rápida. El modo de razonamiento es para análisis más profundos y planificación compleja. El modo rápido es para respuestas de menor latencia cuando la tarea es sencilla. OpenCode de Alibaba Cloud muestra thinking habilitado para las rutas de Qwen3.8 y enumera controles de razonamiento para la ruta de vista previa, incluidos xhigh, medium y low.

Esta división es valiosa para el diseño de producto. Los equipos no deben usar el modo de razonamiento más pesado para cada solicitud. Un bot de soporte puede clasificar un ticket simple a bajo costo, resumir con un modelo más rápido y escalar al modo de razonamiento de Qwen3.8-Max solo cuando el usuario solicite una decisión de política complicada, análisis de causa raíz, revisión de contratos o plan de migración de código.

Estas capacidades se validaron mediante experimentos internos de larga duración y un conjunto integral de benchmarks que cubren agentes de codificación, agentes generales, razonamiento multimodal, comprensión de documentos y tareas de percepción/grounding.

Benchmarking: rendimiento de cuantización de datos

Alibaba publicó un extenso conjunto interno de benchmarks en GA. La verificación independiente (Artificial Analysis Intelligence Index, LMArena, etc.) aún se estaba poniendo al día en los días inmediatamente posteriores al lanzamiento; los datos tempranos de Artificial Analysis situaron a Qwen3.8-Max con un Índice de Inteligencia de 53 (puesto ~16/186 en el conjunto rastreado), con alta verbosidad y velocidad relativamente menor.

Puntuaciones oficiales/reportadas seleccionadas (Qwen3.8-Max vs pares seleccionados):

BenchmarkQwen3.8-MaxClaude Fable 5 / Opus 4.8GPT-5.6 Sol (max)Qwen3.7-Max
Terminal-Bench 2.186.684.688.874.5
PaperBench93.088.8 / 80.390.564.8
SWE-bench Pro67.780.0 / 69.264.660.6
FrontierSWE73.588.840.7
DeepSWE 1.156.670.073.021.6
IFBench82.8~63.579.1
GPQA Diamond92.692.694.192.4
OmniDocBench 1.592.1
OSWorld-Verified86.1

Qwen3.8-Max frecuentemente lidera o se sitúa cerca de la cima en razonamiento multimodal, tareas de documentos/oficina y ciertas métricas de codificación/ investigación agénticas, mientras queda por detrás de los modelos cerrados más fuertes en algunos conjuntos de agentes de ingeniería de software pura. El salto generacional en FrontierSWE y DeepSWE es especialmente notable. Considere las cifras del proveedor como direccionales; ejecuciones independientes y evaluación específica por carga de trabajo siguen siendo esenciales.

Precios de API de Qwen3.8-Max

Tarifas oficiales de Alibaba Cloud Model Studio / QwenCloud para Qwen3.8-Max (precios GA a inicios de agosto de 2026):

  • Entrada: $2.00 por 1 millón de tokens
  • Salida: $6.00 por 1 millón de tokens (incluye tokens de razonamiento)
  • Entrada en caché: aproximadamente $0.25 por 1 millón de tokens (ahorros significativos para contextos largos repetidos)

La tarificación es plana en toda la ventana de contexto de 1M de tokens — una ventaja notable frente a muchos competidores que aplican recargos por contexto largo. Pueden aplicarse descuentos por volumen y otros según la región y el plan de implementación.

Contexto comparativo (precios de lista aproximados en el mismo periodo):

  • Kimi K3: ~$3 / $15
  • Modelos de frontera superiores de Claude / GPT: a menudo $5+ / $15–25+
  • Variantes de DeepSeek V4 Flash: sustancialmente más baratas (a menudo por debajo de $0.50 combinados para muchos casos de uso)

Para equipos que ya usan múltiples proveedores, gateways agregados como CometAPI suelen ofrecer ~20% de descuento respecto a las tarifas oficiales, un único endpoint compatible con OpenAI, facturación unificada y fácil conmutación de modelo o failover. Esto hace que la experimentación con Qwen3.8-Max (y la comparación simultánea con DeepSeek V4 Flash, modelos Kimi u otros) sea operativamente más simple y a menudo más barata. Consulte las páginas de precios actuales de CometAPI y las ofertas de crédito gratuito para conocer las tarifas efectivas más recientes.

Cómo se compara Qwen3.8-Max con Kimi K3 y DeepSeek V4 Flash

DimensiónQwen3.8-MaxKimi K3DeepSeek V4 Flash
Parámetros totales / activos2.4T / ~95B~2.8T / ~104B284B / 13B
Contexto1M1M1M
MultimodalTexto + Imagen + VideoTexto + Imagen + VideoSolo texto
Precio (entrada/salida)$2 / $6$3 / $15~$0.14 / $0.28 (mucho más barato)
Pesos abiertosPlanificados (próxima semana)Ya publicadosMIT, disponibles
FortalezasAutonomía de largo horizonte, multimodal, PaperBench, precio en salidaPuntuaciones independientes sólidas, liderazgo en frontend coding ArenaEficiencia de costo extrema, codificación agéntica sólida para su tamaño
Posición relativaCompetitiva / líder en varios benchmarks de agentes y multimodalLigera ventaja en algunos índices de inteligencia auditadosExcelente relación valor; menor capacidad absoluta

Qwen3.8-Max generalmente iguala o supera a Kimi K3 en eficiencia de costo para trabajo con mucha salida y tareas multimodales, mientras que DeepSeek V4 Flash sigue siendo el rey del presupuesto para cargas de texto de alto volumen donde la capacidad máxima es secundaria. Muchos equipos usarán los tres a través de un gateway unificado, encaminando el tráfico simple a modelos de clase Flash y las sesiones de agentes complejas a Qwen3.8-Max o Kimi K3.

¿Qwen3.8-Max iguala a Kimi K3?

En algunos aspectos, sí. Igual a la categoría de contexto de 1M, tiene un posicionamiento multimodal sólido y es más barato en los precios oficiales estándar de entrada/salida. No iguala el recuento total de parámetros de 2.8T de Kimi K3, y la documentación pública de Kimi actualmente proporciona una guía especialmente detallada sobre herramientas, caché de contexto, salida estructurada y visión.

¿Qwen3.8-Max iguala a DeepSeek V4 Flash?

Compite en contexto de 1M y arquitectura MoE, pero los productos están orientados a trabajos diferentes. DeepSeek V4 Flash es la ruta rápida económica. Qwen3.8-Max es la ruta más grande y de mayor capacidad para trabajos donde la comprensión multimodal, el razonamiento avanzado y la productividad empresarial importan más que el precio por token más bajo.

¿Qué puede hacer Qwen3.8-Max?

Programación e ingeniería de software

Qwen3.8-Max es un candidato sólido para desarrollo full-stack, revisión de código, comprensión de repositorios, planificación de migraciones, diseño de APIs, depuración, razonamiento sobre pruebas y arquitectura de software. Su contexto largo ayuda cuando el modelo necesita tener a la vista muchos archivos, registros y requisitos. Úselo para tareas de código difíciles, no para cada autocompletado o explicación simple de lint.

Trabajo de oficina y del conocimiento

El posicionamiento “Cowork” del modelo importa. Los empleados de empresa no solo hacen preguntas en chat. Comparan PDFs, resumen reuniones, revisan diapositivas, interpretan hojas de cálculo, verifican contratos, redactan informes y preparan decisiones a partir de evidencia desordenada. El diseño multimodal y de largo contexto de Qwen3.8-Max lo hace adecuado para flujos de trabajo de oficina donde hay que razonar conjuntamente sobre texto, documentos, capturas de pantalla y datos estructurados.

Flujos de trabajo agénticos

Qwen3.8-Max es útil para la planificación de agentes: descomponer un objetivo en pasos, decidir qué herramienta llamar, evaluar resultados y revisar el plan. En CometAPI, esto se vuelve más práctico porque la misma aplicación puede encaminar pasos simples a modelos más baratos y reservar Qwen3.8-Max para planificación o verificación.

Cómo empezar y consejos de integración con CometAPI

  1. Acceso directo: Use QwenCloud o Alibaba Cloud Model Studio con el ID de modelo qwen3.8-max. Se admiten endpoints compatibles con OpenAI y con Anthropic.
  2. Acceso unificado vía CometAPI: Regístrese en CometAPI.com, obtenga una clave de API, establezca base_url en https://api.cometapi.com/v1, y llame con model="qwen3.8-max". La misma clave funciona para DeepSeek V4 Flash, Kimi K3, Claude, GPT y cientos de otros modelos — ideal para experimentación, control de costos y enrutamiento en producción. CometAPI enfatiza precios competitivos, baja latencia y rápida incorporación de nuevos modelos (Qwen3.8-Max se listó poco después del lanzamiento).
  3. Marcos de agentes: Conéctelo directamente a Claude Code, OpenClaw o arneses personalizados. Habilite mayor esfuerzo de razonamiento para trabajos complejos de largo horizonte.
  4. Pesos abiertos: Supervise Hugging Face / ModelScope para la próxima publicación si requiere implementaciones on‑premise o ajustes finos.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más