GPT-6 Astra is now live on CometAPI →
ai-model/Investigación de CometAPI

¿Qué es GPT-6 Astra? Especificaciones, pruebas de rendimiento, precios y acceso a la API

GPT-6 Astra: contexto de 1.05M, salida de 128K, precios de la API, mejoras en benchmarks, limitaciones y comparativas con GPT-5.6 Sol, Claude Fable 5.1, Gemini 3.8 Flash.

CometAPI
Mia MarenEquipo de investigación de modelos de IA y API
Actualizado Sep 4, 2026 17 min de lectura
¿Qué es GPT-6 Astra? Especificaciones, pruebas de rendimiento, precios y acceso a la API
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Responde primero

GPT-6 Astra es el nuevo modelo insignia de OpenAI para trabajos difíciles de extremo a extremo. OpenAI publicó GPT-6 Astra el 3 de septiembre de 2026, posicionándolo en torno al razonamiento complejo, uso de computadoras, programación, investigación, trabajo científico y creación de artefactos profesionales. El modelo de API tiene una ventana de contexto de 1.05M tokens y una salida máxima de 128K, acepta entrada de texto e imagen, y admite un esfuerzo de razonamiento desde bajo hasta máximo. El precio estándar de la API comienza en $10 de entrada / $50 de salida por millón de tokens. El cambio práctico más importante no es un salto uniforme en todos los benchmarks de inteligencia general: las mayores ganancias de Astra aparecen en ejecución agentiva, uso de computadoras, recuperación de contexto largo, flujos de trabajo de programación, ciencia y ciberseguridad.

Esto importa porque el artículo anterior de CometAPI GPT-6 Is Coming Soon — What Will It Look Like? era necesariamente especulativo. Ahora que Astra es público, esta guía se centra en el comportamiento confirmado del modelo, compromisos en benchmarks, economía de la API y dónde el modelo es realmente una mejor elección que alternativas de frontera más baratas.

¿Qué es GPT-6 Astra?

GPT-6 Astra es el sucesor del modelo insignia GPT-5.6 Sol de OpenAI. OpenAI describe a Astra como su modelo más capaz para los trabajos más difíciles de extremo a extremo, con énfasis en flujos de trabajo que requieren que el modelo razone, use herramientas, interactúe con software, revise trabajo intermedio y lleve una tarea desde una solicitud inicial hasta un resultado terminado. Ese posicionamiento es importante: Astra no es simplemente un modelo de chat más grande. Está diseñado para actuar como el motor de razonamiento dentro de agentes que trabajan a través de navegadores, terminales, documentos, hojas de cálculo, entornos de desarrollo y software empresarial.

La publicación de lanzamiento destaca resultados de vanguardia en uso de computadoras, navegación, ingeniería de software, ciberseguridad, ciencia y trabajo profesional. Reporta 97.6% / 99.9% / 100% en FrontierMath Tier 4, ARC-AGI-3 y ExploitBench respectivamente. Esas cifras llamativas no deben interpretarse como “Astra gana todos los benchmarks”. En el Artificial Analysis Intelligence Index utilizado en la propia tabla de comparación de OpenAI, Astra puntúa 61.2 mientras que Claude Fable 5.1 puntúa 65.7. Por lo tanto, el lanzamiento se entiende mejor como un cambio de nivel en ejecución y trabajo agentivo que como una victoria total en todas las medidas de inteligencia.

¿Qué cambió desde GPT-5.6 Sol?

El uso de computadoras se convirtió en una capacidad de primera clase

La ganancia generacional más clara de Astra es el uso de computadoras. En OSWorld 2.0, OpenAI reporta 72.6% para Astra frente a 65.7% para GPT-5.6 Sol. En la misma simulación de latencia, Astra completó tareas en aproximadamente 40 minutos frente a unos 75 minutos para Sol, una reducción de alrededor del 47%. Combinado con un harness de Codex actualizado, OpenAI reporta una finalización 1.9× más rápida en Mind2Web. El punto práctico no es solo que Astra pueda “ver” una pantalla; es que puede mantener coherente durante más tiempo una tarea de software de múltiples pasos mientras comete menos desvíos costosos.

La creación de artefactos profesionales es más deliberada

OpenAI entrenó explícitamente a Astra para flujos de trabajo profesionales que terminan en artefactos utilizables en lugar de prosa en bruto. Los materiales de lanzamiento describen un rendimiento más fuerte en documentos, hojas de cálculo, presentaciones, análisis de datos, trabajo de diseño y adherencia a plantillas. Astra también es mejor manteniéndose orientado cuando los requisitos cambian a mitad de tarea, por lo que un mensaje de dirección tiene menos probabilidades de sobrescribir el objetivo original. Esto es particularmente útil en agentes empresariales de larga ejecución, donde a menudo llegan nuevas instrucciones después de que el flujo de trabajo ya ha comenzado.

Las sesiones largas retienen más contexto de trabajo útil

Para sesiones largas de programación, Astra introduce una nueva forma para que Codex preserve y recupere notas después de que se llene el contexto activo. Enfoques anteriores dependían en gran medida de la compactación, que puede omitir por qué falló un intento de corrección o qué restricciones ya se probaron. OpenAI dice que Astra puede mantener notas a través de ventanas de contexto, mejorando la continuidad durante refactors grandes y sesiones de depuración.

El esfuerzo de razonamiento ahora se extiende hasta máximo

Los desarrolladores pueden elegir esfuerzo de razonamiento bajo, medio, alto, xhigh o máximo. Esto crea una curva de calidad-costo más amplia que tratar a Astra como un único punto de operación fijo. La guía oficial del modelo recomienda seleccionar el esfuerzo más bajo que cumpla su objetivo de evaluación, porque la mejor economía del modelo a menudo proviene de la eficiencia de tokens en lugar de ejecutar siempre al máximo razonamiento.

Rendimiento de benchmarks de GPT-6 Astra

OpenAI publicó una comparación amplia que abarca uso de computadoras, trabajo profesional, programación, razonamiento académico, salud, ciberseguridad, contexto largo y alineación. La forma más útil de leer la tabla es separar “inteligencia general” de “capacidad para completar trabajo usando herramientas”. Astra está solo marginalmente por encima de Sol en el Artificial Analysis Intelligence Index en la tabla de OpenAI, pero está muy por delante en varios benchmarks agentivos y operativos.

BenchmarkGPT-6 AstraGPT-5.6 SolLo que sugiere la diferencia
AutomationBench41.4%18.1%Gran ganancia en flujos de trabajo empresariales E2E
OSWorld 2.072.6%65.7%Mejor interacción con computadoras y finalización
Terminal-Bench 4.057.9%37.3%Gran ganancia en programación agentiva en terminal
Terminal-Bench Science 0.164.6%22.4%Gran mejora en flujos científicos con código/herram.
FrontierMath Tier 4 v297.6%83.0%Razonamiento matemático de frontera más sólido
ExploitBench100.0%78.5%Capacidad crítica en ciberseguridad
SRE-Bench, one attempt88.0%55.9%Mucho mejor ingeniería inversa / SRE
MRCR v2, 512K-1M96.3%73.8%Mejor recuperación de contexto muy largo
AA Intelligence Index v4.1.161.260.9Inteligencia general esencialmente plana vs Sol

El patrón es inusualmente claro. La ventaja de Astra es mayor cuando un benchmark requiere interacción sostenida con una herramienta o entorno. AutomationBench sube de 18.1% a 41.4%; Terminal-Bench Science aumenta de 22.4% a 64.6%; y MRCR de contexto largo mejora de 73.8% a 96.3% en la banda de 512K–1M. En cambio, el Artificial Analysis Intelligence Index se mueve de 60.9 a 61.2. Por eso describir a Astra como “2.5× más caro pero un poco más inteligente” pierde la verdadera propuesta de valor del producto.

¿Qué es GPT-6 Astra? Especificaciones, pruebas de rendimiento, precios y acceso a la API

Fuente: Gráfico de OpenAI AutomationBench (imagen original, no redibujada)

Benchmarks independientes: ¿es GPT-6 Astra un salto generacional?

Las pruebas independientes aportan un control de realidad importante. Artificial Analysis reporta una puntuación del Intelligence Index de 61, igual a GPT-5.6 Sol al esfuerzo máximo. Al mismo tiempo, Astra mejora notablemente en el Coding Agent Index y utiliza sustancialmente menos tokens en programación agentiva. Artificial Analysis midió aproximadamente una reducción de tokens de tres veces frente a GPT-5.6 Sol a esfuerzo máximo en su harness de Codex, permitiendo a Astra puntuar más alto a aproximadamente el mismo coste por tarea de agente de programación.

La economía se ve menos favorable en inteligencia general. Astra usa alrededor de un 10% menos de tokens de salida que Sol en el Intelligence Index a esfuerzo máximo, pero el aumento de precio por token de 2.5× domina esa ganancia de eficiencia; Artificial Analysis estima que Astra es aproximadamente un 75% más caro por tarea a esfuerzo máximo. También reporta una reducción de la tasa de alucinaciones del 92% al 51% en AA-Omniscience mientras la precisión aumentó en cuatro puntos.

La conclusión útil es específica por carga de trabajo: GPT-6 Astra parece más generacional donde un agente debe actuar, iterar, usar herramientas y terminar un trabajo complicado. Para razonamiento ordinario o generación de texto de alto volumen, la prima de precio puede ser mucho más difícil de recuperar.

GPT-6 Astra vs GPT-5.6 Sol vs Claude Fable 5.1 vs Gemini 3.8 Flash

Una comparación práctica de selección de modelos debe incluir capacidad, multimodalidad, contexto, ejecución agentiva y precio. Los modelos a continuación no son intercambiables: Astra optimiza para ejecución difícil de extremo a extremo, Claude Fable 5.1 lidera algunas medidas de inteligencia general y Gemini 3.8 Flash ofrece precios de tokens mucho más bajos con modalidades de entrada nativas más amplias.

¿Qué es GPT-6 Astra? Especificaciones, pruebas de rendimiento, precios y acceso a la API

MétricaGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Gemini 3.8 Flash
Ventana de contexto1.05M1.05M1M1.048M
Salida máxima128K128K128K65.5K
Modalidades de entradaTexto, imagenTexto, imagenTexto, imagen/PDFTexto, imagen, audio, video, PDF
AA Intelligence Index61.260.965.758.7
AutomationBench41.4%18.1%31.4%
Terminal-Bench 4.057.9%37.3%55.8%19.1%
DeepSWE 1.174.1%72.7%67.4%73.8%
FrontierMath Tier 4 v297.6%83.0%87.8%
HLE with tools57.2%65.0%
HealthBench Professional63.4%60.5%58.1%52.1%
Precio oficial estándar (entrada)$10/M$4/M$10/M$0.75/M
Precio oficial estándar (salida)$50/M$20/M$50/M$3.75/M

Cuándo GPT-6 Astra es la mejor opción

Elija Astra cuando la tarea sea costosa porque los humanos deban rescatar ejecuciones de agentes fallidas: cambios de código largos, automatización de navegador/escritorio, investigación profunda que abarque herramientas, creación de artefactos técnicos o flujos de trabajo científicos y operativos complejos. Su prima es más fácil de justificar cuando menos reintentos, menos correcciones manuales y menor uso de tokens de salida importan más que el precio por token bruto.

Cuándo Claude Fable 5.1 es la mejor opción

Claude Fable 5.1 sigue siendo un competidor de frontera serio. En la propia tabla de lanzamiento de OpenAI, obtiene 65.7 en el Artificial Analysis Intelligence Index frente a 61.2 de Astra, y 65.0 en Humanity’s Last Exam con herramientas frente a 57.2 de Astra. Eso significa que no debe promocionarse a Astra como un ganador universal de inteligencia. Si su conjunto de evaluación se parece más al razonamiento de formato largo que a la ejecución de uso de computadoras, Claude Fable 5.1 puede seguir siendo el ajuste más fuerte.

Cuándo Gemini 3.8 Flash es la mejor opción

Gemini 3.8 Flash apunta a un punto diferente en la frontera. Admite entrada de texto, imagen, audio, video y PDF con una ventana de contexto de aproximadamente 1M tokens, mientras que el precio de introducción oficial está muy por debajo de Astra. Para extracción multimodal de alto volumen, comprensión de video/audio, agentes rutinarios o cargas de trabajo donde la economía de tokens de $10/$50 es difícil de justificar, Gemini 3.8 Flash suele ser la opción de producción más económica.

Por qué importa la calificación de ciberseguridad de GPT-6 Astra

Astra es el primer modelo desplegado ampliamente por OpenAI en alcanzar el umbral de capacidad crítica en ciberseguridad bajo el Preparedness Framework de la compañía. OpenAI dice que el modelo puede identificar fallos de seguridad previamente desconocidos y desarrollar estrategias de explotación en sistemas endurecidos cuando se le proporcionan las herramientas y el acceso adecuados. En las evaluaciones de lanzamiento, Astra obtuvo 100% en ExploitBench, 42.4% en ExploitGym y 88.0% en SRE-Bench en un intento.

Esa capacidad conlleva controles de despliegue más estrictos. OpenAI dice que las salvaguardas de producción pueden ralentizar, pausar o detener trabajo legítimo, particularmente en contextos cibernéticos de mayor riesgo. ChatGPT o Codex pueden pedir a un usuario que revise una acción antes de continuar, mientras que una tarea de API puede detenerse. El despliegue predeterminado de Astra también rechaza solicitudes más avanzadas de creación de exploits; el programa Daybreak de OpenAI proporciona acceso separado y verificado para algunos flujos de trabajo defensivos.

La system card documenta una compensación de monitorización: Astra está mejor alineado en general que Sol, pero su razonamiento escrito puede ser más difícil de monitorizar en condiciones de evaluación adversarial. Por lo tanto, OpenAI despliega una monitorización de desalineación más amplia alrededor de la inferencia de Astra que usa herramientas. Los equipos empresariales deben tratar los permisos de agentes, los límites de aprobación, los registros de auditoría y el acceso a herramientas con privilegios mínimos como parte de la arquitectura del modelo y no como añadidos opcionales.

¿Qué es GPT-6 Astra? Especificaciones, pruebas de rendimiento, precios y acceso a la API

Fuente: Gráfico oficial de seguridad de honeypot de OpenAI ExploitGym (imagen original, no redibujada)

Precios de GPT-6 Astra

La página de precios actual de la API de OpenAI separa solicitudes de contexto corto y largo. Para el procesamiento Standard, las tarifas de contexto corto son $10 de entrada, $1 para entrada en caché, $12.50 para escrituras de caché y $50 de salida por millón de tokens. Las solicitudes con más de 272K tokens de entrada utilizan el esquema de precios de contexto largo: $20 de entrada, $2 para entrada en caché, $25 para escrituras de caché y $75 de salida por millón de tokens.

Procesamiento / contextoEntradaEntrada en caché / escritura de cachéSalida
Standard, contexto corto$10/M$1/M / $12.50/M$50/M
Standard, contexto largo (>272K entrada)$20/M$2/M / $25/M$75/M
Batch / Flex, contexto corto$5/M$0.50/M / $6.25/M$25/M
Batch / Flex, contexto largo$10/M$1/M / $12.50/M$37.50/M
Fast mode, contexto corto$20/M$2/M / $25/M$100/M
Fast mode, contexto largo$40/M$4/M / $50/M$150/M

En comparación con GPT-5.6 Sol, los precios de tokens Standard de contexto corto de Astra son 2.5× más altos ($10/$50 frente a $4/$20). Esa prima no significa automáticamente un coste por tarea 2.5× mayor. En programación agentiva, OpenAI y Artificial Analysis reportan menor uso de tokens de salida para Astra en algunas configuraciones. La unidad correcta de evaluación es, por lo tanto, el coste por tarea exitosa, no solo el coste por token.

Cómo acceder a GPT-6 Astra

OpenAI inició un despliegue escalonado el 3 de septiembre de 2026. Se prevé que Astra llegue a usuarios de ChatGPT Plus, Pro, Business y Enterprise, a la API de OpenAI y a AWS en los días siguientes. Los administradores empresariales pueden habilitar Astra por espacio de trabajo, y el acceso está desactivado por defecto en el lanzamiento.

Llama a GPT-6 Astra con la Responses API de OpenAI

from openai import OpenAI
client = OpenAI()

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "high"},
    input=(
        "Review this repository architecture. Identify the highest-risk "
        "design issue, explain the evidence, and propose a migration plan."
    ),
)

print(response.output_text)

El ID del modelo es gpt-6-astra. Para flujos de trabajo con muchas herramientas, la Responses API es el punto de partida natural porque Astra admite function calling, salidas estructuradas, búsqueda web, búsqueda de archivos, code interpreter, shell alojado, apply patch, uso de computadora, MCP y tool search. El fine-tuning no está actualmente soportado.

Casos de uso reales de GPT-6 Astra

Desarrollo de juegos y flujos de trabajo de software visual

Playco probó Astra dentro de Playbot, un IDE con IA que funciona directamente en Unity y Godot. OpenAI reporta 50% menos correcciones manuales que con el modelo anterior, y tres prototipos temáticos construidos desde una única base de grey-box. Este ejemplo importa porque la tarea requiere más que generación de código fuente: el modelo debe razonar sobre el diseño espacial, jugar el juego, probar cambios, identificar errores e iterar dentro de un entorno visual.

Revisión de documentos legales y financieros

OpenAI posiciona a Astra para flujos de trabajo profesionales de múltiples pasos que producen documentos, hojas de cálculo y análisis pulidos. En revisión legal y financiera, su valor práctico es mantener el estado de la tarea a través de muchos archivos, verificar evidencia cruzada y devolver un artefacto terminado en lugar de responder a una pregunta aislada. La validación de expertos, controles de aprobación y acceso a datos con privilegios mínimos siguen siendo necesarios.

Agentes de ingeniería de largo horizonte

La combinación de resultados en Terminal-Bench, DeepSWE, migración de bases de datos, uso de computadoras y contexto largo hace que Astra sea especialmente relevante para ingeniería a escala de repositorio. Un patrón de despliegue útil es dar a Astra un entorno de desarrollo restringido, un objetivo de issue o migración, pruebas y acceso a herramientas; luego evaluar el éxito en calidad de tareas fusionadas, número de iteraciones fallidas, tiempo de revisión humana y coste total. Esta es una mejor métrica de producción que un único puntaje de benchmark de programación.

Limitaciones de GPT-6 Astra

  • Precio de tokens premium. Astra cuesta 2.5× GPT-5.6 Sol por token en precios Standard de contexto corto, por lo que chat rutinario, clasificación, extracción y redacción simple suelen ser poco económicos.
  • El contexto largo tiene recargo. Las solicitudes con más de 272K tokens de entrada pasan a tarifas más altas para toda la solicitud, por lo que “contexto de 1.05M” no debe interpretarse como memoria a precio plano.
  • Sin entrada nativa de audio o video en el modelo. Astra acepta texto e imágenes y produce texto; Gemini 3.8 Flash es más flexible cuando la comprensión nativa de audio/video es central para la carga de trabajo.
  • Sin fine-tuning. La página oficial del modelo actualmente lista el fine-tuning como no soportado, por lo que la personalización se basa en prompting, herramientas, recuperación y diseño de flujo de trabajo.
  • Las salvaguardas de ciberseguridad pueden interrumpir flujos de trabajo. OpenAI advierte explícitamente que comprobaciones de seguridad adicionales pueden pausar o detener trabajo legítimo en contextos de mayor riesgo.
  • No es un ganador universal de benchmarks. Claude Fable 5.1 lidera a Astra en el Artificial Analysis Intelligence Index y en HLE con herramientas según las cifras incluidas en la comparación de lanzamiento de OpenAI.

Preguntas frecuentes

¿GPT-6 Astra está oficialmente lanzado?

Sí. OpenAI comenzó el despliegue el 3 de septiembre de 2026. La disponibilidad es escalonada entre organizaciones, planes de pago de ChatGPT, acceso a la API y AWS, en lugar de aparecer para todas las cuentas al mismo tiempo.

¿Cuál es la ventana de contexto de GPT-6 Astra?

La página oficial del modelo lista una ventana de contexto de 1.05M tokens y una salida máxima de 128K tokens. Las solicitudes de más de 272K tokens de entrada usan el esquema de precios de contexto largo.

¿Cuánto cuesta GPT-6 Astra?

El precio Standard de contexto corto es de $10 de entrada / $50 de salida por millón de tokens, con $1 para entrada en caché y $12.50 para escrituras de caché. Contexto largo, Batch/Flex y Fast mode tienen tarifas diferentes, por lo que las estimaciones de producción deben usar el nivel que coincida con la solicitud real.

¿GPT-6 Astra es mejor que Claude Fable 5.1?

Depende de la carga de trabajo. Astra lidera en varias evaluaciones de uso de computadoras, agentes de programación, ciencia, ciber y trabajo profesional, mientras que Claude Fable 5.1 lidera a Astra en el Artificial Analysis Intelligence Index y HLE con herramientas en la comparación publicada por OpenAI. Use sus propias evaluaciones de agentes/tareas en lugar de suponer que un modelo domina todas las categorías.

¿GPT-6 Astra es AGI?

Las páginas oficiales del producto de OpenAI describen a Astra como una nueva generación de inteligencia y su modelo más capaz desplegado ampliamente, pero no definen el producto en sí como “AGI”. La saturación de benchmarks en algunas tareas no equivale a una definición universal, establecida de AGI.

Conclusión

GPT-6 Astra se entiende mejor como un modelo de frontera centrado en la ejecución. Su evidencia más fuerte de progreso no es el pequeño movimiento de 60.9 a 61.2 frente a GPT-5.6 Sol en el Artificial Analysis Intelligence Index; es la mejora mucho mayor en uso de computadoras, programación agentiva, flujos de trabajo científicos, recuperación de contexto largo, finalización de tareas profesionales y ciberseguridad. La ventana de contexto de 1.05M y la pila profunda de herramientas dan a los desarrolladores más margen para crear agentes que sigan siendo útiles más allá de una sola respuesta.

La compensación es el precio. Los precios Standard de $10/$50 son premium, las solicitudes de contexto largo cuestan más y las pruebas independientes muestran que Astra puede ser significativamente más caro que Sol en cargas de trabajo de inteligencia general. El modelo merece esa prima cuando mejores tasas de finalización y menor corrección humana superan el coste de tokens. Para cargas de trabajo más simples o de alto volumen, GPT-5.6, Claude Fable 5.1 y especialmente Gemini 3.8 Flash siguen siendo alternativas relevantes en lugar de predecesores obsoletos.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Sep 4, 2026
Última actualización Sep 4, 2026
19 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más