TL;DR
Actualización de precios: Las tarifas de contexto corto de GPT-5.6 Standard ahora son $5 de entrada / $30 de salida para Sol, $2 / $12 para Terra, y $0.20 / $1.20 para Luna por cada 1 millón de tokens.
El 30 de julio de 2026, OpenAI redujo los precios de GPT-5.6 Terra en un 20% y los de Luna en un 80%. El precio de Sol no cambió.
Atención a los impulsores de costo ocultos: el alias genérico gpt-5.6 enruta a Sol, las solicitudes por encima de 272K tokens de entrada usan tarifas más altas de contexto largo, y los tokens de salida siguen costando 6× más que los tokens de entrada en los tres niveles.
Para cargas de trabajo de Sol sensibles a la latencia, el nuevo Fast mode de OpenAI ofrece hasta 2.5× más velocidad de procesamiento a 2× el precio Standard.
Precios de la API de OpenAI de un vistazo
Para usuarios que buscan en general los precios de la API de OpenAI, la primera pregunta suele ser: ¿qué modelo actual estoy pagando realmente? La siguiente tabla presenta una vista compacta de varios modelos de texto actuales de OpenAI antes de analizar más de cerca GPT-5.6.
(> Actualización de precios — 30 de julio de 2026: OpenAI redujo los precios de la API de GPT-5.6 Terra en un 20% y los de Luna en un 80%. Terra ahora cuesta $2 por 1M tokens de entrada y $12 por 1M tokens de salida, mientras que Luna cuesta $0.20 de entrada y $1.20 de salida. El precio de Sol permanece sin cambios).
| Modelo | Entrada / 1M tokens | Entrada en caché | Salida / 1M tokens |
|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $30.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $12.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $1.20 |
| gpt-5.5 | $5.00 | $0.50 | $30.00 |
| gpt-5.4 | $2.50 | $0.25 | $15.00 |
| gpt-5.4-mini | $0.75 | $0.075 | $4.50 |
| gpt-5.4-nano | $0.20 | $0.02 | $1.25 |
A su nuevo precio, Luna iguala la tarifa de entrada de $0.20 de GPT-5.4 nano y ofrece una tarifa de salida ligeramente menor de $1.20 frente a $1.25.
Fuente*:* OpenAI API pricing
El patrón más importante es fácil de pasar por alto: los tokens de salida de GPT-5.6 cuestan 6× más que los tokens de entrada en Sol, Terra y Luna. Las respuestas largas, los agentes verbosos y los flujos de trabajo con mucho razonamiento pueden por tanto aumentar los costos más rápido que pequeños cambios en la longitud del prompt.
Para una visión más amplia de la familia GPT-5.6 —incluyendo capacidades del modelo, posicionamiento, benchmarks, acceso a la API y funciones clave de lanzamiento— consulta el anuncio de GPT-5.6 de OpenAI o la guía de GPT-5.6 de CometAPI. Este artículo se centra específicamente en precios, cálculos de costos y los factores que pueden afectar tu factura real de la API.
Precios de GPT-5.6: Sol vs Terra vs Luna
GPT-5.6 introduce tres niveles de precios. OpenAI posiciona Sol como la ruta insignia, Terra como la opción equilibrada y Luna como el nivel de menor costo para cargas de alto volumen.
Para un análisis más profundo de las capacidades, cómo acceder a la API de GPT-5.6 y los casos de uso de cada modelo, detalles para ver aquí sobre el modelo GPT-5.6.
Precios Standard de GPT-5.6 para solicitudes con ≤272K tokens de entrada
| Modelo | Entrada corta | Entrada en caché | Escritura de caché | Salida corta | Entrada larga | Entrada larga en caché | Escritura de caché (larga) | Salida larga |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $2.00 | $0.20 | $2.50 | $12.00 | $4.00 | $0.40 | $5.00 | $18.00 |
| gpt-5.6-luna | $0.20 | $0.02 | $0.25 | $1.20 | $0.40 | $0.04 | $0.50 | $1.80 |
Fuente*:* OpenAI API pricing
Precios de contexto largo: Las solicitudes con más de 272K tokens de entrada usan tarifas más altas. La entrada, la entrada en caché y las escrituras de caché se facturan a 2× la tarifa estándar, mientras que la salida se factura a 1.5×. Las tarifas más altas se aplican a toda la solicitud.
Un punto de partida razonable es probar Luna para tareas más simples y de alto volumen, Terra para cargas de trabajo de aplicación equilibradas y Sol para las tareas más difíciles o de mayor impacto. Estas no son recomendaciones universales: la precisión, los reintentos, el comportamiento de las herramientas y la revisión humana pueden pesar más que la diferencia en el precio de lista.
Un detalle importante del alias
La guía de modelos de OpenAI indica que el alias genérico gpt-5.6 enruta a gpt-5.6-sol.
Eso significa que una solicitud enviada a gpt-5.6 usa el nivel de precio de Sol. Si tu carga de trabajo funciona bien en Terra o Luna, utiliza el ID de modelo explícito en lugar de asumir que el alias genérico selecciona el nivel más económico adecuado.
Ejemplo 1: Una solicitud típica de API
Comencemos con una forma común de solicitud:
- 1,000 tokens de entrada
- 500 tokens de salida
| Modelo | Costo mensual de entrada | Costo mensual de salida | Total |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $4,000 | $6,000 | $10,000 |
| gpt-5.6-luna | $400 | $600 | $1,000 |
Bajo esta carga, el nuevo precio de Luna reduce la factura mensual estimada de tokens de $5,000 a $1,000, mientras que Terra baja de $12,500 a $10,000.
Cálculo para Sol:
(1,000 / 1,000,000 × $5) + (500 / 1,000,000 × $30) = $0.020
Este ejemplo también muestra por qué importa la longitud de la salida. Aunque la solicitud contiene el doble de tokens de entrada que de salida, la parte de salida representa el 75% del costo de tokens de Sol porque la salida se tarifa a seis veces la tasa de entrada.
Para chat, agentes y generación de código, controlar la verbosidad innecesaria a veces puede ahorrar más que recortar un pequeño prompt del sistema.
Ejemplo 2: Costo mensual a escala
Ahora supongamos que una aplicación maneja 1 millón de solicitudes por mes, con un promedio de:
- 2,000 tokens de entrada por solicitud
- 500 tokens de salida por solicitud
Eso equivale a 2 mil millones de tokens de entrada y 500 millones de tokens de salida por mes.
| Modelo | Costo mensual de entrada | Costo mensual de salida | Total |
|---|---|---|---|
| gpt-5.6-sol | $10,000 | $15,000 | $25,000 |
| gpt-5.6-terra | $5,000 | $7,500 | $12,500 |
| gpt-5.6-luna | $2,000 | $3,000 | $5,000 |
La diferencia es lo suficientemente grande como para justificar pruebas de enrutamiento, pero la fila más baja no es automáticamente la mejor elección en producción. Si un modelo más barato provoca más reintentos, tareas fallidas o revisión manual, el costo total del flujo de trabajo puede ser mayor.
Precios de contexto largo: ¿Qué pasa por encima de 272K tokens?
Los modelos GPT-5.6 admiten una ventana de contexto de 1.05M tokens, pero OpenAI aplica tarifas más altas cuando una solicitud contiene más de 272,000 tokens de entrada.
Para estas solicitudes de contexto largo:
- la entrada se cobra a 2× la tarifa de contexto corto
- la entrada en caché y las escrituras de caché también se cobran a 2×
- la salida se cobra a 1.5×
- Las tarifas más altas se aplican a toda la solicitud, no solo a los tokens por encima de 272K
Para Sol, eso cambia la entrada de $5 a $10 por 1M tokens y la salida de $30 a $45. La misma estructura de multiplicadores se aplica a Terra y Luna.
Esto crea un “precipicio” de costos cerca de 272K. Para cargas de trabajo cercanas al umbral, reduce fragmentos de recuperación duplicados, historial de conversación obsoleto, archivos de repositorio innecesarios o salida verbosa de herramientas antes de enviar la solicitud. Consulta la guía de optimización de costos de OpenAI para orientación adicional sobre reducción de tokens.
Precios de Standard, Batch, Flex y Priority
Para cargas de trabajo de texto elegibles de GPT-5.6, OpenAI ofrece múltiples niveles de procesamiento.
| Nivel | Sol entrada/salida | Terra entrada/salida | Luna entrada/salida | Uso típico |
|---|---|---|---|---|
| Standard | $5 / $30 | $2 / $12 | $0.20 / $1.20 | Tráfico sincrónico normal |
| Batch | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Trabajos asincrónicos offline |
| Flex | $2.50 / $15 | $1 / $6 | $0.10 / $0.60 | Cargas sensibles al costo que toleran procesamiento más lento |
| Fast mode | $10 / $60 | $4 / $24 | $0.40 / $2.40 | Tráfico de contexto corto sensible a la latencia |
Batch y Flex siguen siendo aproximadamente un 50% más baratos que los precios Standard. Priority Processing pasó a llamarse Fast mode el 30 de julio de 2026, aunque las solicitudes existentes que usan service_tier: "priority" siguen siendo compatibles.
Para GPT-5.6 Sol, Fast mode proporciona hasta 2.5× más velocidad de procesamiento que Standard a 2× el precio de tokens Standard, sin cambios en la inteligencia del modelo. Es más apropiado cuando la latencia de cara al usuario importa lo suficiente como para justificar el recargo.
Caché de prompts: ¿Cuándo ahorra dinero en GPT-5.6?
Para GPT-5.6, las escrituras de caché cuestan 1.25× la tarifa normal de entrada, mientras que las lecturas en caché reciben el precio menor de entrada en caché.
Considera un prefijo reutilizable de 100,000 tokens en Sol:
| Acción | Costo |
|---|---|
| Procesarlo una vez como entrada sin caché | $0.50 |
| Escribir el prefijo en caché | $0.63 |
| Leer el prefijo en caché posteriormente | $0.05 |
Dos usos sin caché cuestan $1.00. Una escritura de caché más una lectura en caché coincidente cuestan $0.675, ahorrando $0.325 en este ejemplo simplificado.
Límite de este ejemplo: Este cálculo compara solo el costo de entrada del prefijo reutilizable. No incluye tokens de salida, otra entrada sin caché, herramientas o reintentos. El ahorro real depende de si el prefijo cumple los requisitos de caché y de cuántas veces se reutiliza realmente.
La caché es por tanto más útil para prefijos de prompt largos y estables que reciben solicitudes repetidas y coincidentes. Una escritura de caché que nunca se reutiliza añade costo en lugar de reducirlo.
La guía de caché de prompts de OpenAI documenta los precios de las escrituras de caché, las lecturas en caché, los puntos de ruptura explícitos y el comportamiento de TTL.
Otros costos que pueden cambiar tu factura de la API de OpenAI
Tokens de razonamiento y Pro mode
Los tokens de razonamiento se facturan como tokens de salida incluso cuando no se muestran como texto de respuesta visible. Configuraciones de razonamiento más altas pueden por tanto aumentar el uso total de tokens de salida y la latencia.
Donde esté disponible, reasoning.mode = "pro" conviene tratarlo como una configuración para evaluar, no como una regla predeterminada de ahorro de costos o calidad. OpenAI no indica un recargo fijo de Pro separado para este modo; el impacto en costos proviene del uso de tokens resultante. Un punto de partida razonable es probar Standard y Pro en tareas representativas y comparar el éxito de la tarea, los tokens de salida totales, la latencia y los reintentos.
Búsqueda web y otras herramientas
OpenAI actualmente lista la búsqueda web estándar a $10 por 1,000 llamadas, además de tokens de contenido de búsqueda facturados a la tarifa del modelo seleccionado. Dos búsquedas web en una solicitud pequeña de Luna pueden por tanto costar más que los tokens de modelo de la solicitud.
OpenAI también lista un precio separado de vista previa de búsqueda web para modelos sin razonamiento a $25 por 1,000 llamadas, con tokens de contenido de búsqueda gratuitos. Verifica la combinación exacta de herramienta y modelo en la página oficial de precios en lugar de aplicar una sola tarifa de búsqueda web a todos los endpoints.
Procesamiento regional
Los endpoints de procesamiento regional o residencia de datos elegibles para modelos lanzados a partir del 5 de marzo de 2026 llevan un recargo del 10% según la página de precios de OpenAI. Los equipos empresariales con requisitos de residencia deberían incluir ese factor en sus estimaciones de presupuesto.
Cómo calcular el costo de la API de OpenAI
Para una solicitud básica:
Costo de tokens =
(tokens de entrada / 1M × tarifa de entrada)
- (tokens de salida / 1M × tarifa de salida)
Para la planificación de producción, amplíalo para incluir:
Costo total del flujo de trabajo =
entrada sin caché
- entrada en caché
- escrituras de caché
- tokens de salida y de razonamiento
- tarifas de herramientas
- ajustes por nivel de servicio
- recargo regional, si corresponde
- reintentos y solicitudes de respaldo
El KPI más útil suele ser:
Costo por tarea exitosa = costo total del flujo de trabajo / tareas exitosas
Esto evita que una tarifa de tokens más barata parezca artificialmente atractiva cuando también produce más fallos o trabajo de revisión.
Cómo elegir el modelo adecuado sin pagar de más
Utiliza la tabla de precios como punto de partida y luego prueba en tareas reales.
- Comienza con el modelo de menor costo que parezca capaz de la tarea. Luna puede ser una primera prueba sensata para trabajos simples y de alto volumen, pero no asumas que será el mejor para cada extracción o resumen.
- Mide la longitud de la salida. Los tokens de salida de GPT-5.6 cuestan 6× los tokens de entrada, por lo que las respuestas verbosas merecen atención.
- Vigila el umbral de 272K. Superarlo cambia las tarifas de toda la solicitud.
- Usa Batch o Flex para trabajo no urgente elegible. Prueba las restricciones operativas antes de mover tráfico de producción.
- Caché solo prefijos reutilizables. Mide los aciertos de caché reales en lugar de asumir que un prompt largo debe cachéarse.
- Controla herramientas y reintentos. Pueden borrar el ahorro de un modelo más barato.
Para equipos que comparan rutas entre proveedores, los precios de CometAPI proporcionan una vista activa entre modelos. El Quickstart de CometAPI y el Cookbook pueden utilizarse para ejecutar el mismo conjunto de pruebas en múltiples rutas compatibles con OpenAI.
Preguntas frecuentes
¿Cuánto cuesta GPT-5.6 en 2026?
El precio depende del modelo. Las tarifas Standard de contexto corto de GPT-5.6 van desde $1 de entrada / $6 de salida por 1M tokens para Luna hasta $5 / $30 para Sol. También hay modelos de menor costo como GPT-5.4 mini y nano. Consulta el modelo exacto en la página de precios en vivo de OpenAI.
¿El precio de la API de ChatGPT es el mismo que el de GPT-5.6?
“Precio de la API de ChatGPT” se usa a menudo de forma informal para referirse al precio de la API de modelos con capacidad de chat de OpenAI, pero las suscripciones de ChatGPT y la facturación de la API son productos separados. El uso de la API se tarifa por el modelo específico y el tipo de uso.
¿Cuál es el modelo más barato de GPT-5.6?
gpt-5.6-luna es el modelo más barato de GPT-5.6, con un precio de $0.20 por 1M tokens de entrada y $1.20 por 1M tokens de salida. OpenAI redujo ambas tarifas en un 80% el 30 de julio, haciendo a Luna sustancialmente más económico para agentes de alto volumen, clasificación, procesamiento de documentos y flujos de trabajo de herramientas bien definidos.
¿Qué modelo usa gpt-5.6?
La guía de modelos de OpenAI indica que el alias gpt-5.6 enruta a gpt-5.6-sol. Utiliza IDs de modelo explícitos de Terra o Luna cuando quieras esos niveles.
¿Cuándo aplica el precio de contexto largo de GPT-5.6?
Cuando la entrada supera 272,000 tokens, GPT-5.6 usa tarifas más altas de contexto largo para toda la solicitud: 2× las tarifas relacionadas con la entrada y 1.5× las tarifas de salida.
¿Batch y Flex son más baratos que Standard para GPT-5.6?
Para cargas de trabajo elegibles de GPT-5.6, las tarifas de tokens listadas de Batch y Flex son aproximadamente un 50% inferiores a Standard. Tienen características de procesamiento diferentes, así que confirma que la carga de trabajo puede tolerar esas restricciones.
¿Las escrituras de caché tienen costo extra en GPT-5.6?
Sí. Las escrituras de caché de GPT-5.6 se tasan a 1.25× la entrada normal, mientras que las lecturas coincidentes en caché usan la tarifa descontada de entrada en caché. El ahorro depende de la reutilización real.
Compara los costos de GPT-5.6 en tu propia carga de trabajo
Las tablas de precios son un punto de partida. Tu costo real depende de los prompts, la longitud de la salida, la tasa de aciertos de caché, las herramientas, los reintentos y el éxito de las tareas.
Con CometAPI, puedes probar GPT-5.6 Sol, Terra, Luna y otros modelos a través de una API compatible con OpenAI usando la misma carga de trabajo.
Próximos pasos: compara los precios actuales de modelos, sigue el Quickstart de CometAPI o usa el CometAPI Cookbook para construir evaluaciones de modelos repetibles.
Elige la ruta de menor costo que aún cumpla tus requisitos de calidad, latencia y confiabilidad.
