Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/Investigación de CometAPI

Precio de GPT-6.1 Sol: tarifas de la API, tokens en caché, contexto largo y costo de CometAPI

Compare los precios de la API GPT-6.1 Sol, las lecturas y escrituras de caché, las tarifas de contexto largo, los niveles de procesamiento, los costos de CometAPI y el costo por tarea aceptada.

CometAPI
Deon GoodwinEquipo de investigación de modelos de IA y API
Actualizado Oct 10, 2026 17 min de lectura
Precio de GPT-6.1 Sol: tarifas de la API, tokens en caché, contexto largo y costo de CometAPI
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

GPT-6.1 Sol es el modelo de razonamiento de OpenAI para codificación compleja, uso de computadoras y flujos de trabajo profesionales. Mantiene las tarifas oficiales de entrada nueva y salida de GPT-6 Sol Standard en $2/$10 por millón de tokens, mientras reduce las lecturas de caché de contexto corto de $0.20 a $0.10. La reutilización exitosa de caché puede reducir los costos de contexto repetido. La entrada por encima de 272K tokens activa tarifas más altas para toda la solicitud, así que estime cada solicitud antes de agregar una factura. CometAPI tiene un programa de puerta de enlace por separado.

Puntos clave

  • Separe entrada nueva, lecturas de caché, escrituras en caché y salida facturada; la salida incluye tokens de razonamiento.
  • Utilice la banda de contexto correcta para cada solicitud. Una capacidad de contexto de 1.05M no implica precios de contexto corto.
  • Compare OpenAI y CometAPI usando la misma composición de tokens y las condiciones de facturación aplicables a la cuenta.
  • Elija el modo de procesamiento según latencia, disponibilidad y soporte de la ruta.
  • Evalúe la economía del agente por el costo total por tarea aceptada, incluyendo intentos no exitosos.

¿Cuál es el precio de GPT-6.1 Sol de un vistazo?

Todos los precios por token a continuación son USD por millón de tokens. La tabla oficial de precios por token proporciona la referencia base de OpenAI; las lecturas y escrituras de caché son categorías de facturación separadas. Las bandas de contexto se refieren a los tokens de entrada en una solicitud individual.

Modo de OpenAI / banda de entradaEntrada nuevaLectura de cachéEscritura en cachéSalida
Standard: como máximo 272K$2.00$0.10$2.50$10.00
Standard: por encima de 272K$4.00$0.20$5.00$15.00
Batch/Flex: como máximo 272K$1.00$0.05$1.25$5.00
Batch/Flex: por encima de 272K$2.00$0.10$2.50$7.50
Fast: como máximo 272K$4.00$0.20$5.00$20.00
Fast: por encima de 272K$8.00$0.40$10.00$30.00
Ultrafast: como máximo 272K$12.00$0.60$15.00$60.00
Ultrafast: por encima de 272K$24.00$1.20$30.00$90.00

Tarifas de nivel de procesamiento de OpenAI verificadas el 9 de octubre de 2026; la comparación con CometAPI conserva la tabla de precios de puerta de enlace del artículo fuente. Estas son tarifas de niveles de procesamiento de OpenAI, no una garantía de que cada nivel esté expuesto a través de un gateway. El procesamiento regional agrega un 10% donde corresponda. Confirme el servicio seleccionado y las condiciones de la cuenta antes de presupuestar.

Para los desarrolladores que acceden a GPT-6.1 Sol a través de CometAPI, la tarifa de contexto estándar es más baja que el precio Standard directo de OpenAI.

Categoría de tokensCometAPIOpenAI StandardDiferencia
Entrada / 1M$1.60$2.0020% menos
Entrada en caché / 1M$0.08$0.1020% menos
Escritura en caché / 1M$2.00$2.5020% menos
Salida / 1M$8.00$10.0020% menos

Para solicitudes de contexto largo, la API de GPT-6.1 Sol en CometAPI usa:

Tokens de contexto largoCometAPIOpenAI
Entrada / 1M$3.20$4.00
Entrada en caché / 1M$0.16$0.20
Escritura en caché / 1M$4.00$5.00
Salida / 1M$12.00$15.00

Eso preserva una diferencia de precio aproximada del 20% en las principales categorías de tokens. Para el presupuesto, esto importa porque una carga de trabajo de producción rara vez consiste solo en tokens de entrada nueva. Una vez que se incluyen contexto en caché, generación de salida y solicitudes de contexto largo, comparar solo la tarifa de entrada promocionada puede subestimar significativamente la diferencia entre rutas.

La tabla de precios por token de CometAPI proporciona la referencia del gateway. Con 100K de entrada nueva y 10K de salida facturada, OpenAI Standard cuesta $0.30; la tabla correspondiente de CometAPI cuesta $0.24. En 10,000 solicitudes idénticas, los totales solo por tokens son $3,000 y $2,400. Esta comparación excluye herramientas, escrituras de caché, reintentos y recargos.

GPT-6.1 Sol está posicionado para codificación compleja, uso de computadoras y flujos de trabajo profesionales. Su ventana de contexto de 1,050,000 tokens y salida máxima de 128,000 tokens son límites de capacidad, no una promesa de facturación de contexto corto: las solicitudes por encima de 272K tokens de entrada usan tarifas más altas. Acepta texto e imágenes y produce texto; use Responses API para llamadas a herramientas, mientras que Chat Completions admite solicitudes sin herramientas. Verifique por separado el soporte de herramientas del gateway y los niveles de procesamiento al elegir una ruta.

Gastos adicionales del agente con GPT-6.1 Sol

El presupuesto de un agente también incluye herramientas alojadas, entornos de ejecución, almacenamiento y cargos por servicios externos. OpenAI lista llamadas de búsqueda web a $10 por 1,000 llamadas. El contenido recuperado de la búsqueda se factura a tarifas de tokens del modelo. Las llamadas de búsqueda de archivos cuestan $2.50 por 1,000; el almacenamiento es $0.10 por GB por día después de la franquicia gratuita de 1 GB.

Hosted Shell y Code Interpreter usan cargos de contenedor separados bajo el mismo programa de precios de OpenAI citado arriba. La tarifa publicada de 1 GB es $0.03 por sesión de 20 minutos por contenedor; las sesiones elegibles usan facturación por minuto con un mínimo de cinco minutos. Use los términos reales de herramientas y ejecución del gateway seleccionado en lugar de suponer que estos cargos de servicio directo aplican sin cambios.

Esfuerzo de razonamiento y gasto total de GPT-6.1 Sol

El esfuerzo de razonamiento no es una tarifa separada en la tabla de tokens, pero puede alterar la salida facturada, el uso de herramientas, la longitud de la trayectoria y los reintentos. Compare esfuerzos compatibles desde bajo hasta máximo en el mismo conjunto de tareas. Registre el uso en lugar de estimar el costo de razonamiento solo por la longitud visible de la respuesta.

¿Cómo cambia el umbral de 272K el costo de GPT-6.1 Sol?

Cuando la entrada excede 272K tokens, OpenAI aplica tarifas de contexto largo a la solicitud completa: las tarifas de entrada y de caché se duplican, mientras que la salida aumenta un 50%. El umbral de entrada aplica incluso cuando gran parte de la entrada proviene de caché.

Carga de trabajoEntrada nuevaSalida facturadaOpenAI StandardCatálogo de CometAPI
Análisis pequeño20K2K$0.06$0.048
Revisión de documentos100K10K$0.30$0.24
Por debajo del umbral270K10K$0.64$0.512
Por encima del umbral280K10K$1.27$1.016
Análisis de repositorio300K20K$1.50$1.20
270K input: 0.27 x $2 + 0.01 x $10 = $0.64
280K input: 0.28 x $4 + 0.01 x $15 = $1.27
Input grows about 3.7%; token cost grows about 98.4%.

Estas son solicitudes independientes sin cargos de caché, herramientas, reintentos ni recargos. El efecto del umbral es la razón por la que la selección de contexto importa incluso cuando el modelo tiene suficiente capacidad para todo el repositorio.

¿Cómo cambia el almacenamiento en caché del prompt los costos de entrada de GPT-6.1 Sol?

Las lecturas de caché de Standard en contexto corto cuestan $0.10/M frente a $2/M de entrada nueva. Una lectura exitosa es por tanto un 95% más barata para esa categoría de tokens. Una escritura en caché cuesta $2.50/M. Los ahorros dependen de la reutilización exitosa del prefijo en caché, no simplemente de repetir texto similar.

Considere diez solicitudes que comparten un prefijo de 100K tokens. Cada una se mantiene en la banda de contexto corto. El caso controlado con caché escribe el prefijo completo una vez y lo lee con éxito nueve veces, sin escrituras adicionales. El prefijo de 100K tokens de la primera solicitud se factura solo a la tarifa de escritura en caché; esos mismos tokens no se cobran también a la tarifa de entrada nueva.

Costo de prefijo repetidoSin cachéUna escritura + nueve lecturas
Entrada de prefijo nueva10 x 0.1 x $2 = $2.00$0.00
Escritura en caché$0.000.1 x $2.50 = $0.25
Lecturas de caché$0.009 x 0.1 x $0.10 = $0.09
Subtotal del prefijo$2.00$0.34

La reducción de $1.66 es el 83% de este costo de prefijo repetido. No es una reducción del 83% en una factura típica de API. Si cada solicitud también genera 2K tokens de salida facturada, la salida agrega $0.20 a lo largo de las diez solicitudes: los totales pasan a $2.20 y $0.54, una reducción de alrededor del 75.5%. Nueva entrada, fallos de caché, escrituras extra, herramientas y bandas de contexto largo cambian el resultado.

Bajo estas suposiciones simplificadas de contexto corto, escribir una vez más N-1 lecturas cuesta 0.25 + 0.01(N-1) dólares para un prefijo de 100K, comparado con 0.20N sin caché. Dos solicitudes son suficientes para hacer que el caso modelado con caché sea más barato, siempre que la segunda solicitud realmente acierte y no cambien otros costos.

¿Cómo se compara el precio de GPT-6.1 Sol con GPT-6 Sol y GPT-6 Astra?

OpenAI documenta las especificaciones de GPT-6 Sol. La reducción de lectura de caché es una comparación de tarifas, no prueba de un costo total de tarea más bajo.

Comparación oficial en Standard (contexto corto)GPT-6.1 SolGPT-6 SolGPT-6 Astra
Entrada nueva / 1M tokens$2.00$2.00$10.00
Lectura de caché / 1M tokens$0.10$0.20$1.00
Escritura en caché / 1M tokens$2.50$2.50$12.50
Salida / 1M tokens$10.00$10.00$50.00
Ventana de contexto / salida máxima1.05M / 128K1.05M / 128K1.05M / 128K

GPT-6.1 Sol reduce a la mitad la tarifa de lectura de caché en contexto corto. La entrada nueva, las escrituras y la salida no cambian. El beneficio máximo depende de qué proporción de su factura consiste en lecturas de caché exitosas. Vuelva a probar configuraciones de esfuerzo, bucles de herramientas y resultados de tareas al migrar.

Comparado con GPT-6 Sol, GPT-6.1 Sol mantiene las mismas tarifas de entrada nueva, escritura en caché y salida, mientras reduce las lecturas de caché en un 50%. Comparado con GPT-6 Astra, use las tarifas anteriores junto con la calidad de la tarea medida y el costo total de la trayectoria.

La tabla de tarifas de GPT-6 Astra sitúa a Astra en un nivel de precios por token superior.

GPT-6.1 Sol es 80% más barato para entrada nueva, escrituras en caché y salida, y 90% más barato para lecturas de caché en esta banda. Estas proporciones no establecen una calidad equivalente. Astra puede justificar su prima si mejores resultados aceptados compensan el gasto adicional; GPT-6.1 Sol puede ser preferible cuando cumple el mismo objetivo de aceptación a menor costo.

Compare parches de repositorios, análisis de documentos y tareas de uso de computadora por separado. Mantenga constantes los prompts, permisos de herramientas, configuraciones de esfuerzo, límites de reintentos y verificaciones de aceptación. Registre fallos sin resolver así como resultados exitosos; no infiera una clasificación universal de codificación o investigación a partir de los precios por token.

¿Cuánto cuesta GPT-6.1 Sol en cargas de trabajo reales de API?

Calcule el costo por solicitud con su banda y modo de procesamiento reales, luego sume los resultados. La entrada nueva excluye lecturas de caché; no cobre los mismos tokens de entrada como nuevos y en caché. Use los registros de uso del proveedor para distinguir escrituras de otras entradas. En la fórmula siguiente, fresh_input excluye tanto cache_reads como cache_writes. Los tokens cargados a la tarifa de escritura de caché no deben contarse también como entrada nueva. Trate las tres cantidades como categorías de facturación mutuamente excluyentes y concílielas con los registros de uso del proveedor.

request_token_cost =
  fresh_input / 1_000_000 * fresh_rate
+ cache_reads / 1_000_000 * read_rate
+ cache_writes / 1_000_000 * write_rate
+ billed_output / 1_000_000 * output_rate

period_total = sum(request_token_cost) + other_charges

Uso agregado a través de múltiples solicitudes cortas

Diez solicitudes que usan cada una 100K de entrada nueva y 20K de salida facturada agregan 1M de entrada y 200K de salida. Cada solicitud individual permanece por debajo de 272K de entrada y por debajo del límite de salida de 128K. OpenAI Standard totaliza $4.00; CometAPI totaliza $3.20. La diferencia del 20% aplica solo a estas categorías de tokens modeladas. Esto no es una sola solicitud con 1M de entrada y 200K de salida.

Un período con uso intensivo de caché y escrituras facturadas por separado

Suponga que un período registra 1M de entrada nueva, 5M de lecturas de caché, 500K de salida facturada y 500K de escrituras de caché. Todas las solicitudes componentes permanecen en la banda Standard de contexto corto. OpenAI cuesta $2.00 + $0.50 + $5.00 + $1.25 = $8.75. CometAPI cuesta $1.60 + $0.40 + $4.00 + $1.00 = $7.00. Estas categorías son cantidades de facturación distintas; el ejemplo no asume que toda la entrada repetida sea un acierto de caché.

Una solicitud de contexto largo

Una solicitud con 400K de entrada nueva y 100K de salida facturada usa tarifas de contexto largo. OpenAI Standard cuesta 0.4 x $4 + 0.1 x $15 = $3.10. CometAPI cuesta 0.4 x $3.20 + 0.1 x $12 = $2.48. Ambas excluyen nuevas escrituras de caché y cargos no relacionados con tokens. La cantidad de salida de 100K incluye razonamiento y debe ajustarse al presupuesto de salida del modelo.

¿Cómo cambian Standard, Batch, Flex, Fast y Ultrafast el costo de GPT-6.1 Sol?

Para una solicitud de 300K de entrada nueva y 20K de salida facturada, use la banda de contexto largo.

Modo de OpenAICosto de entradaCosto de salidaSubtotal de tokens
Batch/Flex$0.60$0.15$0.75
Standard$1.20$0.30$1.50
Fast$2.40$0.60$3.00
Ultrafast$7.20$1.80$9.00

Cálculo de Ultrafast: 0.30M de entrada nueva x $24/M + 0.02M de salida facturada x $90/M = $7.20 + $1.80 = $9.00. Esto usa la banda de contexto largo y excluye cargos de caché, herramientas y regionales.

Batch es adecuado para evaluaciones offline, enriquecimiento, backfills y procesamiento de documentos por lotes. Flex ofrece tarifas más bajas para cargas de trabajo elegibles que toleran procesamiento y disponibilidad variables. Standard es la base para solicitudes interactivas. Fast duplica las tarifas de tokens aplicables; selecciónelo cuando la reducción de espera tenga un valor medible.

Ultrafast prioriza la latencia a un precio de token más alto. Para GPT-6.1 Sol, establezca service_tier en ultrafast en solicitudes de Responses. OpenAI recomienda WebSockets para bucles rápidos de herramientas de agentes; verifique los límites específicos del nivel y el soporte del gateway antes de enrutar tráfico de producción. Las tarifas provienen de la tabla de precios oficial de OpenAI.

Estas tarifas no prueban que cada nivel esté habilitado para su cuenta de gateway. Verifique el enrutamiento compatible y las restricciones regionales antes del despliegue. No presupuestar una opción de procesamiento no tarifada o no disponible como si ya tuviera la tarifa Standard.

¿Por qué el costo por tarea exitosa de GPT-6.1 Sol es la mejor métrica?

Divida el gasto total medido de modelo, herramientas y ejecución en un conjunto de evaluación por resultados aceptados. Incluya intentos fallidos en el numerador. Informe por separado el tiempo de corrección humana y los fallos sin resolver para que el costo no mejore simplemente abandonando tareas más difíciles.

observed_cost_per_accepted_task =
  all_evaluation_model_tool_execution_cost / accepted_tasks

A modo de ilustración, un intento de $0.40 con una probabilidad de éxito del 60% tiene un costo esperado de $0.40 / 0.60 = aproximadamente $0.67 hasta el éxito. Un intento de $0.55 con una probabilidad del 85% cuesta alrededor de $0.65 bajo el mismo modelo. Estas son cifras hipotéticas, no resultados de referencia ni afirmaciones sobre un modelo en particular.

Esa estimación supone reintentos independientes con costo y probabilidad de éxito sin cambios, continuando hasta lograrlo. No agregue un segundo cupo de reintentos: la división ya tiene en cuenta las repeticiones. Fallos correlacionados, reintentos limitados, diferente dificultad de tareas, herramientas e intervención humana pueden hacer que este modelo no sea adecuado. Use el costo observado por tarea aceptada para decisiones de producción.

¿Cómo puede reducir los costos de la API de GPT-6.1 Sol?

Maximice los prefijos de prompt reutilizables. Ponga instrucciones de sistema estables, definiciones de herramientas, esquemas y contexto de fondo en prefijos reutilizables. El precio de entrada en caché de GPT-6.1 Sol de $0.10/M hace que el contexto repetido sea barato en relación con la entrada nueva.

Mantenga las solicitudes por debajo de 272K cuando el contexto completo no sea necesario. Cruzar 272K tokens de entrada cambia los precios de toda la solicitud. La recuperación, compresión de contexto y carga selectiva de archivos pueden reducir el costo incluso cuando el modelo soporta técnicamente una ventana de contexto de 1.05M.

Use Batch para flujos de trabajo asincrónicos en bloque. Las evaluaciones offline, enriquecimiento, backfills y procesamiento de documentos por lotes pueden usar Batch cuando los resultados no necesitan regresar inmediatamente.

Use Flex para solicitudes de baja prioridad que toleren respuestas más lentas y disponibilidad ocasional. Planifique retrasos y reintentos; verifique las cargas de trabajo elegibles y el soporte de la ruta. Batch y Flex usan las tarifas más bajas mostradas arriba, pero atienden necesidades de procesamiento diferentes.

Mida el costo por tarea aceptada. Registre tokens de entrada nueva, tokens de entrada en caché, escrituras de caché, tokens de salida, modo de procesamiento, cargos por herramientas, reintentos y éxito de tareas. Luego calcule el costo real por finalización exitosa.

Enrute tareas más simples a modelos más baratos. No toda solicitud requiere razonamiento de nivel Sol. Clasificación, enrutamiento, extracción simple y otras tareas altamente verificables pueden ajustarse a un modelo de menor costo, mientras que GPT-6.1 Sol maneja las tareas donde un razonamiento más fuerte mejora materialmente la tasa de finalización.

Esto es especialmente importante para agentes porque una ejecución fallida de $0.50 seguida de dos reintentos puede ser más cara que una única ejecución exitosa de $1.00.

Use límites explícitos de finalización, límites de bucles de herramientas y presupuestos de reintentos. Revise los registros de uso para entrada nueva, lecturas de caché, escrituras, salida de razonamiento, nivel, banda de contexto y cargos de herramientas. Compare ahorros frente a la calidad de tareas aceptadas después de cada cambio.

Conclusión

GPT-6.1 Sol es atractivo cuando un flujo de trabajo necesita razonamiento complejo a precios de nivel Sol y puede reutilizar contexto estable. Mantiene las tarifas destacadas Standard de GPT-6 Sol de $2/$10 mientras reduce las lecturas de caché de contexto corto a $0.10/M. Astra tiene tarifas por token más altas, pero la elección debe seguir la calidad de la carga de trabajo y el costo por tarea aceptada.

Comience con estimaciones por solicitud, separe escrituras de caché de lecturas y observe el límite de 272K. Luego mida la trayectoria completa del agente y elija un nivel de procesamiento que se ajuste a la latencia y la disponibilidad. CometAPI proporciona una tabla de precios por separado; confirme los términos reales de cuenta y herramientas antes de escalar.

Preguntas frecuentes

¿Cómo deben gestionar los presupuestos de GPT-6.1 Sol las solicitudes fallidas o canceladas?

Rastree por separado el uso del proveedor para solicitudes completadas, incompletas, fallidas y canceladas. No suponga que toda solicitud no exitosa es gratuita o que toda cancelación del cliente impide el trabajo del lado del servidor. Concílielas por identificadores de solicitud y uso con los registros de facturación, luego incluya el trabajo no exitoso facturado en el cálculo de tareas aceptadas. Confirme las reglas específicas de cobro y reembolso del proveedor en lugar de inferirlas a partir de un estado HTTP.

¿Cómo deben los equipos pronosticar los costos de GPT-6.1 Sol para tráfico variable?

Segmente el tráfico por banda de entrada, nivel de procesamiento, composición de caché y carga de trabajo. Use distribuciones medidas de tokens y de finalizaciones en lugar de un único prompt promedio. Construya un pronóstico base y escenarios para tasas de acierto más bajas, más reintentos y salidas más largas; también monitoree la proporción que cruza 272K. Actualice el pronóstico a medida que cambia la mezcla de tareas.

¿Cómo pueden los equipos conciliar las previsiones de GPT-6.1 Sol con las facturas?

Elija un período de facturación completado y agrupe solicitudes por ruta, nivel de procesamiento y banda de entrada. Concilie el uso registrado con las categorías e créditos de la factura, incluyendo ajustes, cargos por herramientas y cualquier impuesto o conversión de moneda aplicable. Investigue discrepancias usando identificadores de solicitud y marcas de tiempo de facturación en lugar de aplicar un factor de corrección inexplicado. Confirme el reporte diferido y las reglas de redondeo del proveedor antes de cambiar el pronóstico.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Oct 10, 2026
Última actualización Oct 10, 2026
0 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

Leer Más