GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
technology/Investigación de CometAPI

Grok 4.7: Pruebas de rendimiento, precios, características y acceso a la API

Aprenda qué es Grok 4.7, incluyendo su ventana de contexto de 500K, benchmarks, precios, modos de razonamiento, capacidades de agente, comparación con Grok 4.6 y acceso.

CometAPI
Deon GoodwinEquipo de investigación de modelos de IA y API
Actualizado Sep 22, 2026 14 min de lectura
Grok 4.7: Pruebas de rendimiento, precios, características y acceso a la API
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Grok 4.7 es el modelo de frontera de SpaceXAI para programación, flujos de trabajo agentes y trabajo profesional del conocimiento, lanzado el 21 de septiembre de 2026. Combina una ventana de contexto de 500,000 tokens, entrada de texto e imagen, razonamiento configurable, llamadas a funciones, búsqueda web y en X, y ejecución de código.

Para prompts por debajo de 200,000 tokens, la API oficial de xAI lista $2 por millón de tokens de entrada, $0.50 por millón de tokens de entrada en caché y $6 por millón de tokens de salida. Actualmente, CometAPI lista Grok 4.7 a $1.60 la entrada, $0.40 la entrada en caché y $4.80 la salida por millón de tokens para el mismo nivel, una reducción del 20% con respecto a las tarifas oficiales mostradas en su página del modelo.

La propuesta de valor práctica no es el liderazgo universal en benchmarks. Grok 4.7 resulta más convincente cuando una carga combina tareas de ingeniería, bucles de agente largos, uso de herramientas, contextos de trabajo grandes y sensibilidad al costo de tokens de salida. Los equipos deben validarlo en sus propios repositorios y flujos de trabajo antes del enrutamiento a producción.

Key Takeaways

  • Grok 4.7 utiliza un modelo base más grande que Grok 4.6, un aprendizaje por refuerzo más prolongado en tareas más difíciles de varias horas y una autoverificación más sólida.
  • La API admite una ventana de contexto de 500,000 tokens, entrada de texto e imagen, salida de texto, cuatro niveles de razonamiento, salida estructurada, llamadas a funciones, búsqueda web y en X, y ejecución de código.
  • SpaceXAI reporta 46.3% en CursorBench 4.0, 71.0% en DeepSWE v1.1 y 38.0% en Terminal-Bench 4.0. Son resultados publicados por el proveedor, no una prueba de liderazgo universal.
  • CometAPI lista Grok 4.7 como disponible, con un endpoint compatible con OpenAI y precios 20% por debajo de las tarifas oficiales de xAI que aparecen en su catálogo actual.
  • Elige Grok 4.7 para agentes de ingeniería sensibles al costo y uso sostenido de herramientas; elige alternativas cuando un contexto muy largo o un dominio crítico por benchmark importe más que el precio unitario.

What Is Grok 4.7?

Grok 4.7 es el último modelo de frontera de SpaceXAI, orientado a la programación, tareas de agentes autónomos y trabajo profesional del conocimiento. El lanzamiento se enfoca en tareas que requieren interacción sostenida, uso de herramientas, verificación y revisión en lugar de solo respuestas de una sola vez.

SpaceXAI afirma que Grok 4.7 fue entrenado con una corrida de aprendizaje por refuerzo más larga en una mezcla más difícil de tareas, ponderada hacia problemas que pueden tardar muchas horas en completarse. Esta dirección de entrenamiento lo hace especialmente relevante para ingeniería de software a nivel de repositorio, depuración, investigación, creación de documentos, análisis de ingeniería y automatización de múltiples pasos.

How Is Grok 4.7 Different From—and Better Than—Grok 4.6?

A Larger Base Model

Grok 4.7 pasa a un modelo base más grande que Grok 4.6. SpaceXAI no ha divulgado un conteo de parámetros público finalizado, por lo que la conclusión defendible es un aumento de la capacidad del modelo base, no una estimación específica de parámetros.

Longer Reinforcement Learning on Harder Tasks

La etapa de aprendizaje por refuerzo se extendió y se orientó hacia problemas más difíciles y de horizonte más largo. SpaceXAI enfatiza tareas que pueden requerir horas de trabajo, alineando el modelo con flujos de trabajo de agentes autónomos de programación, investigación y trabajo profesional.

Stronger Self-Verification

Grok 4.7 está entrenado para inspeccionar su propio trabajo con más cuidado. Esto importa en ingeniería de software porque un agente fiable debe inspeccionar, modificar, probar, diagnosticar fallos, revisar y validar de manera repetida, no solo generar una primera respuesta.

Measured Improvements Over Grok 4.6

DimensiónGrok 4.6Grok 4.7Cambio
CursorBench 4.040.4%46.3%+5.9 pts
DeepSWE v1.165.2%71.0%+5.8 pts
EEBench53.0%64.0%+11.0 pts
AA Briefcase v1.11,5461,657+111
Terminal-Bench 4.020.3%38.0%+17.7 pts
Harvey Legal Agent Benchmark15.8%19.6%+3.8 pts
HealthBench Professional48.5%56.7%+8.2 pts

En el conjunto de lanzamiento publicado, Grok 4.7 mejora respecto a Grok 4.6 en cada resultado listado. La mayor ganancia absoluta es en Terminal-Bench 4.0, consistente con el énfasis del lanzamiento en flujos de trabajo de línea de comandos y uso de herramientas de larga duración. Estas cifras siguen siendo publicadas por el proveedor y deben probarse frente a tareas reales antes de una decisión de migración.

How Good Is Grok 4.7 on Benchmarks?

La evaluación de lanzamiento de SpaceXAI abarca ingeniería de software, trabajo en terminal, tareas profesionales de oficina, trabajo legal, razonamiento clínico y, ingeniería eléctrica. Son resultados publicados por el proveedor y deben validarse frente a cargas de trabajo de producción antes de decisiones de compra o enrutamiento.

BenchmarkGrok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%*65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

En sus resultados de lanzamiento de Grok 4.7, SpaceXAI marca la puntuación de 71.0% en DeepSWE v1.1 como esfuerzo de razonamiento alto.

El anuncio de lanzamiento no divulga cada arnés por benchmark, configuración de herramientas, recuento de ejecuciones ni entorno de evaluación. Trata estos valores como resultados publicados por el proveedor y valida el modelo en tus propios repositorios, herramientas, objetivos de latencia y criterios de fallo antes de enrutar trabajo de producción.

What Does the Grok 4.7 Benchmark Profile Show?

Software Engineering

CursorBench 4.0 sube de 40.4% en Grok 4.6 a 46.3% en Grok 4.7, mientras que DeepSWE v1.1 sube de 65.2% a 71.0%. Esto respalda el posicionamiento de Grok 4.7 como un modelo para agentes de programación más que solo asistencia conversacional de código.

Long-Running Terminal Work

Terminal-Bench 4.0 muestra uno de los mayores cambios generacionales: 20.3% para Grok 4.6 frente a 38.0% para Grok 4.7. La ganancia absoluta de 17.7 puntos es consistente con el énfasis de SpaceXAI en aprendizaje por refuerzo de horizonte más largo y autoverificación.

Electrical Engineering

En EEBench, Grok 4.7 alcanza 64.0%, comparado con 53.0% para Grok 4.6. Entre las comparaciones publicadas, esta es una de las mejores cifras relativas de Grok 4.7.

Professional Knowledge Work

AA Briefcase v1.1 sube de 1,546 a 1,657. Estas tareas están diseñadas para reflejar trabajo profesional de varias horas que involucra artefactos como documentos, presentaciones, análisis y otros entregables estructurados.

Grok 4.7 vs GPT-5.6 Sol vs Fable 5.1: How Do They Compare?

Comprobaciones de precios nativos del proveedor: OpenAI lista GPT-5.6 Sol a $4 por millón de tokens de entrada y $20 por millón de tokens de salida, mientras que Anthropic lista Claude Fable 5.1 a $10 por millón de tokens de entrada y $50 por millón de tokens de salida.

DimensiónGrok 4.7GPT-5.6 SolClaude Fable 5.1
Posicionamiento principalProgramación, tareas de agentes, trabajo del conocimientoRazonamiento profesional complejo y programaciónAgentes de larga duración, programación y trabajo del conocimiento
Ventana de contexto500,000 tokens1,050,000 tokens1,000,000 tokens
ModalidadesEntrada de texto e imagen; salida de textoEntrada de texto e imagen; salida de textoEntrada de texto e imagen; salida de texto
Control de razonamientoLow, medium, high, xhighNone through maxEsfuerzo adaptable con ajuste configurable
Estado de la API del proveedorDisponible en la API pública de xAIDisponible a través de Chat Completions y Responses de OpenAIDisponible a través de la API de Claude y marketplaces en la nube
Precio de entrada / 1M tokens$2$4$10
Precio de salida / 1M tokens$6$20$50
CursorBench 4.046.3%41.7%51.8%
DeepSWE v1.171.0%72.7%70.0%
Mejor encajeAgentes de ingeniería sensibles al precio y uso sostenido de herramientasRazonamiento profesional amplio con contexto muy largoMáximo rendimiento de agentes de larga duración y flujos de trabajo de conocimiento

Which Model Should You Choose?

  • Elige Grok 4.7 cuando las cargas de trabajo de ingeniería, el uso sostenido de herramientas, el razonamiento configurable y un menor costo por tokens de salida sean la prioridad. Es particularmente atractivo para agentes de repositorios, flujos de trabajo en terminal y investigaciones de gran contexto que se mantengan por debajo del umbral de precios de 200K.
  • Elige GPT-5.6 Sol cuando la tarea necesite un razonamiento profesional más amplio, una ventana de contexto superior al millón de tokens o cuando su mejor resultado en una evaluación crítica para el negocio, como DeepSWE o razonamiento clínico, haya sido validado en tu propio arnés.
  • Elige Claude Fable 5.1 cuando el máximo rendimiento en agentes de larga duración, calidad de código, ejecución en terminal o razonamiento clínico justifique su mayor precio por token.
  • Usa enrutamiento de modelos cuando varíen las cargas. Ruta pasos de ingeniería rutinaria y de alto volumen al modelo calificado más rentable, y reserva un modelo más caro para tareas donde las tasas de éxito medidas justifiquen la prima.

La elección correcta depende del éxito de la tarea de extremo a extremo, latencia, reintentos, precisión de llamadas a herramientas y retrabajo humano, no de un único benchmark ni de una tarifa titular de tokens.

How Much Does the Grok 4.7 API Cost?

La tabla siguiente compara las tarifas oficiales de xAI con los precios mostrados en la página del modelo Grok 4.7 de CometAPI el 22 de septiembre de 2026. CometAPI indica un descuento del 20%; verifica los precios en vivo antes de producción porque los precios de gateways y los términos promocionales pueden cambiar.

Nivel de promptTipo de precioxAI oficialCometAPIDiferencia
Por debajo de 200K tokens de promptEntrada / 1M$2.00$1.6020% menor
Entrada en caché / 1M$0.50$0.4020% menor
Salida / 1M$6.00$4.8020% menor
Por encima de 200K tokens de promptEntrada / 1M$4.00$3.2020% menor
Entrada en caché / 1M$1.00$0.8020% menor
Salida / 1M$12.00$9.6020% menor

Standard Context Pricing for Prompts Up to 200,000 Tokens

Para solicitudes cuyo prompt no exceda 200,000 tokens, Grok 4.7 cuesta $2 por millón de tokens de entrada, $0.50 por millón de tokens de entrada en caché y $6 por millón de tokens de salida. La entrada en caché es la categoría menos costosa, por lo que las aplicaciones con instrucciones de sistema repetidas o contexto reutilizable pueden reducir el costo cuando esos tokens califican para caché.

Por un ejemplo simple, una solicitud que use 100,000 tokens de entrada no cacheados y produzca 10,000 tokens de salida costaría alrededor de $0.26 antes de cualquier otro cargo de la plataforma: $0.20 por la entrada más $0.06 por la salida.

Long-Context Pricing Above 200,000 Prompt Tokens

Una vez que el prompt supera los 200,000 tokens, las tarifas se duplican a $4 por millón de tokens de entrada, $1 por millón de tokens de entrada en caché y $12 por millón de tokens de salida. El nivel más alto se aplica por la longitud del prompt, por lo que los equipos deben monitorear el historial acumulado de conversación, trazas de herramientas, documentos recuperados y contexto de repositorios antes de enviar cada solicitud.

La decisión de costo práctica no es solo cuántos tokens usa una tarea, sino si el prompt cruza la frontera de 200,000 tokens. Resumir trabajo completado, eliminar salida obsoleta de herramientas y recuperar solo los archivos más relevantes puede mantener cargas adecuadas en el nivel estándar sin sacrificar el contexto necesario.

Las notas de la versión de SpaceXAI documentan este umbral. Los presupuestos de producción también deben contar con reintentos, bucles de agentes, llamadas a herramientas fallidas y longitud de salida, en lugar de comparar proveedores solo por su precio titular de tokens de entrada.

What Makes Grok 4.7 Useful for AI Agents?

  • Ventana de contexto de 500K: Aloja código fuente sustancial, especificaciones, salida de herramientas, registros e historial de conversación en un solo contexto de trabajo. Esto es útil para programación a escala de repositorio y análisis multidocumento, aunque el contexto aún requiere poda activa.
  • Razonamiento configurable: Las aplicaciones pueden seleccionar esfuerzo bajo, medio, alto o xhigh, intercambiando latencia y cómputo por razonamiento más profundo según la dificultad de la tarea.
  • Llamadas a funciones y salida estructurada: Los agentes pueden consultar bases de datos, ejecutar pruebas, inspeccionar documentos, llamar APIs internas y devolver resultados legibles por máquinas.
  • Búsqueda web y en X: Las herramientas de búsqueda pueden recuperar información actual cuando los datos de entrenamiento del modelo son insuficientes. El contenido recuperado debe tratarse como entrada no confiable y verificarse.
  • Ejecución de código: El modelo puede validar cálculos, transformar datos y probar soluciones generadas en lugar de depender únicamente de la inferencia del modelo de lenguaje.
  • Enfoque en flujos de trabajo de horizonte largo: El énfasis del entrenamiento en tareas de varias horas, gestión de contexto y autoverificación apunta a bucles de agentes que acumulan trazas de herramientas y requieren recuperación tras fallos.

How Does Grok 4.7 Improve Safety?

SpaceXAI afirma que Grok 4.7 introduce una pila de salvaguardas completamente nueva y reporta mayor resistencia a jailbreaks y seguridad de doble uso. En el anuncio de lanzamiento, la empresa reporta 62.4% en el benchmark de bioseguridad de LatchBio y afirma que solo 3.3% de prompts de doble uso arriesgado se permitieron en HackerBench v0.3.

Estas cifras son evaluaciones publicadas por el proveedor. Son útiles para entender las afirmaciones del lanzamiento, pero no deben tratarse como una medida universal del desempeño de seguridad en el mundo real.

How Can Developers Use the Grok 4.7 API?

Grok 4.7 está actualmente disponible a través de CometAPI bajo el ID de modelo grok-4.7. CometAPI proporciona un endpoint compatible con OpenAI, una única clave API y flujo de facturación para múltiples proveedores de modelos, pruebas comparativas y enrutamiento más sencillos, y precios actualmente listados 20% por debajo de las tarifas oficiales de xAI. Antes de uso en producción, confirma la página del modelo en vivo, el estado del endpoint, los parámetros admitidos, los precios y los requisitos de manejo de datos.

Ejemplo de solicitud en CometAPI:

curl "https://api.cometapi.com/v1/responses" \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -d '{
    "model": "grok-4.7",
    "input": "Explain how a distributed task queue handles worker failure."
  }'

Is Grok 4.7 Worth Switching To?

Para usuarios existentes de Grok 4.6 que dependen de agentes de programación o flujos de trabajo profesionales de larga duración, Grok 4.7 es una candidatura de actualización material porque el conjunto de benchmarks de lanzamiento mejora en todas las dimensiones reportadas mientras que el precio estándar por tokens se mantiene en el mismo nivel de $2/$6 por debajo del umbral de contexto largo.

Para usuarios de otros modelos de frontera, la decisión es específica de la carga. Grok 4.7 es especialmente interesante cuando el costo de tokens de salida, las cargas de ingeniería, los contextos grandes y el uso sostenido de herramientas importan. Donde otro modelo es más fuerte en un dominio crítico, el enrutamiento de modelos puede ser más racional que reemplazar cada modelo por un único proveedor.

Conclusion

Grok 4.7 es más que una actualización numérica rutinaria de Grok 4.6. El lanzamiento está explícitamente orientado a trabajo de larga duración realizado mediante herramientas, verificación repetida, contextos grandes y múltiples pasos de ejecución.

Las mayores ganancias generacionales aparecen donde esa dirección de entrenamiento debería importar: Terminal-Bench 4.0 sube de 20.3% a 38.0%, EEBench de 53.0% a 64.0% y CursorBench 4.0 de 40.4% a 46.3%, mientras que el precio estándar por debajo del umbral de 200K tokens de prompt se mantiene en $2/M de entrada y $6/M de salida.

La propuesta de valor práctica no es “Grok 4.7 gana cada benchmark”. Es que Grok 4.7 reduce la brecha entre la capacidad de agentes de clase frontera y una inferencia de menor costo, haciéndolo especialmente relevante para agentes de programación, sistemas de investigación y flujos de trabajo profesionales que necesitan operar durante muchos pasos en lugar de responder una sola vez.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Sep 22, 2026
Última actualización Sep 22, 2026
8 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más