TLDR: El 30 de septiembre de 2026, Google DeepMind anunció Gemini 4 Argon, su nuevo modelo de frontera y el inicio de la serie Gemini 4. Ofrece rendimiento de vanguardia en ingeniería de software de largo horizonte (77.9% en DeepSWE v1.1), trabajo de conocimiento empresarial (lidera el Vals Index con 68.9%) y ciberseguridad defensiva. Las mejoras clave incluyen un límite de salida líder del sector de 1 millón de tokens (frente a 64K).
Puntos clave
- Gemini 4 Argon es el modelo más capaz de Google hasta la fecha, optimizado para flujos de trabajo complejos y de múltiples pasos en programación, trabajo de conocimiento legal/financiero y defensa cibernética.
- Argon está diseñado para mantener el razonamiento a lo largo de flujos de trabajo largos y de múltiples pasos, en lugar de chat corto ordinario. Google enfatiza la ingeniería de software del mundo real, el trabajo legal y financiero, la comprensión multimodal y la defensa en ciberseguridad.
- Google amplió la salida máxima desde el nivel anterior de 64K tokens hasta 1 millón de tokens. Google aún no ha publicado una especificación pública completa de la API de Gemini para el contexto de entrada de Argon, modalidades, comportamiento del endpoint o límites de velocidad.
- En la tabla de comparación de Google, Argon obtiene 68.9% en el Vals Index, 77.9% en DeepSWE v1.1, 91.7% en LVBench y 68% en CWE-bench v1. No lidera todas las pruebas: GPT-6 Astra gana FrontierSWE v2 y Terminal-Bench Science, mientras que Claude Opus 5.5 lidera Terminal-Bench 4.0 y PostTrainBench.
- El precio introductorio de la API de Google es de $2 por millón de tokens de entrada y $10 por millón de tokens de salida. Tras el periodo introductorio, los precios suben a $4 y $20, respectivamente. La entrada en caché se anuncia con un 95% de descuento respecto al precio aplicable de tokens de entrada.
- El catálogo público de CometAPI listaba
gemini-4-argoncomo disponible, en lugar de próximo, el 1 de octubre de 2026.
Google ha recuperado una posición de liderazgo en la carrera de IA de frontera con el lanzamiento de Gemini 4 Argon. Anunciado el 30 de septiembre de 2026, este modelo marca el comienzo de la era Gemini 4 y se posiciona explícitamente como la “próxima era de inteligencia de frontera” de Google. Se orienta a las cargas de trabajo más difíciles del mundo real: programación agéntica sostenida, trabajo de conocimiento empresarial de alto riesgo (legal, finanzas, impuestos) y ciberseguridad defensiva.
A diferencia de actualizaciones incrementales previas, Argon introduce un cambio fundamental en profundidad de capacidad mediante una salida dramáticamente ampliada y entrenamiento especializado para tareas de largo horizonte. Miles de empleados de Google ya lo usan internamente para trabajo de ingeniería en producción, mientras que el acceso externo comienza de forma restringida con socios de ciberseguridad validados.
¿Qué es Gemini 4 Argon?
Gemini 4 Argon es el último modelo grande de lenguaje de frontera de Google DeepMind y la primera versión de la familia Gemini 4. Está diseñado específicamente para sostener un razonamiento profundo a lo largo de flujos de trabajo complejos, de múltiples pasos y largo horizonte, que modelos previos no completaban de forma fiable en una sola trayectoria.
Según Google, Argon “ofrece rendimiento de frontera en flujos de trabajo complejos a través de ingeniería de software del mundo real, trabajo de conocimiento empresarial como legal y finanzas, y defensa de ciberseguridad.” Se basa en las lecciones de los esfuerzos retrasados o cancelados de Gemini 3.5 Pro a principios de 2026 y el enfoque posterior en la serie Gemini 3.8 Flash.
El modelo enfatiza capacidades agénticas: planificación autónoma, uso de herramientas, generación y edición de código, descubrimiento y remediación de vulnerabilidades, análisis multidocumento y comprensión de video largo, incorporando sistemas de seguridad más sólidos para un poder de nivel frontera.
Internamente, Argon ya está generando impacto medible a escala Google:
- Los equipos de computación cuántica lo usaron para optimizar recursos espaciotemporales (qubits × puertas), superando referencias publicadas en 40% en minutos.
- Equipos de agentes analizaron telemetría a escala de flota y aplicaron autónomamente optimizaciones de memoria, liberando más de 300 TiB de memoria en centros de datos (con ahorros totales estimados de 500 TiB a 1 PiB).
- Están en marcha migraciones de código a gran escala de C/C++ a Rust, incluyendo decenas de miles de líneas en bibliotecas centrales (re2, libgav1) y más de 800,000 líneas en el kernel Zircon de Fuchsia. Un resultado notable: un decodificador de video con memoria segura (libgav1) que funciona 2.7× más rápido que la anterior portación a Rust tras la optimización guiada por perfiles.
Estas implementaciones reales subrayan que Argon no es solo un campeón de benchmarks, sino un multiplicador de productividad práctico para organizaciones de ingeniería complejas.
Accesibilidad de Gemini 4 Argon a 1 de octubre
Google está adoptando un enfoque deliberadamente gradual para el lanzamiento debido a las capacidades avanzadas del modelo. Actualmente se está desplegando a un conjunto de defensores cibernéticos de confianza a través del Programa Fairwind (que ha inscrito a más de 650 organizaciones, incluidas grandes firmas de seguridad). Google también participa en el proceso voluntario del gobierno de EE. UU. de acceso previo al lanzamiento del modelo. Se espera una disponibilidad más amplia para desarrolladores, empresas y consumidores—comenzando con clientes de API de pago y suscriptores de Google AI Ultra—“lo antes posible” después de iterar en salvaguardas basándose en los primeros comentarios.
Características clave de Gemini 4 Argon
1. Razonamiento de largo horizonte con hasta 1M de tokens de salida
Google afirma que la salida máxima de Argon es de 1 millón de tokens, desde 64,000 tokens en la generación anterior. Es un límite máximo de generación, no una afirmación de que cada respuesta deba ser enorme. Le da al modelo margen para trayectorias largas de razonamiento, generación de código multiarchivo, investigación detallada o trabajo de agente prolongado sin forzar una nueva solicitud cada pocos pasos.
2. Ingeniería de software del mundo real
La puntuación de Argon del 77.9% en DeepSWE v1.1 es el valor más alto en la tabla de comparación de Google. DeepSWE se centra en trabajo de ingeniería de software de largo horizonte, que se ajusta mejor a agentes de programación autónomos que a pruebas cortas de autocompletado de código. El modelo también alcanza 91.9% en Vibe Code Bench.
La imagen no es unilateral. GPT-6 Astra obtiene 65.5% en FrontierSWE v2 frente al 55.0% de Argon, y Claude Opus 5.5 obtiene 66.4% en Terminal-Bench 4.0 frente al 57.4% de Argon. Por tanto, los compradores deberían probar por separado edición de repositorios, uso de shell, depuración y trabajo de migración, en lugar de confiar en una única puntuación de “programación”.
3. Trabajo de conocimiento empresarial
Google reporta a Argon con 68.9% en el Vals Index, que pondera finanzas, programación, legal e impuestos por su contribución al PIB de EE. UU. También lidera los modelos comparados en Vals Finance Agent v2, el benchmark legal de Harvey y AutomationBench.
Estas evaluaciones hacen que Argon sea especialmente relevante para flujos de trabajo intensivos en investigación: diligencia debida, revisión de contratos, análisis financiero, investigación fiscal y síntesis entre documentos. No eliminan la necesidad de verificación de fuentes ni revisión profesional. Un liderazgo en benchmark mide el rendimiento bajo un arnés específico; no establece idoneidad para decisiones legales o financieras sin supervisión.
4. Comprensión multimodal y de video largo
Argon obtiene 71.6% en Chartography y 91.7% en LVBench, liderando por poco a GPT-6 Astra en comprensión de gráficos y con más claridad en comprensión de video largo. Google también describe flujos de trabajo en los que Argon interpreta una secuencia de documentos y actúa sobre el resultado.
Esta combinación es útil cuando el texto por sí solo es insuficiente: analizar gráficos de resultados junto con presentaciones, extraer evidencia de horas de video, revisar capturas de pantalla de productos con requisitos escritos o reconciliar datos entre PDFs e informes visuales.
5. Ciberseguridad defensiva
Google entrenó a Argon para descubrir, validar y parchear vulnerabilidades críticas. En CWE-bench v1, Argon y GPT-6 Astra obtienen ambos 68%, mientras que Claude Opus 5.5 obtiene 67%. Google afirma que Argon también supera a Gemini 3.8 Flash Cyber en evaluaciones internas de descubrimiento de vulnerabilidades y pruebas de penetración de caja negra.
El acceso inicial refleja el riesgo. Los defensores cibernéticos de confianza pueden usar el modelo a través del Programa Fairwind de Google, y Google afirma que Wiz usó Argon en su iniciativa Scan for Good para identificar una vulnerabilidad crítica que afectaba a software sanitario. La distribución restringida da tiempo a Google para recopilar evidencia antes de exponer una capacidad cibernética avanzada de forma más amplia.
6. La tasa de alucinaciones cayó al 10%.
Gemini 4 Argon tiene una tasa de alucinaciones increíblemente baja en Artificial Analysis. 15%. Arena informa una estimación de alucinación de herramientas de 0.10% +/- 0.48% para Gemini 4 Argon High, en comparación con 0.16% +/- 0.09% para Gemini 3.8 Flash High. La estimación puntual es menor, lo que sugiere mejora. Sin embargo, los intervalos de incertidumbre se superponen sustancialmente, y el intervalo de Argon es mucho más amplio.
Rendimiento de benchmarks de Gemini 4 Argon
Las siguientes cifras provienen de la tabla de comparación de Google DeepMind. Google enlaza un documento de metodología por separado y afirma que las puntuaciones son pass@1 salvo que se indique lo contrario. Trate estos como resultados publicados por el proveedor y valídelos frente a cargas de trabajo privadas.
| Benchmark | Carga de trabajo | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Líder |
|---|---|---|---|---|---|
| Vals Index | Trabajo de conocimiento ponderado por PIB | 68.9% | 63.1% | 67.0% | Argon |
| AutomationBench | Automatización empresarial de extremo a extremo | 51.3% | 41.4% | 42.5% | Argon |
| Vals Finance Agent v2 | Investigación financiera de múltiples pasos | 65.4% | 53.5% | 58.6% | Argon |
| Harvey Legal Agent | Investigación y redacción legal | 19.6% | 5.4% | 3.8% | Argon |
| DeepSWE v1.1 | Ingeniería de software de largo horizonte | 77.9% | 74.1% | 74.2% | Argon |
| FrontierSWE v2 | Programación agéntica | 55.0% | 65.5% | 62.3% | Astra |
| Terminal-Bench 4.0 | Trabajo de agente en terminal | 57.4% | 58.2% | 66.4% | Opus |
| Terminal-Bench Science 0.1 | Agentes de ciencia y matemáticas | 57.6% | 68.1% | 63.3% | Astra |
| GraphWalks, 256K-1M | Recorrido de grafos de largo contexto, F1 | 84.2% | 71.8% | 66.8% | Argon |
| Agent's Last Exam | Uso de computadora | 39.5% | 34.2% | 38.2% | Argon |
| OSWorld 2.0 offline subset | Uso de computadora, puntuación parcial | 69.2% | 72.6% | Not reported | Astra |
| Chartography | Comprensión de gráficos | 71.6% | 71.0% | 66.3% | Argon |
| LVBench | Comprensión de video largo | 91.7% | 87.5% | 83.7% | Argon |
| CWE-bench v1 | Remediación de vulnerabilidades | 68.0% | 68.0% | 67.0% | Empate |
Cómo leer los resultados
La ventaja más clara de Argon es la amplitud en trabajo de conocimiento profesional, contexto largo, análisis de gráficos y video largo. Su resultado de 19.6% como agente legal es más de tres veces el 5.4% de Astra, aunque las tres puntuaciones absolutas muestran que el benchmark sigue siendo difícil. Argon también lidera AutomationBench por 8.8 puntos porcentuales sobre Opus 5.5.
La programación requiere una conclusión más matizada. Argon lidera DeepSWE y Vibe Code Bench, pero Astra lidera FrontierSWE, y Opus lidera Terminal-Bench 4.0. Para trabajo científico en terminal, Astra supera a Argon por 10.5 puntos. El titular correcto no es “Argon gana todos los benchmarks”. Es que Argon es excepcionalmente fuerte en flujos de trabajo empresariales de largo horizonte mientras que los competidores mantienen ventajas importantes específicas por tarea.

La evidencia de benchmarks es sólida pero no universal. GPT-6 Astra sigue por delante en varias medidas de ciencia, programación y uso de computadora, mientras que Claude Opus 5.5 lidera pruebas importantes de terminal e ingeniería de ML. Evidencia independiente igualmente matizada: Artificial Analysis clasifica a Argon como #8 de 223 modelos en su clase de comparación, y Arena clasifica a Gemini 4 Argon High como #8 de 46 modelos de agentes, situándolo primero en direccionabilidad. La mayor ventaja de Argon es la combinación de razonamiento de largo horizonte, rendimiento en dominios empresariales y profundidad multimodal con un precio anunciado agresivo.
¿Está disponible Gemini 4 Argon?
A partir del anuncio (30 de septiembre de 2026) y la cobertura posterior, no—no para el público general ni desarrolladores estándar. El acceso está restringido a:
- Miembros de confianza del Programa Fairwind (defensores cibernéticos, gobiernos, socios de infraestructura crítica).
- Equipos internos de Google.
- Participantes en el proceso voluntario de acceso previo del gobierno de EE. UU.
Google afirma que ampliará “lo antes posible” tras recopilar comentarios e iterar en salvaguardas, comenzando con clientes de API de pago y suscriptores de Google AI Ultra, luego acceso más amplio para desarrolladores, empresas y consumidores. No se ha dado una fecha pública fija
Precios de la API de Gemini 4 Argon
El precio introductorio de Google es de $2 por millón de tokens de entrada y $10 por millón de tokens de salida. La tarifa posterior al periodo introductorio es de $4 para entrada y $20 para salida. La entrada en caché tiene un precio con un 95% de descuento respecto a la tarifa de entrada aplicable, lo que implica $0.10 por millón durante el periodo introductorio y $0.20 después si la política se aplica exactamente como se anunció.
El precio es atractivo en relación con otros modelos de frontera premium, pero el costo por token no es el costo por tarea completada. Un modelo que genera cientos de miles de tokens de salida o realiza muchas llamadas a herramientas aún puede generar una factura grande. Establezca límites de salida, supervise bucles de herramientas y mida el costo por resultado aceptado.
Cómo acceder a la API de Gemini 4 Argon a través de CometAPI
Una vez que Google abra un acceso más amplio a la API, las plataformas que agregan modelos de frontera se convierten en la forma más rápida y, a menudo, más rentable para que los desarrolladores experimenten y lleven a producción.
CometAPI proporciona un endpoint unificado, compatible con OpenAI, para más de 500 modelos de OpenAI, Anthropic, Google y otros. Esto significa que puede alternar entre modelos Gemini, variantes de GPT-6 y modelos Claude cambiando únicamente el parámetro del modelo, sin gestionar múltiples cuentas, sistemas de facturación ni SDKs.
Pasos recomendados para prepararse y acceder vía CometAPI:
- Regístrese en cometapi.com y genere una clave de API desde el panel (comienza con
sk-). - Use la URL base
https://api.cometapi.com/v1. - Llame a los modelos con el SDK estándar de OpenAI o el formato nativo de Gemini.
CometAPI ya admite la familia Gemini (incluidos modelos Pro y Flash previos) con precios competitivos, créditos de prueba gratuitos y conmutación sin fricciones. Revise regularmente la página de Modelos de CometAPI para la disponibilidad de Gemini 4 Argon. Este enfoque evita la fricción de incorporación a Google Cloud y permite pruebas A/B sencillas frente a Claude Opus 5.5 o GPT-6 Astra en la misma base de código.
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5
| Categoría | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Proveedor | OpenAI | Anthropic | |
| Estado de lanzamiento al 1 de octubre de 2026 | Despliegue limitado a probadores de confianza; acceso más amplio en camino | Modelo de API activo | Último modelo activo; lanzado el 22 de septiembre de 2026 |
| Mejor para | Trabajo de conocimiento de largo horizonte, análisis multimodal, ciberdefensa, salidas grandes | Razonamiento complejo, ciencia, uso de computadora, amplio ecosistema de herramientas | Programación agéntica de larga duración y trabajo de conocimiento |
| Contexto de entrada | Aún no publicado como especificación pública final de la API | 1,050,000 tokens | 1,000,000 tokens |
| Salida máxima | 1,000,000 tokens | 128,000 tokens | 128,000 sincrónicos; 300,000 Batch beta |
| Entradas y salidas | Capacidades multimodales indicadas; matriz pública detallada de API pendiente | Texto e imagen de entrada; texto de salida | Texto e imágenes de entrada; texto de salida |
| Control de razonamiento | Razonamiento de largo horizonte; controles públicos de API pendientes | esfuerzo de razonamiento de bajo a máximo | Pensamiento adaptativo siempre activado; esfuerzo predeterminado medio |
| Precio estándar por 1M tokens | Intro: $2 entrada / $10 salida; luego $4 / $20 | $10 entrada / $50 salida | $4 entrada / $20 salida |
| Victorias destacadas en la tabla de Google | Vals, AutomationBench, DeepSWE, contexto largo, LVBench | FrontierSWE, trabajo de terminal científico, subconjunto OSWorld | Terminal-Bench 4.0, PostTrainBench |
| Advertencia principal | La disponibilidad amplia de la API y las especificaciones completas aún se están desplegando | El precio de lista más alto de los tres | No lidera la tabla de trabajo de conocimiento de Google; el pensamiento adaptativo no se puede desactivar |
¿Qué modelo es mejor?
Elija Gemini 4 Argon cuando dominen la carga de trabajo el trabajo de conocimiento de largo contexto, la evidencia multimodal, la ciberseguridad defensiva o artefactos generados inusualmente grandes. Elija GPT-6 Astra cuando necesite una superficie de herramientas madura de OpenAI, un rendimiento sólido de agentes científicos o sus fortalezas específicas de uso de computadora. Elija Claude Opus 5.5 para flujos de trabajo de programación agéntica y terminal nativos de Claude, especialmente cuando su comportamiento ya rinde bien en su arnés de evaluación.
Para la mayoría de las empresas, la mejor estrategia no es una decisión permanente de un solo modelo. Envíe solicitudes rutinarias a un modelo de menor costo, evalúe Argon, Astra y Opus en la cola difícil y preserve un respaldo. CometAPI es útil aquí porque una capa de integración puede facilitar las pruebas entre modelos y el enrutamiento controlado.
Conclusión
Gemini 4 Argon marca la reentrada más fuerte de Google en la frontera absoluta, recuperando el liderazgo en varios benchmarks críticos para la empresa y de largo horizonte, a la vez que introduce avances prácticos como 1M de tokens de salida y precios introductorios agresivos. Su despliegue gradual y centrado en la seguridad prioriza la implementación responsable de potentes capacidades de ciberdefensa.
