TLDR: Gemini 3.7 Flash (model ID gemini-3.7-flash), lanzado el 13 de agosto de 2026, es el modelo de clase Flash más capaz de Google para programación, flujos agentivos, desarrollo web y tareas intensivas en conocimiento.
Ofrece una ventana de contexto de 1,048,576 tokens, hasta 65,536 tokens de salida, niveles de razonamiento ajustables (bajo/medio/alto), sólido soporte multimodal y un precio introductorio de $0.75 por 1M de tokens de entrada / $3.75 por 1M de tokens de salida hasta el 31 de diciembre de 2026. Accede a él mediante la Interactions API de Google o, más convenientemente para pilas multimodelo, a través del endpoint unificado de CometAPI. Esta guía cubre las novedades, parámetros de API, uso paso a paso con CometAPI, ejemplos de código, benchmarks y buenas prácticas.
Puntos clave
- Gemini 3.7 Flash ofrece grandes mejoras frente a 3.6 Flash en programación (FrontierCode 1.1 Main: 43.6% vs 34.4%; DeepSWE v1.1: 65.3% vs ~49%), desarrollo web (WebDev Arena Elo 1588 vs 1538), procesamiento de documentos (GDP.pdf 34% vs 22%) y automatización empresarial (AutomationBench 30.4% vs 17%).
- Usa la Interactions API (
client.interactions.create) para las funciones más recientes; thinking_level reemplaza parámetros de budget antiguos. - CometAPI proporciona una única clave de API y acceso compatible con OpenAI (o nativo Gemini) a Gemini 3.7 Flash y más de 500 modelos adicionales, simplificando la facturación, el cambio de modelos y el control de costos.
- Entradas multimodales (texto, imagen, video, audio, PDF) con salida en texto; herramientas integradas incluyen function calling, ejecución de código, grounding de búsqueda, uso de computadora (preview) y más.
- $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida hasta el 31 de diciembre de 2026; el precio introductorio termina el 31 de diciembre de 2026; planifica la tarifa estándar de $1.50 / $7.50 a partir de entonces.
- Ideal para agentes en producción, generación de código de alta precisión y flujos multi‑paso donde importan la eficiencia de costos y la fiabilidad.
Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026—apenas tres semanas después de Gemini 3.6 Flash—como su modelo de trabajo más inteligente hasta la fecha para programación y agentes. Apunta a ingeniería de software compleja, ejecución agentiva multi‑paso, generación web/UI con fuerte adherencia al diseño y dominios con alta densidad de conocimiento como finanzas, derecho y biociencias.
Importante: Gemini 3.7 Flash introduce o hereda cambios clave de comportamiento en la API Gemini 3.x. En particular, los desarrolladores que migren aplicaciones antiguas de Gemini deben eliminar
temperature,top_pytop_k, reemplazarthinking_budgetporthinking_level, eliminarcandidate_countno soportado y dejar de prefijar turnos del modelo.
¿Qué es Gemini 3.7 Flash?
Gemini 3.7 Flash es el modelo generativo de clase Flash más reciente de Google, lanzado el 13 de agosto de 2026.
Google lo describe como su “modelo de trabajo más inteligente hasta la fecha para programación y agentes.” El lanzamiento es notable porque llegó solo tres semanas después de Gemini 3.6 Flash, lo que sugiere que Google está acelerando el ciclo de iteración para sus modelos Flash orientados a desarrolladores.
En lugar de posicionar a Gemini 3.7 Flash simplemente como un chatbot más rápido, Google apunta a cargas de trabajo en las que un sistema de IA necesita:
- razonar a través de múltiples pasos;
- escribir y depurar software;
- usar herramientas;
- interactuar con sistemas externos;
- analizar documentos extensos;
- transformar diseños en interfaces funcionales;
- ejecutar flujos de trabajo de negocio;
- operar como parte de un agente de IA.
Esa distinción importa.
Un chatbot tradicional podría responder:
“¿Cómo implemento OAuth?”
Se espera que un modelo de programación orientado a agentes entienda el repositorio, inspeccione archivos, identifique dependencias, proponga cambios, ejecute herramientas, diagnostique errores e itere hasta que la implementación funcione.
Gemini 3.7 Flash está mucho más orientado al segundo escenario.
API de Gemini 3.7 Flash: especificaciones básicas
La documentación oficial de la API de Gemini lista a Gemini 3.7 Flash como disponible de forma general con las siguientes especificaciones destacadas.
| Especificación | Gemini 3.7 Flash |
|---|---|
| Model ID | gemini-3.7-flash |
| Disponibilidad | Disponibilidad general |
| Ventana de contexto | 1,000,000 tokens |
| Salida máxima | 64,000 tokens |
| Nivel de razonamiento predeterminado | Medium |
| Niveles de razonamiento | Low, Medium, High |
| Entrada | Capacidades multimodales compatibles a través de la plataforma Gemini |
| Enfoque principal | Programación, agentes, desarrollo web, trabajo con conocimiento |
| Precio introductorio de entrada | $0.75 / 1M tokens |
| Precio introductorio de salida | $3.75 / 1M tokens |
| Vencimiento del precio introductorio | December 31, 2026 |
| Precio estándar de entrada tras la oferta | $1.50 / 1M tokens |
| Precio estándar de salida tras la oferta | $7.50 / 1M tokens |
La ventana de contexto de 1M de tokens es particularmente útil para repositorios grandes, documentación técnica extensa, documentos empresariales y sesiones agentivas de múltiples pasos.
¿Qué ha cambiado en la API de Gemini 3.7 Flash?
Esta es una de las secciones más importantes para desarrolladores.
Gemini 3.7 Flash no es simplemente cambiar:
gemini-3.6-flash
por:
gemini-3.7-flash
La generación Gemini 3.x introdujo cambios de comportamiento en la API que pueden romper aplicaciones antiguas. La documentación de migración de Gemini 3.7 destaca específicamente varios cambios.
1. temperature, top_p y top_k están obsoletos
Las integraciones antiguas de Gemini comúnmente contienen una configuración como:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40
}
Para Gemini 3.x, estos parámetros de muestreo deben eliminarse.
Google indica que estos parámetros están obsoletos y futuras generaciones del modelo pueden rechazarlos en lugar de aceptarlos silenciosamente.
Para Gemini 3.7 Flash, usa controles de razonamiento en su lugar:
generation_config = {
"thinking_level": "medium"
}
Este es un cambio conceptual significativo.
En lugar de controlar principalmente la aleatoriedad, los desarrolladores pueden controlar explícitamente la cantidad de esfuerzo de razonamiento.
2. thinking_budget pasa a ser thinking_level
Las aplicaciones que usan una configuración de razonamiento más antigua pueden tener algo como:
{
"thinking_budget": 4096
}
Gemini 3.7 Flash usa:
{
"thinking_level": "medium"
}
Los niveles admitidos son:
lowmediumhigh
Google describe low como útil para tareas sensibles a la latencia, medium como el valor por defecto y ajuste de propósito general, y high como apropiado para razonamiento difícil, matemáticas, programación y tareas agentivas.
3. Debe eliminarse candidate_count
La lista de verificación de migración de Google también indica eliminar candidate_count, que no está soportado en Gemini 3.x.
Por lo tanto, una configuración heredada como:
{
"candidate_count": 3
}
no debe trasladarse sin más a Gemini 3.7 Flash.
4. Ya no se admiten los turnos del modelo prefijados
Arquitecturas conversacionales antiguas a veces terminan una solicitud con un turno del modelo parcialmente prefijado.
El comportamiento más reciente de la API Gemini requiere que los desarrolladores reevalúen este patrón.
Google recomienda usar el estado de conversación del lado del servidor mediante previous_interaction_id para interacciones multi‑turno y eliminar los turnos de modelo prefijados.
5. Function calling requiere atención adicional
La guía de migración también resalta cambios en function calling.
Para aplicaciones que usan herramientas, los desarrolladores deben prestar atención a:
- recursos multimodales;
- instrucciones inline;
- metadatos de respuesta de función;
call_id;- nombres de funciones;
- errores de llamadas a funciones mal formadas.
Para la API generateContent específicamente, Google indica que los objetos FunctionResponse deben incluir tanto call_id como name.
Esto importa particularmente para aplicaciones de agentes porque function calling ya no es un “nice‑to‑have” opcional. Es central en el funcionamiento de agentes de programación y de flujos de trabajo.
Cómo usar la API de Gemini 3.7 Flash con CometAPI
CometAPI es una puerta de enlace de API unificada que ofrece acceso a más de 500 modelos (incluida la familia completa de Gemini) bajo una sola clave de API, endpoints compatibles con OpenAI, precios competitivos y una gestión multi‑proveedor simplificada. Esto es especialmente útil si tu aplicación ya usa SDKs de OpenAI o necesita alternar entre Gemini, Claude, GPT y otros modelos sin reescribir la autenticación o la lógica de facturación.
A continuación, un recorrido completo orientado a producción. Cada paso principal está estructurado como H2 para claridad y SEO.
Regístrate en CometAPI y obtén tu clave de API
- Visita https://www.cometapi.com/ y crea una cuenta (Google, GitHub o email).
- Navega a la sección API Keys / Console: https://www.cometapi.com/console/token.
- Haz clic en Create API Key, asígnale un nombre descriptivo (p. ej., gemini-3.7-flash-prod) y copia la clave.
- Guárdala de forma segura como una variable de entorno:Bash
export COMETAPI_KEY="your-key-here"
Nunca subas la clave al control de versiones ni la expongas en código del lado del cliente.
CometAPI usa precios de pago por uso con tarifas típicamente competitivas frente a los proveedores directos y sin mínimos mensuales.
Instala los SDKs necesarios
Para estilo nativo de Gemini (recomendado para paridad de funciones completa):
Bash
pip install google-genai
Para llamadas compatibles con OpenAI (la migración más fácil):
Bash
pip install openai
También hay equivalentes para Node.js (@google/genai o el SDK de OpenAI para Node).
Configura el cliente para CometAPI
Opción A – Cliente nativo de Google GenAI apuntado a CometAPI (preserva la Interactions API y los controles de razonamiento):
Python
import os
from google import genai
client = genai.Client(
http_options={
"api_version": "v1beta",
"base_url": "https://api.cometapi.com"
},
api_key=os.environ.get("COMETAPI_KEY")
)
Opción B – Cliente compatible con OpenAI (ideal si tu base de código ya está basada en OpenAI):
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("COMETAPI_KEY"),
base_url="https://api.cometapi.com/v1"
)
Ambos enfoques enrutan el tráfico a través de CometAPI mientras seleccionan el modelo ascendente mediante el parámetro model.
Realiza tu primera llamada a Gemini 3.7 Flash
Usando el estilo de la Interactions API (vía cliente GenAI configurado):
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Write a production-ready Three.js script that renders a realistic 3D black hole with accretion disk and gravitational lensing.",
generation_config={
"thinking_level": "medium"
}
)
print(interaction.output_text)
Estilo de chat completions compatible con OpenAI:
Python
response = client.chat.completions.create(
model="gemini-3.7-flash", # Confirm exact model ID in CometAPI dashboard if aliased
messages=[
{"role": "system", "content": "You are an expert software engineer."},
{"role": "user", "content": "Write a Python function that safely handles concurrent payment retries with proper locking."}
],
max_tokens=4096
)
print(response.choices[0].message.content)
Ejemplo cURL (compatible con OpenAI):
Bash
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{"role": "user", "content": "Explain the key improvements in Gemini 3.7 Flash in 3 bullet points."}
]
}'
Siempre verifica la cadena exacta del modelo disponible en tu panel de Modelos de CometAPI, ya que los agregadores a veces usan identificadores o alias ligeramente diferentes.
Configura el nivel de razonamiento y opciones avanzadas de generación
Para programación o tareas agentivas complejas, establece explícitamente el nivel de razonamiento:
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Analyze this payment processing pipeline for race conditions and rewrite the locks safely.",
generation_config={
"thinking_level": "high" # or "low" / "medium"
}
)
- low: El más rápido, adecuado para chat en tiempo real o redacción simple.
- medium (predeterminado): Mejor equilibrio para la mayoría del trabajo de programación y agentivo.
- high: Profundidad máxima de razonamiento y uso de herramientas; mayor consumo de tokens/costo.
Añade entradas multimodales (imágenes, PDFs, video, audio)
Gemini 3.7 Flash acepta de forma nativa modalidades mixtas. Ejemplo con imagen + prompt de texto (usando el cliente GenAI):
Python
from google.genai import types
# Assume image bytes or file path handled appropriately
response = client.models.generate_content( # or interactions equivalent
model="gemini-3.7-flash",
contents=[
types.Part.from_bytes(data=image_bytes, mime_type="image/jpeg"),
"Describe the UI design system in this mockup and generate matching React + Tailwind code."
]
)
Patrones similares funcionan para entradas PDF, video y audio. Esto es potente para flujos de diseño‑a‑código, Q&A de documentos y análisis de video.
Implementa function calling / uso de herramientas
Declara herramientas en la solicitud y deja que el modelo decida cuándo llamarlas. CometAPI las pasa al backend subyacente de Gemini. Sigue el esquema oficial de function calling de Gemini (name, description, parameters como JSON Schema). Tras recibir una llamada de función, ejecuta la herramienta y devuelve el resultado en un turno posterior.
Parámetros de la API para Gemini 3.7 Flash
Al llamar mediante la Interactions API (recomendado), los parámetros clave incluyen:
- model: "gemini-3.7-flash" (requerido)
- input: Cadena o contenido estructurado (texto + partes multimodales)
- generation_config (objeto opcional):
- thinking_level: "low" | "medium" | "high" (por defecto medium)
- Otros campos de configuración soportados para salidas estructuradas, seguridad, etc.
- tools / declaraciones de funciones para uso de herramientas
- system instructions (vía rol system o campo dedicado según el cliente)
- Configuraciones de entorno/agente al usar agentes gestionados (p. ej., Antigravity)
Las llamadas de estilo generateContent nativo siguen disponibles, pero se prefiere la Interactions API para acceso completo a funciones y orquestación de agentes.
Se admite conteo de tokens, caching (implícito + explícito), inferencia por lotes y opciones de prioridad/flex.
Los parámetros y conceptos de configuración más importantes se resumen a continuación.
| Parámetro | Propósito | Guía para Gemini 3.7 Flash |
|---|---|---|
| model | Seleccionar modelo | gemini-3.7-flash |
| input | Instrucción del usuario en Interactions API | Requerido |
| generation_config | Controles de generación | Usa los campos soportados en Gemini 3.x |
| thinking_level | Controla el esfuerzo de razonamiento | low, medium, high |
| contents | Entrada para generateContent de Gemini | Se usa con solicitudes en formato Gemini |
| parts | Componentes de contenido individuales | Contenido de texto/multimodal |
| temperature | Aleatoriedad del muestreo | No usar |
| top_p | Muestreo por núcleo (nucleus) | No usar |
| top_k | Muestreo Top‑K | No usar |
| thinking_budget | Control de razonamiento antiguo | Reemplazar por thinking_level |
| candidate_count | Múltiples candidatos | No soportado en Gemini 3.x |
| previous_interaction_id | Continuidad de la conversación | Recomendado para flujos multi‑turno con Interactions API |
La documentación de migración de Google señala explícitamente los parámetros obsoletos/no soportados y el nuevo patrón conversacional.
Mejores prácticas de producción y consejos de migración
- Comienza con thinking_level="medium" y mide calidad vs latencia/costo.
- Elimina parámetros obsoletos (temperature, top_p, top_k, budgets antiguos de razonamiento).
- Prefiere la Interactions API para flujos agentivos multi‑paso e integración con Antigravity.
- Para aplicaciones multimodelo, mantén la base URL de CometAPI y cambia solo la cadena del modelo—sin reautenticación.
- Prueba a fondo con tus bucles de agente específicos; 3.7 Flash reduce bucles fallidos pero aún se beneficia de instrucciones system claras y esquemas de herramientas bien definidos.
- Combínalo con otros modelos de CometAPI (p. ej., generadores de imagen especializados u otros modelos de razonamiento) cuando Gemini 3.7 Flash no sea la mejor opción para una subtarea.
Gestiona streaming, caching y solicitudes por lotes
- El streaming se admite mediante los flags estándar de streaming tanto en clientes compatibles con OpenAI como en los nativos.
- El caching de contexto (implícito y explícito) reduce el costo para contextos grandes repetidos.
- Hay opciones de inferencia por lotes y prioridad para grandes volúmenes o latencia sensible—consulta la matriz de soporte actual de CometAPI y las opciones oficiales de consumo de Gemini.
Monitorea uso, costos y errores
Usa el panel de CometAPI para seguimiento en tiempo real de uso, costos y límites de tasa. Implementa backoff exponencial para errores 429 y respeta los límites de tasa documentados. Registra el uso de tokens de los metadatos de respuesta para una atribución precisa de costos.
Lista de verificación de migración de la API de Gemini 3.7 Flash
Antes de desplegar una aplicación existente de Gemini, marca cada elemento a continuación.
[ ] Change model ID to gemini-3.7-flash
[ ] Remove temperature
[ ] Remove top_p
[ ] Remove top_k
[ ] Replace thinking_budget with thinking_level
[ ] Remove candidate_count
[ ] Remove prefilled model turns
[ ] Review multi-turn conversation state
[ ] Review function-call handling
[ ] Check FunctionResponse call_id/name
[ ] Update SDK
[ ] Re-run production test suite
[ ] Benchmark low/medium/high thinking
[ ] Recalculate token costs
[ ] Test failure/retry behavior
La guía de migración de Google recomienda específicamente estos cambios al pasar a Gemini 3.7 Flash.
Preguntas frecuentes
¿Qué es la API de Gemini 3.7 Flash?
La API de Gemini 3.7 Flash proporciona acceso programático al modelo Gemini 3.7 Flash de Google. Google posiciona el modelo para programación, agentes, desarrollo web, trabajo con conocimiento y flujos complejos multi‑paso.
¿Cuánto cuesta Gemini 3.7 Flash?
Hasta el 31 de diciembre de 2026, el precio introductorio es de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida.
Desde el 1 de enero de 2027, Google indica que el precio pasa a $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.
¿Puedo seguir usando temperature con Gemini 3.7 Flash?
No deberías. La documentación de migración de Gemini 3.x de Google indica que temperature, top_p y top_k están obsoletos y deben eliminarse.
¿Puedo usar Gemini 3.7 Flash a través de CometAPI?
La plataforma de CometAPI actualmente anuncia la disponibilidad de Gemini 3.7 Flash y proporciona patrones de API en formato Gemini y compatibles con OpenAI. Dado que el modelo es reciente, los desarrolladores deben verificar la página actual del modelo y las capacidades del endpoint antes de un despliegue en producción.
¿Es CometAPI mejor que la API oficial de Gemini?
Ninguna es universalmente “mejor”. La API oficial de Gemini es la opción natural si quieres el ecosistema nativo de Google y funcionalidades específicas del proveedor. CometAPI es más atractivo cuando necesitas una interfaz unificada entre múltiples proveedores de IA, gestión centralizada y un cambio de modelos más sencillo.
Veredicto final: ¿Vale la pena usar Gemini 3.7 Flash?
Para desarrolladores que construyen aplicaciones de IA en 2026, Gemini 3.7 Flash merece atención seria.
El lanzamiento trata menos de hacer un chatbot marginalmente más inteligente y más de hacer que un modelo relativamente económico sea mejor en realmente hacer cosas.
La mayor consideración técnica es la migración.
Si tu aplicación se construyó alrededor de APIs antiguas de Gemini, no cambies simplemente el nombre del modelo. Elimina los parámetros de muestreo obsoletos, migra a thinking_level, elimina candidate_count no soportado, deja de prefijar turnos y revisa el comportamiento de function calling.
Para equipos construyendo exclusivamente con Google, la API nativa de Gemini es el punto de partida obvio.
Para equipos que construyen una pila multimodelo de IA, CometAPI ofrece una alternativa convincente: una capa de API, acceso centralizado a modelos y la posibilidad de experimentar con Gemini junto a otras familias importantes sin crear una integración separada para cada proveedor.
La recomendación práctica es simple:
Empieza con Gemini 3.7 Flash en esfuerzo de razonamiento medio, evalúalo contra tu carga real y luego usa razonamiento bajo o alto de forma selectiva según latencia, calidad y costos. Si tu producto también necesita múltiples proveedores de IA, evalúa la misma carga a través de CometAPI para comparar modelos sin rediseñar la arquitectura de tu aplicación.
Esa combinación—mejor rendimiento agentivo, una ventana de contexto de 1M de tokens, razonamiento configurable y precios agresivos en 2026—convierte a Gemini 3.7 Flash en uno de los lanzamientos de API más interesantes para desarrolladores que construyen agentes de IA en producción hoy.
