FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
guide/Investigación de CometAPI

Cómo usar la API Gemini 3.7 Flash: guía completa para desarrolladores

Aprende a utilizar la API de Gemini 3.7 Flash. Explora los cambios de la API, los niveles de razonamiento, los parámetros, los precios, los consejos de migración y las mejores prácticas para producción.

CometAPI
AnnaEquipo de investigación de modelos de IA y API
Actualizado Aug 14, 2026 15 min de lectura
Cómo usar la API Gemini 3.7 Flash: guía completa para desarrolladores
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: Gemini 3.7 Flash (model ID gemini-3.7-flash), lanzado el 13 de agosto de 2026, es el modelo de clase Flash más capaz de Google para programación, flujos agentivos, desarrollo web y tareas intensivas en conocimiento.

Ofrece una ventana de contexto de 1,048,576 tokens, hasta 65,536 tokens de salida, niveles de razonamiento ajustables (bajo/medio/alto), sólido soporte multimodal y un precio introductorio de $0.75 por 1M de tokens de entrada / $3.75 por 1M de tokens de salida hasta el 31 de diciembre de 2026. Accede a él mediante la Interactions API de Google o, más convenientemente para pilas multimodelo, a través del endpoint unificado de CometAPI. Esta guía cubre las novedades, parámetros de API, uso paso a paso con CometAPI, ejemplos de código, benchmarks y buenas prácticas.

Puntos clave

  • Gemini 3.7 Flash ofrece grandes mejoras frente a 3.6 Flash en programación (FrontierCode 1.1 Main: 43.6% vs 34.4%; DeepSWE v1.1: 65.3% vs ~49%), desarrollo web (WebDev Arena Elo 1588 vs 1538), procesamiento de documentos (GDP.pdf 34% vs 22%) y automatización empresarial (AutomationBench 30.4% vs 17%).
  • Usa la Interactions API (client.interactions.create) para las funciones más recientes; thinking_level reemplaza parámetros de budget antiguos.
  • CometAPI proporciona una única clave de API y acceso compatible con OpenAI (o nativo Gemini) a Gemini 3.7 Flash y más de 500 modelos adicionales, simplificando la facturación, el cambio de modelos y el control de costos.
  • Entradas multimodales (texto, imagen, video, audio, PDF) con salida en texto; herramientas integradas incluyen function calling, ejecución de código, grounding de búsqueda, uso de computadora (preview) y más.
  • $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida hasta el 31 de diciembre de 2026; el precio introductorio termina el 31 de diciembre de 2026; planifica la tarifa estándar de $1.50 / $7.50 a partir de entonces.
  • Ideal para agentes en producción, generación de código de alta precisión y flujos multi‑paso donde importan la eficiencia de costos y la fiabilidad.

Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026—apenas tres semanas después de Gemini 3.6 Flash—como su modelo de trabajo más inteligente hasta la fecha para programación y agentes. Apunta a ingeniería de software compleja, ejecución agentiva multi‑paso, generación web/UI con fuerte adherencia al diseño y dominios con alta densidad de conocimiento como finanzas, derecho y biociencias.

Importante: Gemini 3.7 Flash introduce o hereda cambios clave de comportamiento en la API Gemini 3.x. En particular, los desarrolladores que migren aplicaciones antiguas de Gemini deben eliminar temperature, top_p y top_k, reemplazar thinking_budget por thinking_level, eliminar candidate_count no soportado y dejar de prefijar turnos del modelo.

¿Qué es Gemini 3.7 Flash?

Gemini 3.7 Flash es el modelo generativo de clase Flash más reciente de Google, lanzado el 13 de agosto de 2026.

Google lo describe como su “modelo de trabajo más inteligente hasta la fecha para programación y agentes.” El lanzamiento es notable porque llegó solo tres semanas después de Gemini 3.6 Flash, lo que sugiere que Google está acelerando el ciclo de iteración para sus modelos Flash orientados a desarrolladores.

En lugar de posicionar a Gemini 3.7 Flash simplemente como un chatbot más rápido, Google apunta a cargas de trabajo en las que un sistema de IA necesita:

  • razonar a través de múltiples pasos;
  • escribir y depurar software;
  • usar herramientas;
  • interactuar con sistemas externos;
  • analizar documentos extensos;
  • transformar diseños en interfaces funcionales;
  • ejecutar flujos de trabajo de negocio;
  • operar como parte de un agente de IA.

Esa distinción importa.

Un chatbot tradicional podría responder:

“¿Cómo implemento OAuth?”

Se espera que un modelo de programación orientado a agentes entienda el repositorio, inspeccione archivos, identifique dependencias, proponga cambios, ejecute herramientas, diagnostique errores e itere hasta que la implementación funcione.

Gemini 3.7 Flash está mucho más orientado al segundo escenario.

API de Gemini 3.7 Flash: especificaciones básicas

La documentación oficial de la API de Gemini lista a Gemini 3.7 Flash como disponible de forma general con las siguientes especificaciones destacadas.

EspecificaciónGemini 3.7 Flash
Model IDgemini-3.7-flash
DisponibilidadDisponibilidad general
Ventana de contexto1,000,000 tokens
Salida máxima64,000 tokens
Nivel de razonamiento predeterminadoMedium
Niveles de razonamientoLow, Medium, High
EntradaCapacidades multimodales compatibles a través de la plataforma Gemini
Enfoque principalProgramación, agentes, desarrollo web, trabajo con conocimiento
Precio introductorio de entrada$0.75 / 1M tokens
Precio introductorio de salida$3.75 / 1M tokens
Vencimiento del precio introductorioDecember 31, 2026
Precio estándar de entrada tras la oferta$1.50 / 1M tokens
Precio estándar de salida tras la oferta$7.50 / 1M tokens

La ventana de contexto de 1M de tokens es particularmente útil para repositorios grandes, documentación técnica extensa, documentos empresariales y sesiones agentivas de múltiples pasos.

¿Qué ha cambiado en la API de Gemini 3.7 Flash?

Esta es una de las secciones más importantes para desarrolladores.

Gemini 3.7 Flash no es simplemente cambiar:

gemini-3.6-flash

por:

gemini-3.7-flash

La generación Gemini 3.x introdujo cambios de comportamiento en la API que pueden romper aplicaciones antiguas. La documentación de migración de Gemini 3.7 destaca específicamente varios cambios.

1. temperature, top_p y top_k están obsoletos

Las integraciones antiguas de Gemini comúnmente contienen una configuración como:

generation_config = {
    "temperature": 0.7,
    "top_p": 0.9,
    "top_k": 40
}

Para Gemini 3.x, estos parámetros de muestreo deben eliminarse.

Google indica que estos parámetros están obsoletos y futuras generaciones del modelo pueden rechazarlos en lugar de aceptarlos silenciosamente.

Para Gemini 3.7 Flash, usa controles de razonamiento en su lugar:

generation_config = {
    "thinking_level": "medium"
}

Este es un cambio conceptual significativo.

En lugar de controlar principalmente la aleatoriedad, los desarrolladores pueden controlar explícitamente la cantidad de esfuerzo de razonamiento.


2. thinking_budget pasa a ser thinking_level

Las aplicaciones que usan una configuración de razonamiento más antigua pueden tener algo como:

{
  "thinking_budget": 4096
}

Gemini 3.7 Flash usa:

{
  "thinking_level": "medium"
}

Los niveles admitidos son:

  • low
  • medium
  • high

Google describe low como útil para tareas sensibles a la latencia, medium como el valor por defecto y ajuste de propósito general, y high como apropiado para razonamiento difícil, matemáticas, programación y tareas agentivas.


3. Debe eliminarse candidate_count

La lista de verificación de migración de Google también indica eliminar candidate_count, que no está soportado en Gemini 3.x.

Por lo tanto, una configuración heredada como:

{
  "candidate_count": 3
}

no debe trasladarse sin más a Gemini 3.7 Flash.


4. Ya no se admiten los turnos del modelo prefijados

Arquitecturas conversacionales antiguas a veces terminan una solicitud con un turno del modelo parcialmente prefijado.

El comportamiento más reciente de la API Gemini requiere que los desarrolladores reevalúen este patrón.

Google recomienda usar el estado de conversación del lado del servidor mediante previous_interaction_id para interacciones multi‑turno y eliminar los turnos de modelo prefijados.


5. Function calling requiere atención adicional

La guía de migración también resalta cambios en function calling.

Para aplicaciones que usan herramientas, los desarrolladores deben prestar atención a:

  • recursos multimodales;
  • instrucciones inline;
  • metadatos de respuesta de función;
  • call_id;
  • nombres de funciones;
  • errores de llamadas a funciones mal formadas.

Para la API generateContent específicamente, Google indica que los objetos FunctionResponse deben incluir tanto call_id como name.

Esto importa particularmente para aplicaciones de agentes porque function calling ya no es un “nice‑to‑have” opcional. Es central en el funcionamiento de agentes de programación y de flujos de trabajo.

Cómo usar la API de Gemini 3.7 Flash con CometAPI

CometAPI es una puerta de enlace de API unificada que ofrece acceso a más de 500 modelos (incluida la familia completa de Gemini) bajo una sola clave de API, endpoints compatibles con OpenAI, precios competitivos y una gestión multi‑proveedor simplificada. Esto es especialmente útil si tu aplicación ya usa SDKs de OpenAI o necesita alternar entre Gemini, Claude, GPT y otros modelos sin reescribir la autenticación o la lógica de facturación.

A continuación, un recorrido completo orientado a producción. Cada paso principal está estructurado como H2 para claridad y SEO.

Regístrate en CometAPI y obtén tu clave de API

  1. Visita https://www.cometapi.com/ y crea una cuenta (Google, GitHub o email).
  2. Navega a la sección API Keys / Console: https://www.cometapi.com/console/token.
  3. Haz clic en Create API Key, asígnale un nombre descriptivo (p. ej., gemini-3.7-flash-prod) y copia la clave.
  4. Guárdala de forma segura como una variable de entorno:Bashexport COMETAPI_KEY="your-key-here"

Nunca subas la clave al control de versiones ni la expongas en código del lado del cliente.

CometAPI usa precios de pago por uso con tarifas típicamente competitivas frente a los proveedores directos y sin mínimos mensuales.

Instala los SDKs necesarios

Para estilo nativo de Gemini (recomendado para paridad de funciones completa):

Bash
pip install google-genai

Para llamadas compatibles con OpenAI (la migración más fácil):

Bash
pip install openai

También hay equivalentes para Node.js (@google/genai o el SDK de OpenAI para Node).

Configura el cliente para CometAPI

Opción A – Cliente nativo de Google GenAI apuntado a CometAPI (preserva la Interactions API y los controles de razonamiento):

Python
import os
from google import genai

client = genai.Client(
    http_options={
        "api_version": "v1beta",
        "base_url": "https://api.cometapi.com"
    },
    api_key=os.environ.get("COMETAPI_KEY")
)

Opción B – Cliente compatible con OpenAI (ideal si tu base de código ya está basada en OpenAI):

Python
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ.get("COMETAPI_KEY"),
    base_url="https://api.cometapi.com/v1"
)

Ambos enfoques enrutan el tráfico a través de CometAPI mientras seleccionan el modelo ascendente mediante el parámetro model.

Realiza tu primera llamada a Gemini 3.7 Flash

Usando el estilo de la Interactions API (vía cliente GenAI configurado):

Python
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input="Write a production-ready Three.js script that renders a realistic 3D black hole with accretion disk and gravitational lensing.",
    generation_config={
        "thinking_level": "medium"
    }
)
print(interaction.output_text)

Estilo de chat completions compatible con OpenAI:

Python
response = client.chat.completions.create(
    model="gemini-3.7-flash",  # Confirm exact model ID in CometAPI dashboard if aliased
    messages=[
        {"role": "system", "content": "You are an expert software engineer."},
        {"role": "user", "content": "Write a Python function that safely handles concurrent payment retries with proper locking."}
    ],
    max_tokens=4096
)
print(response.choices[0].message.content)

Ejemplo cURL (compatible con OpenAI):

Bash
curl https://api.cometapi.com/v1/chat/completions \
  -H "Authorization: Bearer $COMETAPI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {"role": "user", "content": "Explain the key improvements in Gemini 3.7 Flash in 3 bullet points."}
    ]
  }'

Siempre verifica la cadena exacta del modelo disponible en tu panel de Modelos de CometAPI, ya que los agregadores a veces usan identificadores o alias ligeramente diferentes.

Configura el nivel de razonamiento y opciones avanzadas de generación

Para programación o tareas agentivas complejas, establece explícitamente el nivel de razonamiento:

Python
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input="Analyze this payment processing pipeline for race conditions and rewrite the locks safely.",
    generation_config={
        "thinking_level": "high"  # or "low" / "medium"
    }
)
  • low: El más rápido, adecuado para chat en tiempo real o redacción simple.
  • medium (predeterminado): Mejor equilibrio para la mayoría del trabajo de programación y agentivo.
  • high: Profundidad máxima de razonamiento y uso de herramientas; mayor consumo de tokens/costo.

Añade entradas multimodales (imágenes, PDFs, video, audio)

Gemini 3.7 Flash acepta de forma nativa modalidades mixtas. Ejemplo con imagen + prompt de texto (usando el cliente GenAI):

Python
from google.genai import types

# Assume image bytes or file path handled appropriately
response = client.models.generate_content(  # or interactions equivalent
    model="gemini-3.7-flash",
    contents=[
        types.Part.from_bytes(data=image_bytes, mime_type="image/jpeg"),
        "Describe the UI design system in this mockup and generate matching React + Tailwind code."
    ]
)

Patrones similares funcionan para entradas PDF, video y audio. Esto es potente para flujos de diseño‑a‑código, Q&A de documentos y análisis de video.

Implementa function calling / uso de herramientas

Declara herramientas en la solicitud y deja que el modelo decida cuándo llamarlas. CometAPI las pasa al backend subyacente de Gemini. Sigue el esquema oficial de function calling de Gemini (name, description, parameters como JSON Schema). Tras recibir una llamada de función, ejecuta la herramienta y devuelve el resultado en un turno posterior.

Parámetros de la API para Gemini 3.7 Flash

Al llamar mediante la Interactions API (recomendado), los parámetros clave incluyen:

  • model: "gemini-3.7-flash" (requerido)
  • input: Cadena o contenido estructurado (texto + partes multimodales)
  • generation_config (objeto opcional):
    • thinking_level: "low" | "medium" | "high" (por defecto medium)
    • Otros campos de configuración soportados para salidas estructuradas, seguridad, etc.
  • tools / declaraciones de funciones para uso de herramientas
  • system instructions (vía rol system o campo dedicado según el cliente)
  • Configuraciones de entorno/agente al usar agentes gestionados (p. ej., Antigravity)

Las llamadas de estilo generateContent nativo siguen disponibles, pero se prefiere la Interactions API para acceso completo a funciones y orquestación de agentes.

Se admite conteo de tokens, caching (implícito + explícito), inferencia por lotes y opciones de prioridad/flex.

Los parámetros y conceptos de configuración más importantes se resumen a continuación.

ParámetroPropósitoGuía para Gemini 3.7 Flash
modelSeleccionar modelogemini-3.7-flash
inputInstrucción del usuario en Interactions APIRequerido
generation_configControles de generaciónUsa los campos soportados en Gemini 3.x
thinking_levelControla el esfuerzo de razonamientolow, medium, high
contentsEntrada para generateContent de GeminiSe usa con solicitudes en formato Gemini
partsComponentes de contenido individualesContenido de texto/multimodal
temperatureAleatoriedad del muestreoNo usar
top_pMuestreo por núcleo (nucleus)No usar
top_kMuestreo Top‑KNo usar
thinking_budgetControl de razonamiento antiguoReemplazar por thinking_level
candidate_countMúltiples candidatosNo soportado en Gemini 3.x
previous_interaction_idContinuidad de la conversaciónRecomendado para flujos multi‑turno con Interactions API

La documentación de migración de Google señala explícitamente los parámetros obsoletos/no soportados y el nuevo patrón conversacional.

Mejores prácticas de producción y consejos de migración

  • Comienza con thinking_level="medium" y mide calidad vs latencia/costo.
  • Elimina parámetros obsoletos (temperature, top_p, top_k, budgets antiguos de razonamiento).
  • Prefiere la Interactions API para flujos agentivos multi‑paso e integración con Antigravity.
  • Para aplicaciones multimodelo, mantén la base URL de CometAPI y cambia solo la cadena del modelo—sin reautenticación.
  • Prueba a fondo con tus bucles de agente específicos; 3.7 Flash reduce bucles fallidos pero aún se beneficia de instrucciones system claras y esquemas de herramientas bien definidos.
  • Combínalo con otros modelos de CometAPI (p. ej., generadores de imagen especializados u otros modelos de razonamiento) cuando Gemini 3.7 Flash no sea la mejor opción para una subtarea.

Gestiona streaming, caching y solicitudes por lotes

  • El streaming se admite mediante los flags estándar de streaming tanto en clientes compatibles con OpenAI como en los nativos.
  • El caching de contexto (implícito y explícito) reduce el costo para contextos grandes repetidos.
  • Hay opciones de inferencia por lotes y prioridad para grandes volúmenes o latencia sensible—consulta la matriz de soporte actual de CometAPI y las opciones oficiales de consumo de Gemini.

Monitorea uso, costos y errores

Usa el panel de CometAPI para seguimiento en tiempo real de uso, costos y límites de tasa. Implementa backoff exponencial para errores 429 y respeta los límites de tasa documentados. Registra el uso de tokens de los metadatos de respuesta para una atribución precisa de costos.

Lista de verificación de migración de la API de Gemini 3.7 Flash

Antes de desplegar una aplicación existente de Gemini, marca cada elemento a continuación.

[ ] Change model ID to gemini-3.7-flash
[ ] Remove temperature
[ ] Remove top_p
[ ] Remove top_k
[ ] Replace thinking_budget with thinking_level
[ ] Remove candidate_count
[ ] Remove prefilled model turns
[ ] Review multi-turn conversation state
[ ] Review function-call handling
[ ] Check FunctionResponse call_id/name
[ ] Update SDK
[ ] Re-run production test suite
[ ] Benchmark low/medium/high thinking
[ ] Recalculate token costs
[ ] Test failure/retry behavior

La guía de migración de Google recomienda específicamente estos cambios al pasar a Gemini 3.7 Flash.

Preguntas frecuentes

¿Qué es la API de Gemini 3.7 Flash?

La API de Gemini 3.7 Flash proporciona acceso programático al modelo Gemini 3.7 Flash de Google. Google posiciona el modelo para programación, agentes, desarrollo web, trabajo con conocimiento y flujos complejos multi‑paso.

¿Cuánto cuesta Gemini 3.7 Flash?

Hasta el 31 de diciembre de 2026, el precio introductorio es de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida.

Desde el 1 de enero de 2027, Google indica que el precio pasa a $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.

¿Puedo seguir usando temperature con Gemini 3.7 Flash?

No deberías. La documentación de migración de Gemini 3.x de Google indica que temperature, top_p y top_k están obsoletos y deben eliminarse.

¿Puedo usar Gemini 3.7 Flash a través de CometAPI?

La plataforma de CometAPI actualmente anuncia la disponibilidad de Gemini 3.7 Flash y proporciona patrones de API en formato Gemini y compatibles con OpenAI. Dado que el modelo es reciente, los desarrolladores deben verificar la página actual del modelo y las capacidades del endpoint antes de un despliegue en producción.

¿Es CometAPI mejor que la API oficial de Gemini?

Ninguna es universalmente “mejor”. La API oficial de Gemini es la opción natural si quieres el ecosistema nativo de Google y funcionalidades específicas del proveedor. CometAPI es más atractivo cuando necesitas una interfaz unificada entre múltiples proveedores de IA, gestión centralizada y un cambio de modelos más sencillo.

Veredicto final: ¿Vale la pena usar Gemini 3.7 Flash?

Para desarrolladores que construyen aplicaciones de IA en 2026, Gemini 3.7 Flash merece atención seria.

El lanzamiento trata menos de hacer un chatbot marginalmente más inteligente y más de hacer que un modelo relativamente económico sea mejor en realmente hacer cosas.

La mayor consideración técnica es la migración.

Si tu aplicación se construyó alrededor de APIs antiguas de Gemini, no cambies simplemente el nombre del modelo. Elimina los parámetros de muestreo obsoletos, migra a thinking_level, elimina candidate_count no soportado, deja de prefijar turnos y revisa el comportamiento de function calling.

Para equipos construyendo exclusivamente con Google, la API nativa de Gemini es el punto de partida obvio.

Para equipos que construyen una pila multimodelo de IA, CometAPI ofrece una alternativa convincente: una capa de API, acceso centralizado a modelos y la posibilidad de experimentar con Gemini junto a otras familias importantes sin crear una integración separada para cada proveedor.

La recomendación práctica es simple:

Empieza con Gemini 3.7 Flash en esfuerzo de razonamiento medio, evalúalo contra tu carga real y luego usa razonamiento bajo o alto de forma selectiva según latencia, calidad y costos. Si tu producto también necesita múltiples proveedores de IA, evalúa la misma carga a través de CometAPI para comparar modelos sin rediseñar la arquitectura de tu aplicación.

Esa combinación—mejor rendimiento agentivo, una ventana de contexto de 1M de tokens, razonamiento configurable y precios agresivos en 2026—convierte a Gemini 3.7 Flash en uno de los lanzamientos de API más interesantes para desarrolladores que construyen agentes de IA en producción hoy.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Aug 14, 2026
Última actualización Aug 14, 2026
2 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más