Especificaciones técnicas de Gemini 3.7 Flash
| Elemento | Gemini 3.7 Flash |
|---|---|
| Model ID | gemini-3.7-flash |
| Provider | |
| Context | 1,048,576 tokens |
| Max Output | 65,536 tokens |
| Input | Texto / Imagen / Video / Audio / PDF |
| Thinking | Bajo / Medio / Alto |
| Function Calling | ✅ |
| Code Execution | ✅ |
| Search Grounding | ✅ |
| Google Maps Grounding | ✅ |
| URL Context | ✅ |
| File Search | ✅ |
| Computer Use | Vista previa |
| Knowledge Cutoff | marzo de 2026 |
| Release | 13 de agosto de 2026 |
¿Qué es Gemini 3.7 Flash?
Gemini 3.7 Flash es la iteración del 13 de agosto de 2026 de la línea Gemini 3 Flash de Google. Google lo posiciona como su caballo de batalla Flash más inteligente hasta la fecha para programación y agentes de IA, con mejoras centradas en ingeniería de software, desarrollo web, trabajo de conocimiento complejo y flujos de trabajo de múltiples pasos. Llegó tres semanas después de Gemini 3.6 Flash y se describe como el resultado de los comentarios de desarrolladores y de innovaciones algorítmicas.
Características principales
- 1M tokens de contexto: Admite grandes repositorios, documentos largos, conversaciones extendidas e historiales de agentes de múltiples pasos.
- Razonamiento multimodal: Acepta entradas de texto, imágenes, video, audio y PDF.
- Razonamiento configurable: Admite BAJO, MEDIO y ALTO;
MINIMALno está disponible. - Codificación basada en agentes: Grandes avances en depuración, resolución de incidencias, precisión en el primer intento y ingeniería de software a largo plazo.
- Desarrollo web y de UI: Mayor fidelidad a capturas de pantalla, imágenes y sistemas de diseño.
- Flujos de trabajo impulsados por herramientas: Llamadas a funciones, ejecución de código, anclaje con búsqueda, anclaje con Google Maps, contexto de URL, búsqueda de archivos y uso de computadora en vista previa.
- Trabajo de conocimiento intensivo en documentos: Rendimiento mejorado en finanzas, derecho, biociencias, comprensión de PDF y automatización empresarial.
Rendimiento en benchmarks
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 52 | 55 | 57 |
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 49.0% | — | — |
| GDM-MRCR v2 (8-needle, 128K) | 97.0% | 91.8% | 81.5% | 93.5% |
| OSWorld-2.0 | 47.9% | 33.8% | — | 50.2% |
| Agent's Last Exam | 26.3% | 24.2% | 33.3% | 28.0% |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% |
| LABBench2 | 82.1% | 76.1% | 80.1% | 81.2% |
Google también informa GDP.pdf en 34.0% frente a 22.0%, AutomationBench en 30.4% frente a 17.0%, y WebDev Arena Elo en 1588 frente a 1538 para Gemini 3.6 Flash.
Gemini 3.7 Flash vs Gemini 3.6 Flash vs Claude Sonnet 5
| Modelo | Posicionamiento | Contexto | Fortalezas clave |
|---|---|---|---|
| Gemini 3.7 Flash | Caballo de batalla agéntico eficiente | 1.05M | Programación, desarrollo web, agentes multimodales, flujos de trabajo de largo contexto |
| Gemini 3.6 Flash | Caballo de batalla Flash anterior | 1M | Cargas de trabajo generales de agentes y multimodales |
| Claude Sonnet 5 | Razonamiento/codificación de gama alta | Varía | Programación, trabajo de conocimiento, razonamiento |
Gemini 3.7 Flash resulta particularmente atractivo cuando una aplicación necesita equilibrar capacidad de frontera, procesamiento multimodal, contexto largo, uso de herramientas y economía de inferencia.
Limitaciones
- El razonamiento
MINIMALno está disponible. - No se admite la generación de imágenes; la salida es texto.
- No se admite Gemini Live API.
- La fecha límite de conocimientos es marzo de 2026.
- Google señala posibles alucinaciones, lentitud ocasional y problemas de tiempo de espera.
- El uso de computadora es actualmente una capacidad en vista previa.
Casos de uso
- Agentes de programación e ingeniería de software a escala de repositorios.
- Desarrollo web a partir de capturas de pantalla, imágenes o sistemas de diseño.
- Agentes empresariales de documentos y conocimiento.
- Automatización de flujos de trabajo multimodales.
- Agentes que usan herramientas con búsqueda, ejecución de código y llamadas a funciones.
- Análisis de largo contexto de grandes bases de código y colecciones de documentos.
- Automatización empresarial estructurada.