Especificaciones técnicas de Gemini 3.5 Flash-Lite
| Elemento | Gemini 3.5 Flash-Lite |
|---|---|
| Proveedor | Google DeepMind |
| Model ID | gemini-3.5-flash-lite |
| Familia de modelo | Gemini 3.5 |
| Disponibilidad | Disponibilidad general (GA) |
| Tipos de entrada | Text, Image, Video, Audio, PDF |
| Tipos de salida | Text |
| Ventana de contexto | 1,048,576 tokens |
| Salida máxima | 65,536 tokens |
| Pensamiento | Supported (default: minimal; also medium and high) |
| Function calling | Yes |
| Code execution | Yes |
| File Search | Yes |
| URL Context | Yes |
| Search Grounding | Yes |
| Structured Output | Yes |
| Computer Use | Not supported |
| Caching | Supported |
| Enfoque principal | Inferencia de alto rendimiento, baja latencia y bajo costo |
¿Qué es Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite es el modelo más rápido y rentable de Google dentro de la familia Gemini 3.5. Está optimizado para cargas de trabajo en las que la latencia, el rendimiento y el costo de la API son más importantes que el razonamiento máximo. Las aplicaciones típicas incluyen análisis de documentos, extracción de datos estructurados, enrutamiento, programación ligera y subagentes autónomos que operan a escala. Google la posiciona como la ruta de actualización recomendada desde Gemini 3.1 Flash-Lite y Gemini 2.5 Flash para despliegues en producción.
Características principales de Gemini 3.5 Flash-Lite
- Optimizado para inferencia de alto volumen y bajo costo.
- Admite una ventana de contexto de 1 millón de tokens para documentos y repositorios extensos.
- Entradas multimodales nativas, incluidos texto, imágenes, video, audio y PDF.
- Admite Function Calling, Code Execution, File Search, URL Context, Search Grounding y Structured Outputs.
- Niveles de pensamiento configurables (
minimal,medium,high) para equilibrar velocidad y calidad de razonamiento. - Mejora significativamente la programación, el razonamiento y los flujos de trabajo con agentes en comparación con Gemini 3.1 Flash-Lite, manteniendo una latencia muy baja.
Rendimiento en benchmarks de Gemini 3.5 Flash-Lite
Google afirma que Gemini 3.5 Flash-Lite supera ampliamente a las generaciones anteriores de Flash-Lite en programación, comprensión de documentos y flujos de trabajo con agentes, a la vez que sigue siendo el modelo de menor costo en la línea Gemini 3.5. Gemini 3.5 Flash-Lite obtuvo 54% en la prueba Terminal-Bench 2.1, una mejora significativa frente al 31% de su predecesor.
Sus puntos fuertes están en clasificación, extracción, respuestas de chat y respuestas simples mejoradas con recuperación. Precisamente donde los modelos rápidos y de bajo costo pueden destacar.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspecto | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Posicionamiento | El más rápido y barato para tareas cotidianas de alto volumen (p. ej., procesamiento de documentos, búsqueda) | Buque insignia actual de Flash: mejor equilibrio entre inteligencia, eficiencia y rendimiento con agentes | Modelo fuerte en agentes/programación (en gran parte superado por 3.6) |
| Ideal para | Flujos de trabajo de alto rendimiento y bajo costo | Programación, multimodal, agentes complejos, trabajo con conocimiento | Tareas generales con agentes y programación |
| Inteligencia / rendimiento | Bueno (supera a los Lite anteriores; competitivo en muchas tareas con agentes) | El más alto entre los tres (mejoras notables en programación y agentes) | Sólido (cercano a la frontera en la serie Flash) |
| Indicadores clave | - Terminal-Bench: ~54%- Fuerte en documentos y tareas de alto volumen | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Inferior a 3.6 en la mayoría de programación/con agentes |
| Velocidad | El más rápido (~350 tokens de salida/sec) | Muy rápido (~280 t/s) | Rápido |
| Eficiencia | Excelente para volumen | El mejor (17% menos tokens de salida en promedio; hasta 65% en programación) | Buena |
| Multimodal | Texto + Imagen + Video + Audio | Texto + Imagen + Video + Audio (razonamiento más sólido) | Texto + Imagen + Video + Audio |
| Ventana de contexto | ~1M tokens | ~1M tokens | ~1M tokens |
| Máximo de tokens de salida | ~64k | ~64k | ~64k |
| Precio (por 1M tokens) | El más barato: ~$0.30 entrada / $2.50 salida | $1.50 entrada / $7.50 salida | $1.50 entrada / $9.00 salida |
| Costo efectivo | Más bajo por tarea para trabajos simples | Más bajo que 3.5 debido a mejoras de eficiencia | Más alto que 3.6 |
Recomendaciones resumidas
- Elige 3.5 Flash-Lite — cuando necesites máxima velocidad y costo mínimo para tareas simples o de alto volumen.
- Elige 3.6 Flash — para la mayoría de usuarios y desarrolladores (la mejor opción general ahora mismo).
- Elige 3.5 Flash — solo si tienes flujos existentes ligados a él (planifica actualizar a 3.6).
Limitaciones de Gemini 3.5 Flash-Lite
- Optimizado para eficiencia más que para razonamiento de frontera.
- Computer Use no está admitido.
- La generación nativa de imágenes y audio no está disponible.
- El ajuste fino actualmente no está admitido.
- Las tareas complejas de razonamiento de múltiples pasos se adaptan mejor a Gemini 3.5 Flash o Gemini 3.6 Flash.