Especificaciones técnicas de Gemini 3.5 Flash-Lite
| Elemento | Gemini 3.5 Flash-Lite |
|---|---|
| Proveedor | Google DeepMind |
| ID de modelo | gemini-3.5-flash-lite |
| Familia de modelos | Gemini 3.5 |
| Disponibilidad | Disponibilidad general (GA) |
| Tipos de entrada | Texto, imagen, video, audio, PDF |
| Tipos de salida | Texto |
| Ventana de contexto | 1,048,576 tokens |
| Salida máxima | 65,536 tokens |
| Razonamiento | Compatible (predeterminado: mínimo; también medio y alto) |
| Llamadas a funciones | Sí |
| Ejecución de código | Sí |
| Búsqueda de archivos | Sí |
| Contexto de URL | Sí |
| Grounding de búsqueda | Sí |
| Salida estructurada | Sí |
| Uso de computadora | No compatible |
| Almacenamiento en caché | Compatible |
| Enfoque principal | Inferencia de alto rendimiento, baja latencia y bajo costo |
¿Qué es Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite es el modelo más rápido y rentable de Google dentro de la familia Gemini 3.5. Está optimizado para cargas de trabajo en las que la latencia, el rendimiento y el costo de la API son más importantes que el rendimiento máximo de razonamiento. Las aplicaciones típicas incluyen análisis de documentos, extracción de datos estructurados, enrutamiento, programación ligera y subagentes autónomos que operan a escala. Google lo posiciona como la ruta de actualización recomendada desde Gemini 3.1 Flash-Lite y Gemini 2.5 Flash para implementaciones en producción.
Características principales de Gemini 3.5 Flash-Lite
- Optimizado para inferencia de alto volumen y bajo costo.
- Admite una ventana de contexto de 1 millón de tokens para documentos y repositorios largos.
- Entradas multimodales nativas, incluidos texto, imágenes, video, audio y PDF.
- Admite llamadas a funciones, ejecución de código, búsqueda de archivos, contexto de URL, grounding de búsqueda y salidas estructuradas.
- Niveles de razonamiento configurables (
minimal,medium,high) para equilibrar velocidad y calidad de razonamiento. - Mejora significativamente la programación, el razonamiento y los flujos de trabajo basados en agentes en comparación con Gemini 3.1 Flash-Lite, manteniendo una latencia muy baja.
Rendimiento en pruebas comparativas de Gemini 3.5 Flash-Lite
Google afirma que Gemini 3.5 Flash-Lite supera ampliamente a generaciones anteriores de Flash-Lite en programación, comprensión de documentos y flujos de trabajo basados en agentes, al tiempo que se mantiene como el modelo de menor costo en la línea Gemini 3.5. Gemini 3.5 Flash-Lite obtuvo un 54% en la prueba Terminal-Bench 2.1, una mejora significativa frente al 31% de su predecesor.
Sus puntos fuertes están en la clasificación, la extracción, las respuestas de chat y las respuestas simples mejoradas con recuperación. Precisamente en estas áreas los modelos rápidos y de bajo costo pueden destacar.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspecto | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Posicionamiento | El más rápido y barato para tareas cotidianas de alto volumen (p. ej., procesamiento de documentos, búsqueda) | Flash insignia actual: el mejor equilibrio entre inteligencia, eficiencia y rendimiento basado en agentes | Modelo sólido para agentes/programación (ahora en gran medida reemplazado por 3.6) |
| Mejor para | Flujos de trabajo de alto rendimiento y bajo costo | Programación, multimodalidad, agentes complejos, trabajo del conocimiento | Tareas generales de agentes y programación |
| Inteligencia / rendimiento | Bueno (supera a Lites anteriores; competitivo en muchas tareas basadas en agentes) | El más alto entre los tres (mejoras notables en programación y agentes) | Sólido (cercano a la frontera dentro de la serie Flash) |
| Benchmarks clave | - Terminal-Bench: ~54% - Fuerte en tareas de documentos y alto volumen | - DeepSWE: 49% (vs 37%) - MLE-Bench: 63.9% (vs 49.7%) - OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2% - Inferior a 3.6 en la mayoría de aspectos de programación/agentes |
| Velocidad | El más rápido (~350 tokens de salida/seg) | Muy rápido (~280 t/s) | Rápido |
| Eficiencia | Excelente para volumen | La mejor (17% menos tokens de salida en promedio; hasta 65% en programación) | Buena |
| Multimodal | Texto + imagen + video + audio | Texto + imagen + video + audio (razonamiento más sólido) | Texto + imagen + video + audio |
| Ventana de contexto | ~1M tokens | ~1M tokens | ~1M tokens |
| Tokens máximos de salida | ~64k | ~64k | ~64k |
| Precio (por 1M tokens) | Más barato: ~$0.30 entrada / $2.50 salida | $1.50 entrada / $7.50 salida | $1.50 entrada / $9.00 salida |
| Costo efectivo | Más bajo por tarea para trabajo simple | Más bajo que 3.5 debido a las mejoras de eficiencia | Más alto que 3.6 |
Recomendaciones resumidas
- Elige 3.5 Flash-Lite — cuando necesites máxima velocidad y costo mínimo para tareas de alto volumen o simples.
- Elige 3.6 Flash — para la mayoría de usuarios y desarrolladores (la mejor opción general en este momento).
- Elige 3.5 Flash — solo si tienes flujos de trabajo existentes ligados a él (planea actualizar a 3.6).
Limitaciones de Gemini 3.5 Flash-Lite
- Optimizado para la eficiencia más que para un razonamiento de nivel frontera.
- El uso de computadora no es compatible.
- La generación nativa de imágenes y audio no está disponible.
- Actualmente no se admite el ajuste fino.
- Las tareas complejas de razonamiento de múltiples pasos generalmente se adaptan mejor a Gemini 3.5 Flash o Gemini 3.6 Flash.