Spécifications techniques de Gemini 3.5 Flash-Lite
| Élément | Gemini 3.5 Flash-Lite |
|---|---|
| Fournisseur | Google DeepMind |
| ID du modèle | gemini-3.5-flash-lite |
| Famille de modèles | Gemini 3.5 |
| Disponibilité | Disponibilité générale (GA) |
| Types d'entrée | Texte, Image, Vidéo, Audio, PDF |
| Types de sortie | Texte |
| Fenêtre de contexte | 1,048,576 jetons |
| Sortie maximale | 65,536 jetons |
| Réflexion | Pris en charge (par défaut : minimal ; également medium et high) |
| Appels de fonctions | Oui |
| Exécution de code | Oui |
| Recherche de fichiers | Oui |
| Contexte d'URL | Oui |
| Search Grounding | Oui |
| Sortie structurée | Oui |
| Computer Use | Non pris en charge |
| Mise en cache | Pris en charge |
| Objectif principal | Inférence à haut débit, faible latence et faible coût |
Qu'est-ce que Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite est le modèle le plus rapide et le plus économique de Google dans la famille Gemini 3.5. Il est optimisé pour les charges de travail où la latence, le débit et le coût API priment sur les performances maximales en raisonnement. Les applications typiques incluent l'analyse de documents, l'extraction de données structurées, le routage, le codage léger et des sous-agents autonomes opérant à grande échelle. Google le présente comme la voie de mise à niveau recommandée à partir de Gemini 3.1 Flash-Lite et Gemini 2.5 Flash pour les déploiements en production.
Principales fonctionnalités de Gemini 3.5 Flash-Lite
- Optimisé pour une inférence à grand volume et à faible coût.
- Prend en charge une fenêtre de contexte d'un million de jetons pour les longs documents et les référentiels.
- Entrées multimodales natives, incluant texte, images, vidéo, audio et PDF.
- Prend en charge Function Calling, Code Execution, File Search, URL Context, Search Grounding et Structured Outputs.
- Niveaux de réflexion configurables (
minimal,medium,high) pour équilibrer vitesse et qualité de raisonnement. - Améliore nettement le codage, le raisonnement et les workflows agentiques par rapport à Gemini 3.1 Flash-Lite tout en maintenant une très faible latence.
Performances de référence de Gemini 3.5 Flash-Lite
Google indique que Gemini 3.5 Flash-Lite surpasse largement les générations précédentes de Flash-Lite en codage, compréhension de documents et workflows agentiques, tout en restant le modèle le moins cher de la gamme Gemini 3.5. Gemini 3.5 Flash-Lite a obtenu 54 % au test Terminal-Bench 2.1, une amélioration significative par rapport aux 31 % de son prédécesseur.
Ses points forts résident dans la classification, l'extraction, les réponses en conversation et les réponses simples renforcées par la recherche. C'est précisément là que les modèles rapides et peu coûteux excellent.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspect | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Positionnement | Le plus rapide et le moins cher pour les tâches quotidiennes à grand volume (p. ex., traitement de documents, recherche) | Flash phare actuel : meilleur équilibre entre intelligence, efficacité et performances agentiques | Modèle agentique/codage performant (largement supplanté par 3.6) |
| Idéal pour | Workflows à haut débit et faible coût | Codage, multimodal, agents complexes, travail de connaissance | Tâches agentiques et de codage générales |
| Intelligence / Performances | Bonne (surpasse les anciennes versions Lite ; compétitif sur de nombreuses tâches agentiques) | La plus élevée des trois (gains notables en codage et agentique) | Solide (près de l'état de l'art pour la série Flash) |
| Principaux benchmarks | - Terminal-Bench : ~54% - Fort sur les documents et les tâches à grand volume | - DeepSWE : 49% (vs 37%) - MLE-Bench : 63.9% (vs 49.7%) - OSWorld : 83% (vs 78.4%) | - Terminal-Bench : 76.2% - Inférieur à 3.6 sur la plupart des tâches de codage/agentiques |
| Vitesse | Le plus rapide (~350 jetons de sortie/sec) | Très rapide (~280 t/s) | Rapide |
| Efficacité | Excellente pour le volume | Meilleure (17% de jetons de sortie en moins en moyenne ; jusqu'à 65% sur le codage) | Bonne |
| Multimodal | Texte + Image + Vidéo + Audio | Texte + Image + Vidéo + Audio (raisonnement renforcé) | Texte + Image + Vidéo + Audio |
| Fenêtre de contexte | ~1M jetons | ~1M jetons | ~1M jetons |
| Jetons de sortie max | ~64k | ~64k | ~64k |
| Tarification (par 1M de jetons) | Le moins cher : ~$0.30 entrée / $2.50 sortie | $1.50 entrée / $7.50 sortie | $1.50 entrée / $9.00 sortie |
| Coût effectif | Le plus bas par tâche pour un travail simple | Inférieur à 3.5 grâce aux gains d'efficacité | Plus élevé que 3.6 |
Recommandations résumées
- Choisissez 3.5 Flash-Lite — lorsque vous avez besoin d'une vitesse maximale et d'un coût minimal pour des tâches simples ou à grand volume.
- Choisissez 3.6 Flash — pour la plupart des utilisateurs et des développeurs (meilleur choix global actuellement).
- Choisissez 3.5 Flash — uniquement si vos workflows existants y sont liés (prévoir une mise à niveau vers 3.6).
Limites de Gemini 3.5 Flash-Lite
- Optimisé pour l'efficacité plutôt que pour un raisonnement de pointe.
- Computer Use n'est pas pris en charge.
- La génération native d'images et d'audio n'est pas disponible.
- Le fine-tuning n'est actuellement pas pris en charge.
- Les tâches de raisonnement complexe en plusieurs étapes conviennent généralement mieux à Gemini 3.5 Flash ou Gemini 3.6 Flash.