Spécifications techniques de Gemini 3.5 Flash-Lite
| Élément | Gemini 3.5 Flash-Lite |
|---|---|
| Fournisseur | Google DeepMind |
| ID du modèle | gemini-3.5-flash-lite |
| Famille de modèle | Gemini 3.5 |
| Disponibilité | Disponibilité générale (GA) |
| Types d'entrée | Texte, Image, Vidéo, Audio, PDF |
| Types de sortie | Texte |
| Fenêtre de contexte | 1,048,576 jetons |
| Sortie maximale | 65,536 jetons |
| Raisonnement | Pris en charge (par défaut: minimal; aussi medium et high) |
| Appel de fonctions | Oui |
| Exécution de code | Oui |
| Recherche de fichiers | Oui |
| Contexte d'URL | Oui |
| Ancrage de recherche | Oui |
| Sortie structurée | Oui |
| Utilisation de l'ordinateur | Non prise en charge |
| Mise en cache | Pris en charge |
| Objectif principal | Inférence à haut débit, faible latence et faible coût |
Qu'est-ce que Gemini 3.5 Flash-Lite ?
Gemini 3.5 Flash-Lite est le modèle le plus rapide et le plus économique de Google au sein de la famille Gemini 3.5. Il est optimisé pour les charges où la latence, le débit et le coût API sont plus importants que des performances de raisonnement maximales. Les applications typiques comprennent l'analyse de documents, l'extraction de données structurées, le routage, le codage léger et des sous-agents autonomes opérant à grande échelle. Google le positionne comme la voie de mise à niveau recommandée depuis Gemini 3.1 Flash-Lite et Gemini 2.5 Flash pour les déploiements en production.
Principales fonctionnalités de Gemini 3.5 Flash-Lite
- Optimisé pour une inférence à haut volume et faible coût.
- Prend en charge une fenêtre de contexte de 1 million de jetons pour les longs documents et dépôts.
- Entrées multimodales natives incluant texte, images, vidéo, audio et PDF.
- Prend en charge Function Calling, Code Execution, File Search, URL Context, Search Grounding et Structured Outputs.
- Niveaux de raisonnement configurables (
minimal,medium,high) pour équilibrer vitesse et qualité du raisonnement. - Améliore significativement le codage, le raisonnement et les workflows agentiques par rapport à Gemini 3.1 Flash-Lite tout en maintenant une latence très faible.
Performances de référence de Gemini 3.5 Flash-Lite
Google indique que Gemini 3.5 Flash-Lite surpasse largement les générations précédentes de Flash-Lite en codage, compréhension de documents et workflows agentiques, tout en restant le modèle le moins coûteux de la gamme Gemini 3.5. Gemini 3.5 Flash-Lite a obtenu 54% au test Terminal-Bench 2.1, une amélioration significative par rapport aux 31% de son prédécesseur.
Ses points forts résident dans la classification, l'extraction, les réponses en chat et les réponses simples améliorées par la récupération. C'est précisément là où les modèles rapides et peu coûteux peuvent exceller.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspect | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Positionnement | Le plus rapide et le moins cher pour les tâches quotidiennes à haut volume (par ex., traitement de documents, recherche) | Flagship Flash actuel: Meilleur équilibre entre intelligence, efficacité et performances agentiques | Modèle performant en agentique/codage (largement supplanté par 3.6) |
| Idéal pour | Workflows à haut débit et faible coût | Codage, multimodal, agents complexes, travail de connaissance | Tâches agentiques et de codage générales |
| Intelligence / Performance | Bonne (surpasse les Lites plus anciens; compétitif sur de nombreuses tâches agentiques) | La plus élevée des trois (gains sensibles en codage et agentique) | Forte (proche de l'état de l'art pour la série Flash) |
| Principaux benchmarks | - Terminal-Bench: ~54%- Solide sur les documents et les tâches à fort volume | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Inférieur à 3.6 sur la plupart des tâches de codage/agentiques |
| Vitesse | La plus rapide (~350 jetons de sortie/sec) | Très rapide (~280 t/s) | Rapide |
| Efficacité | Excellente pour le volume | Meilleure (17% de jetons de sortie en moins en moyenne; jusqu'à 65% en codage) | Bonne |
| Multimodal | Texte + Image + Vidéo + Audio | Texte + Image + Vidéo + Audio (meilleur raisonnement) | Texte + Image + Vidéo + Audio |
| Fenêtre de contexte | ~1M jetons | ~1M jetons | ~1M jetons |
| Jetons de sortie max | ~64k | ~64k | ~64k |
| Tarification (par 1M de jetons) | Le moins cher: ~$0.30 entrée / $2.50 sortie | $1.50 entrée / $7.50 sortie | $1.50 entrée / $9.00 sortie |
| Coût effectif | Le plus bas par tâche pour un travail simple | Inférieur à 3.5 grâce aux gains d'efficacité | Plus élevé que 3.6 |
Recommandations synthétiques
- Choisissez 3.5 Flash-Lite — lorsque vous avez besoin d'une vitesse maximale et d'un coût minimal pour des tâches simples ou à grand volume.
- Choisissez 3.6 Flash — pour la plupart des utilisateurs et développeurs (meilleur choix global à ce jour).
- Choisissez 3.5 Flash — seulement si vos workflows y sont déjà liés (prévoir une mise à niveau vers 3.6).
Limitations de Gemini 3.5 Flash-Lite
- Optimisé pour l'efficacité plutôt que pour un raisonnement de pointe.
- Utilisation de l'ordinateur non prise en charge.
- La génération native d'images et d'audio n'est pas disponible.
- Le fine-tuning n'est pas pris en charge pour le moment.
- Les tâches complexes de raisonnement multi-étapes conviennent généralement mieux à Gemini 3.5 Flash ou Gemini 3.6 Flash.