Specifiche tecniche di Gemini 3.5 Flash-Lite
| Voce | Gemini 3.5 Flash-Lite |
|---|---|
| Fornitore | Google DeepMind |
| ID modello | gemini-3.5-flash-lite |
| Famiglia del modello | Gemini 3.5 |
| Disponibilità | General Availability (GA) |
| Tipi di input | Testo, Immagine, Video, Audio, PDF |
| Tipi di output | Testo |
| Finestra di contesto | 1,048,576 tokens |
| Output massimo | 65,536 tokens |
| Ragionamento | Supportato (predefinito: minimal; anche medium e high) |
| Function calling | Sì |
| Code execution | Sì |
| File Search | Sì |
| URL Context | Sì |
| Search Grounding | Sì |
| Structured Output | Sì |
| Computer Use | Non supportato |
| Caching | Supportato |
| Focus principale | Inferenza ad alto throughput, bassa latenza e basso costo |
Che cos'è Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite è il modello più veloce e conveniente della famiglia Gemini 3.5 di Google. È ottimizzato per carichi di lavoro in cui latenza, throughput e costo API sono più importanti delle massime prestazioni di ragionamento. Le applicazioni tipiche includono parsing dei documenti, estrazione di dati strutturati, instradamento, coding leggero e sottoagenti autonomi operanti su larga scala. Google lo posiziona come il percorso di aggiornamento consigliato da Gemini 3.1 Flash-Lite e Gemini 2.5 Flash per le distribuzioni in produzione.
Caratteristiche principali di Gemini 3.5 Flash-Lite
- Ottimizzato per inferenza ad alto volume e basso costo.
- Supporta una finestra di contesto da 1 milione di token per documenti lunghi e repository.
- Input multimodali nativi, inclusi testo, immagini, video, audio e PDF.
- Supporta Function Calling, Code Execution, File Search, URL Context, Search Grounding e Structured Outputs.
- Livelli di ragionamento configurabili (
minimal,medium,high) per bilanciare velocità e qualità del ragionamento. - Migliora in modo significativo coding, ragionamento e workflow agentici rispetto a Gemini 3.1 Flash-Lite, mantenendo una latenza molto bassa.
Prestazioni nei benchmark di Gemini 3.5 Flash-Lite
Google afferma che Gemini 3.5 Flash-Lite supera in modo sostanziale le precedenti generazioni Flash-Lite in coding, comprensione dei documenti e workflow agentici, rimanendo il modello a costo più basso nella lineup Gemini 3.5. Gemini 3.5 Flash-Lite ha ottenuto il 54% nel test Terminal-Bench 2.1, un miglioramento significativo rispetto al 31% del suo predecessore.
I suoi punti di forza risiedono in classificazione, estrazione, risposte in chat e risposte semplici potenziate dal retrieval. Sono proprio questi gli ambiti in cui i modelli veloci e a basso costo possono eccellere.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspetto | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Posizionamento | Il più rapido e conveniente per attività quotidiane ad alto volume (es. elaborazione documentale, ricerca) | Modello di punta attuale della linea Flash: miglior equilibrio tra intelligenza, efficienza e performance agentiche | Modello solido per agentic/coding (ora in gran parte superato dal 3.6) |
| Ideale per | Workflow ad alto throughput e basso costo | Coding, multimodale, agenti complessi, knowledge work | Attività generali di agentic e coding |
| Intelligenza / Prestazioni | Buona (supera le versioni Lite precedenti; competitiva in molte attività agentiche) | La più alta tra le tre (miglioramenti evidenti in coding e agentic) | Solida (vicina al livello di frontiera per la serie Flash) |
| Benchmark chiave | - Terminal-Bench: ~54%- Forte su attività relative ai documenti e ad alto volume | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Inferiore al 3.6 nella maggior parte delle attività di coding/agentic |
| Velocità | La più veloce (~350 token di output/sec) | Molto veloce (~280 t/s) | Veloce |
| Efficienza | Eccellente per grandi volumi | La migliore (in media il 17% di token di output in meno; fino al 65% sul coding) | Buona |
| Multimodale | Testo + Immagine + Video + Audio | Testo + Immagine + Video + Audio (ragionamento più solido) | Testo + Immagine + Video + Audio |
| Finestra di contesto | ~1M tokens | ~1M tokens | ~1M tokens |
| Max token di output | ~64k | ~64k | ~64k |
| Prezzi (per 1M tokens) | Più economico: ~$0.30 input / $2.50 output | $1.50 input / $7.50 output | $1.50 input / $9.00 output |
| Costo effettivo | Più basso per attività semplici | Inferiore rispetto al 3.5 grazie ai miglioramenti di efficienza | Superiore al 3.6 |
Raccomandazioni in sintesi
- Scegli 3.5 Flash-Lite — quando ti servono velocità massima e costo minimo per attività ad alto volume o semplici.
- Scegli 3.6 Flash — per la maggior parte degli utenti e degli sviluppatori (la scelta complessiva migliore al momento).
- Scegli 3.5 Flash — solo se hai workflow esistenti legati a questo modello (pianifica l'upgrade a 3.6).
Limitazioni di Gemini 3.5 Flash-Lite
- Ottimizzato per l'efficienza più che per il ragionamento a livello di frontiera.
- Computer Use non è supportato.
- La generazione nativa di immagini e audio non è disponibile.
- Il fine-tuning al momento non è supportato.
- Le attività di ragionamento complesse e multi-step sono in genere più adatte a Gemini 3.5 Flash o Gemini 3.6 Flash.