Specifiche tecniche di Gemini 3.5 Flash-Lite
| Voce | Gemini 3.5 Flash-Lite |
|---|---|
| Fornitore | Google DeepMind |
| ID modello | gemini-3.5-flash-lite |
| Famiglia del modello | Gemini 3.5 |
| Disponibilità | Disponibilità generale (GA) |
| Tipi di input | Testo, Immagine, Video, Audio, PDF |
| Tipi di output | Testo |
| Finestra di contesto | 1,048,576 token |
| Output massimo | 65,536 token |
| Ragionamento | Supportato (predefinito: minimo; anche medio e alto) |
| Chiamata di funzioni | Sì |
| Esecuzione di codice | Sì |
| Ricerca file | Sì |
| Contesto URL | Sì |
| Grounding basato sulla ricerca | Sì |
| Output strutturato | Sì |
| Uso del computer | Non supportato |
| Caching | Supportato |
| Focus principale | Inferenza ad alto throughput, bassa latenza e basso costo |
Che cos'è Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite è il modello più veloce e conveniente di Google nella famiglia Gemini 3.5. È ottimizzato per carichi di lavoro in cui latenza, throughput e costo dell’API sono più importanti delle massime prestazioni di ragionamento. Le applicazioni tipiche includono parsing dei documenti, estrazione di dati strutturati, instradamento, programmazione leggera e sottoagenti autonomi operanti su larga scala. Google lo presenta come il percorso di upgrade consigliato da Gemini 3.1 Flash-Lite e Gemini 2.5 Flash per distribuzioni in produzione.
Funzionalità principali di Gemini 3.5 Flash-Lite
- Ottimizzato per inferenza ad alto volume e basso costo.
- Supporta una finestra di contesto da 1 milione di token per documenti e repository lunghi.
- Input multimodali nativi, inclusi testo, immagini, video, audio e PDF.
- Supporta chiamata di funzioni, esecuzione di codice, ricerca file, contesto URL, grounding basato sulla ricerca e output strutturati.
- Livelli di ragionamento configurabili (
minimal,medium,high) per bilanciare velocità e qualità del ragionamento. - Migliora in modo significativo coding, ragionamento e workflow agentici rispetto a Gemini 3.1 Flash-Lite, mantenendo una latenza molto bassa.
Prestazioni nei benchmark di Gemini 3.5 Flash-Lite
Secondo Google, Gemini 3.5 Flash-Lite supera sostanzialmente le precedenti generazioni di Flash-Lite in coding, comprensione dei documenti e workflow agentici, restando al contempo il modello a costo più basso nella linea Gemini 3.5. Gemini 3.5 Flash-Lite ha ottenuto il 54% nel test Terminal-Bench 2.1, un miglioramento significativo rispetto al 31% del suo predecessore.
I suoi punti di forza risiedono in classificazione, estrazione, risposte in chat e risposte semplici potenziate dal retrieval. Sono proprio questi gli ambiti in cui i modelli veloci e a basso costo possono eccellere.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspetto | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Posizionamento | Più veloce ed economico per attività quotidiane ad alto volume (ad es. elaborazione di documenti, ricerca) | Modello di punta attuale della serie Flash: miglior equilibrio tra intelligenza, efficienza e prestazioni agentiche | Solido modello per agenti/codifica (ora in gran parte superato da 3.6) |
| Ideale per | Flussi di lavoro ad alto throughput e basso costo | Programmazione, multimodale, agenti complessi, lavoro della conoscenza | Attività generali di agenti e programmazione |
| Intelligenza / Prestazioni | Buona (supera le versioni Lite precedenti; competitiva in molte attività agentiche) | La più alta tra le tre (miglioramenti sensibili in programmazione e capacità agentiche) | Solida (vicina allo stato dell’arte per la serie Flash) |
| Benchmark chiave | - Terminal-Bench: ~54%- Forte su attività con documenti e ad alto volume | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Inferiore a 3.6 nella maggior parte della programmazione/agentico |
| Velocità | Più veloce (~350 token di output/sec) | Molto veloce (~280 t/s) | Veloce |
| Efficienza | Eccellente per il volume | La migliore (in media il 17% di token di output in meno; fino al 65% nella programmazione) | Buona |
| Multimodale | Testo + Immagine + Video + Audio | Testo + Immagine + Video + Audio (ragionamento più forte) | Testo + Immagine + Video + Audio |
| Finestra di contesto | ~1M token | ~1M token | ~1M token |
| Token di output massimi | ~64k | ~64k | ~64k |
| Prezzi (per 1M token) | Il più economico: ~$0.30 input / $2.50 output | $1.50 input / $7.50 output | $1.50 input / $9.00 output |
| Costo effettivo | Più basso per task semplici | Inferiore a 3.5 grazie ai guadagni di efficienza | Superiore a 3.6 |
Raccomandazioni in sintesi
- Scegli 3.5 Flash-Lite — quando ti servono massima velocità e costo minimo per task ad alto volume o semplici.
- Scegli 3.6 Flash — per la maggior parte degli utenti e degli sviluppatori (la scelta complessiva migliore al momento).
- Scegli 3.5 Flash — solo se hai workflow esistenti vincolati a questo modello (pianifica l'upgrade a 3.6).
Limitazioni di Gemini 3.5 Flash-Lite
- Ottimizzato per l’efficienza più che per il ragionamento allo stato dell’arte.
- L’uso del computer non è supportato.
- La generazione nativa di immagini e audio non è disponibile.
- Il fine-tuning al momento non è supportato.
- I compiti di ragionamento complessi a più passaggi sono generalmente più adatti a Gemini 3.5 Flash o Gemini 3.6 Flash.