Especificações técnicas do Gemini 3.5 Flash-Lite
| Item | Gemini 3.5 Flash-Lite |
|---|---|
| Fornecedor | Google DeepMind |
| ID do modelo | gemini-3.5-flash-lite |
| Família do modelo | Gemini 3.5 |
| Disponibilidade | Disponibilidade Geral (GA) |
| Tipos de entrada | Texto, Imagem, Vídeo, Áudio, PDF |
| Tipos de saída | Texto |
| Janela de contexto | 1,048,576 tokens |
| Saída máxima | 65,536 tokens |
| Raciocínio | Suportado (padrão: minimal; também medium e high) |
| Function calling | Sim |
| Code execution | Sim |
| File Search | Sim |
| URL Context | Sim |
| Search Grounding | Sim |
| Structured Output | Sim |
| Computer Use | Não suportado |
| Caching | Suportado |
| Foco principal | Inferência de alto throughput, baixa latência e baixo custo |
O que é o Gemini 3.5 Flash-Lite?
O Gemini 3.5 Flash-Lite é o modelo mais rápido e mais econômico do Google na família Gemini 3.5. Ele é otimizado para cargas de trabalho em que latência, throughput e custo de API são mais importantes do que o desempenho máximo de raciocínio. Aplicações típicas incluem parsing de documentos, extração de dados estruturados, roteamento, codificação leve e subagentes autônomos em escala. O Google o posiciona como o caminho de atualização recomendado a partir do Gemini 3.1 Flash-Lite e do Gemini 2.5 Flash para implantações em produção.
Principais recursos do Gemini 3.5 Flash-Lite
- Otimizado para inferência de alto volume e baixo custo.
- Suporta uma janela de contexto de 1 milhão de tokens para documentos longos e repositórios.
- Entradas multimodais nativas, incluindo texto, imagens, vídeo, áudio e PDF.
- Suporta Function Calling, Code Execution, File Search, URL Context, Search Grounding e Structured Outputs.
- Níveis de raciocínio configuráveis (
minimal,medium,high) para equilibrar velocidade e qualidade de raciocínio. - Melhora significativamente a codificação, o raciocínio e os fluxos de trabalho com agentes em comparação com o Gemini 3.1 Flash-Lite, mantendo latência muito baixa.
Desempenho em benchmarks do Gemini 3.5 Flash-Lite
O Google afirma que o Gemini 3.5 Flash-Lite supera substancialmente as gerações anteriores do Flash-Lite em codificação, compreensão de documentos e fluxos de trabalho com agentes, ao mesmo tempo que permanece o modelo de menor custo na linha Gemini 3.5. O Gemini 3.5 Flash-Lite obteve 54% no teste Terminal-Bench 2.1, uma melhoria significativa em relação aos 31% de seu antecessor.
Seus pontos fortes residem em classificação, extração, respostas de chat e respostas simples aprimoradas por recuperação. É exatamente nesses cenários que modelos rápidos e de baixo custo podem se destacar.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspecto | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Posicionamento | Mais rápido e mais barato para tarefas cotidianas de alto volume (por exemplo, processamento de documentos, busca) | Flagship atual da linha Flash: melhor equilíbrio entre inteligência, eficiência e desempenho com agentes | Modelo forte para agentes/codificação (agora amplamente substituído pelo 3.6) |
| Melhor para | Workflows de alto throughput e baixo custo | Codificação, multimodalidade, agentes complexos, trabalho de conhecimento | Tarefas gerais com agentes e codificação |
| Inteligência / Desempenho | Bom (supera as Lites anteriores; competitivo em muitas tarefas com agentes) | O mais alto entre os três (ganhos notáveis em codificação e agentes) | Forte (próximo da fronteira para a série Flash) |
| Principais benchmarks | - Terminal-Bench: ~54%- Forte em tarefas de documentos & de alto volume | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Inferior ao 3.6 na maioria dos itens de codificação/agentes |
| Velocidade | Mais rápido (~350 tokens de saída/sec) | Muito rápido (~280 t/s) | Rápido |
| Eficiência | Excelente para volume | Melhor (17% menos tokens de saída em média; até 65% em codificação) | Boa |
| Multimodal | Texto + Imagem + Vídeo + Áudio | Texto + Imagem + Vídeo + Áudio (raciocínio mais forte) | Texto + Imagem + Vídeo + Áudio |
| Janela de contexto | ~1M tokens | ~1M tokens | ~1M tokens |
| Máx. de tokens de saída | ~64k | ~64k | ~64k |
| Preços (por 1M tokens) | Mais barato: ~$0.30 entrada / $2.50 saída | $1.50 entrada / $7.50 saída | $1.50 entrada / $9.00 saída |
| Custo efetivo | Mais baixo por tarefa para trabalho simples | Mais baixo que o 3.5 devido a ganhos de eficiência | Mais alto que o 3.6 |
Recomendações resumidas
- Escolha o 3.5 Flash-Lite — quando você precisa de máxima velocidade e custo mínimo para tarefas simples ou de alto volume.
- Escolha o 3.6 Flash — para a maioria dos usuários e desenvolvedores (a melhor opção geral hoje).
- Escolha o 3.5 Flash — apenas se você tiver fluxos existentes vinculados a ele (planeje atualizar para o 3.6).
Limitações do Gemini 3.5 Flash-Lite
- Otimizado para eficiência, não para raciocínio no nível de fronteira.
- Computer Use não é suportado.
- Geração nativa de imagem e áudio indisponível.
- Fine-tuning não é suportado no momento.
- Tarefas complexas de raciocínio em múltiplas etapas são geralmente mais adequadas ao Gemini 3.5 Flash ou ao Gemini 3.6 Flash.