Especificações Técnicas do Gemini 3.5 Flash-Lite
| Item | Gemini 3.5 Flash-Lite |
|---|---|
| Fornecedor | Google DeepMind |
| ID do modelo | gemini-3.5-flash-lite |
| Família do modelo | Gemini 3.5 |
| Disponibilidade | Disponibilidade Geral (GA) |
| Tipos de entrada | Texto, Imagem, Vídeo, Áudio, PDF |
| Tipos de saída | Texto |
| Janela de contexto | 1,048,576 tokens |
| Saída máxima | 65,536 tokens |
| Raciocínio | Suportado (padrão: minimal; também medium e high) |
| Chamadas de função | Sim |
| Execução de código | Sim |
| Pesquisa de arquivos | Sim |
| Contexto de URL | Sim |
| Grounding de pesquisa | Sim |
| Saída estruturada | Sim |
| Uso de computador | Não suportado |
| Cache | Suportado |
| Foco principal | Inferência de alto throughput, baixa latência e baixo custo |
O que é o Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite é o modelo mais rápido e mais econômico do Google na família Gemini 3.5. É otimizado para cargas de trabalho em que latência, throughput e custo de API são mais importantes que o desempenho máximo de raciocínio. Aplicações típicas incluem parsing de documentos, extração de dados estruturados, roteamento, codificação leve e subagentes autônomos operando em escala. O Google o posiciona como o caminho de atualização recomendado a partir do Gemini 3.1 Flash-Lite e do Gemini 2.5 Flash para implantações em produção.
Principais recursos do Gemini 3.5 Flash-Lite
- Otimizado para inferência de alto volume e baixo custo.
- Suporta uma janela de contexto de 1 milhão de tokens para documentos e repositórios longos.
- Entradas multimodais nativas, incluindo texto, imagens, vídeo, áudio e PDF.
- Suporta Chamadas de função, Execução de código, Pesquisa de arquivos, Contexto de URL, Grounding de pesquisa e Saídas estruturadas.
- Níveis de raciocínio configuráveis (
minimal,medium,high) para equilibrar velocidade e qualidade de raciocínio. - Melhora significativamente codificação, raciocínio e fluxos de trabalho com agentes em comparação ao Gemini 3.1 Flash-Lite, mantendo latência muito baixa.
Desempenho em benchmarks do Gemini 3.5 Flash-Lite
O Google afirma que o Gemini 3.5 Flash-Lite supera substancialmente as gerações anteriores do Flash-Lite em codificação, compreensão de documentos e fluxos de trabalho com agentes, permanecendo o modelo de menor custo na linha Gemini 3.5. O Gemini 3.5 Flash-Lite obteve 54% no teste Terminal-Bench 2.1, uma melhoria significativa em relação aos 31% do seu antecessor.
Seus pontos fortes estão em classificação, extração, respostas em chat e respostas simples com recuperação aprimorada. É exatamente nesses casos que modelos rápidos e de baixo custo podem se destacar.
Gemini 3.5 Flash-Lite vs Gemini 3.6 Flash vs Gemini 3.5 Flash
| Aspecto | Gemini 3.5 Flash-Lite | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|---|
| Posicionamento | Mais rápido e mais barato para tarefas cotidianas de alto volume (ex.: processamento de documentos, busca) | Flash atual principal: melhor equilíbrio entre inteligência, eficiência e desempenho em agentes | Modelo forte para agentes/codificação (agora amplamente substituído pelo 3.6) |
| Melhor para | Workflows de alto throughput e baixo custo | Codificação, multimodal, agentes complexos, trabalho de conhecimento | Tarefas gerais de agentes e codificação |
| Inteligência / Desempenho | Bom (supera Lites mais antigos; competitivo em muitas tarefas com agentes) | O mais alto entre os três (ganhos notáveis em codificação e agentes) | Forte (próximo da fronteira para a série Flash) |
| Principais benchmarks | - Terminal-Bench: ~54%- Forte em tarefas de documentos e de alto volume | - DeepSWE: 49% (vs 37%)- MLE-Bench: 63.9% (vs 49.7%)- OSWorld: 83% (vs 78.4%) | - Terminal-Bench: 76.2%- Inferior ao 3.6 na maioria das tarefas de codificação/agentes |
| Velocidade | Mais rápido (~350 tokens de saída/seg) | Muito rápido (~280 t/s) | Rápido |
| Eficiência | Excelente para volume | Melhor (17% menos tokens de saída em média; até 65% em codificação) | Boa |
| Multimodal | Texto + Imagem + Vídeo + Áudio | Texto + Imagem + Vídeo + Áudio (raciocínio mais forte) | Texto + Imagem + Vídeo + Áudio |
| Janela de contexto | ~1M tokens | ~1M tokens | ~1M tokens |
| Máximo de tokens de saída | ~64k | ~64k | ~64k |
| Preços (por 1M tokens) | Mais barato: ~$0.30 entrada / $2.50 saída | $1.50 entrada / $7.50 saída | $1.50 entrada / $9.00 saída |
| Custo efetivo | Mais baixo por tarefa para trabalho simples | Mais baixo que o 3.5 devido a ganhos de eficiência | Mais alto que o 3.6 |
Recomendações resumidas
- Escolha o 3.5 Flash-Lite — quando você precisar de velocidade máxima e custo mínimo para tarefas de alto volume ou simples.
- Escolha o 3.6 Flash — para a maioria dos usuários e desenvolvedores (melhor escolha geral no momento).
- Escolha o 3.5 Flash — apenas se você tiver fluxos de trabalho existentes vinculados a ele (planeje atualizar para o 3.6).
Limitações do Gemini 3.5 Flash-Lite
- Otimizado para eficiência, em vez de raciocínio em nível de ponta.
- Uso de computador não é suportado.
- Geração nativa de imagens e áudio indisponível.
- Ajuste fino não é suportado no momento.
- Tarefas complexas de raciocínio em múltiplas etapas geralmente são mais adequadas ao Gemini 3.5 Flash ou ao Gemini 3.6 Flash.