TL;DR O lançamento mais recente do Gemini pelo Google não é o aguardado Gemini 3.5 Pro. Em vez disso, o Google disponibilizou três modelos focados em eficiência: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite e Gemini 3.5 Flash Cyber. A mensagem prática é clara: o Google está priorizando a economia de agentes, a latência, a eficiência de tokens e a automação de segurança especializada enquanto seu modelo Pro carro-chefe ainda está em testes.
Para desenvolvedores, a melhor decisão não é esperar passivamente pelo Gemini 3.5 Pro. Use o Gemini 3.6 Flash como candidato padrão de upgrade para agentes complexos e fluxos de trabalho de código; use o Gemini 3.5 Flash-Lite para extração e roteamento em alto volume; e mantenha uma estratégia de fallback entre modelos para tarefas de raciocínio de fronteira. A CometAPI fornece acesso unificado a 500+ modelos por meio de uma única chave de API compatível com a OpenAI, para que o Gemini possa ser testado ao lado de GPT, Claude, DeepSeek, Kimi, Qwen e outros modelos sem reconstruir sua integração.
Principais pontos
- Google anunciou o Gemini 3.6 Flash, Gemini 3.5 Flash-Lite e Gemini 3.5 Flash Cyber em 21 de julho de 2026. O Gemini 3.5 Pro não foi lançado nesta data. O Google diz que está testando com parceiros e estará amplamente disponível quando pronto.
- O Gemini 3.6 Flash está geralmente disponível na Gemini API, Google AI Studio, Gemini Enterprise Agent Platform, aplicativo Gemini e Google Antigravity. O Gemini 3.5 Flash-Lite está geralmente disponível na Gemini API e tem como alvo fluxos de trabalho de alta vazão e baixo custo.
- O Gemini 3.5 Flash Cyber possui acesso limitado, projetado para detecção de vulnerabilidades, validação e aplicação de patches dentro do CodeMender.
- Google relata que o Gemini 3.6 Flash usa 17% menos tokens de saída do que o 3.5 Flash no Artificial Analysis e até 65% menos tokens de saída em testes ao estilo DeepSWE.
- Artificial Analysis relata de forma independente o Gemini 3.6 Flash com pontuação de 50 no Intelligence Index, 251,3 tokens de saída/s e uma redução do custo médio por tarefa de $0,59 para $0,50 em comparação ao Gemini 3.5 Flash.
- DeepSWE lista o Gemini 3.6 Flash com 49% de pass@1 e custo médio de $3,53 por tarefa, comparado ao Gemini 3.5 Flash com 37% de pass@1 e $7,34 de custo médio por tarefa.
- A CometAPI atualmente lista o Gemini 3.6 Flash a $1,20/M de entrada e $6,00/M de saída, e o Gemini 3.5 Flash-Lite a $0,24/M de entrada e $2,016/M de saída. Verifique o painel ao vivo antes de publicar preços na interface do produto.
O que o Google lançou?
Gemini 3.6 Flash
O Gemini 3.6 Flash é o modelo mais importante do lançamento para desenvolvedores em geral. É um modelo estável da categoria Flash, criado para agentes de produção, codificação, fluxos de trabalho multimodais, análise de documentos, raciocínio com longo contexto e trabalho de conhecimento.
O Google descreve o Gemini 3.6 Flash como um “cavalo de batalha” que oferece melhor desempenho em codificação, trabalho de conhecimento e multimodal do que o Gemini 3.5 Flash, ao mesmo tempo em que melhora a eficiência de tokens. A página oficial da Gemini API diz que o modelo é projetado para a era baseada em agentes e é especialmente eficaz para loops rápidos de codificação e iteração.
O ID público do modelo é:
gemini-3.6-flash
Especificações principais, consulte a página do modelo Gemini 3.6 Flash.
Gemini 3.5 Flash-Lite
O Gemini 3.5 Flash-Lite é o modelo de eficiência deste lançamento. O Google o posiciona como o modelo 3.5 mais rápido e com melhor custo-benefício, otimizado para execução de alta vazão, análise de documentos, tradução, classificação, roteamento e extração simples de dados.
O ID público do modelo é:
gemini-3.5-flash-lite
Especificações principais, consulte a página do modelo Gemini 3.5 Flash-Lite.
A distinção principal não é a janela de contexto. O Flash-Lite mantém o mesmo perfil de 1M de entrada e 64K de saída do 3.6 Flash. A diferença é a intenção de roteamento: o Flash-Lite é para vazão e controle de custos; o 3.6 Flash é para tarefas mais difíceis, onde qualidade e confiabilidade de ferramentas importam mais.
Gemini 3.5 Flash Cyber
O Gemini 3.5 Flash Cyber é um modelo especializado em cibersegurança, construído sobre o Gemini 3.5 Flash e ajustado para descoberta de vulnerabilidades, validação e geração de patches.
Este não é um modelo normal de API pública. O Google diz que estará disponível para governos e parceiros de confiança por meio do CodeMender como parte de um programa piloto de acesso limitado. Essa limitação é importante para desenvolvedores: não projete um roteiro de SaaS público em torno do acesso direto ao Flash Cyber a menos que você faça parte desse piloto ou de um programa de segurança defensiva validado.
O modelo ainda é importante porque mostra para onde o Google está levando o Gemini: modelos especialistas eficientes coordenados por infraestrutura de agentes. Em vez de fazer um único modelo de fronteira fazer tudo, o Google está construindo sistemas menores e especializados que podem executar varreduras repetidas, combinar relatórios e aplicar patches em código a menor custo.
Você deve ignorar o Gemini 3.5 Pro?
A resposta prática
Para a maioria das equipes de produção, sim: comece a avaliar o Gemini 3.6 Flash e o Gemini 3.5 Flash-Lite agora, em vez de esperar pelo Gemini 3.5 Pro ou Gemini 4 Pro.
Isso não significa que o Gemini 3.5 Pro será desimportante. Significa que os modelos mais recentes disponíveis já cobrem grande parte das cargas de trabalho de IA de alto volume: agentes de codificação, agentes de recuperação, fluxos de trabalho com documentos, parsing multimodal, extração de dados, roteamento de prompts, automação de UI, revisão de longo contexto e execução de subtarefas de agentes.
O próprio anúncio do Google diz que o Gemini 3.5 Pro ainda está em testes com parceiros e será lançado amplamente quando estiver pronto. Não é necessário nenhuma página pública do modelo gemini-3.5-pro, tabela final de preços ou ficha técnica para começar a melhorar a economia de produção hoje.
Quando ainda faz sentido esperar pelo Gemini 3.5 Pro
Você ainda deve acompanhar o Gemini 3.5 Pro ou o Gemini 4 Pro se sua carga de trabalho precisar mais de raciocínio de fronteira do que de vazão. Exemplos incluem síntese de pesquisa avançada, engenharia altamente complexa envolvendo múltiplos arquivos, matemática difícil, raciocínio científico, análises corporativas de alto risco e tarefas em que um modelo Flash ainda falha após cuidadoso design de prompt e ferramentas.
A estratégia de modelo mais forte não é “esperar pelo Pro” nem “substituir tudo por Flash”. É roteamento em camadas:
- Use o Gemini 3.5 Flash-Lite para subtarefas de baixo custo e alto volume.
- Use o Gemini 3.6 Flash para codificação, análise multimodal, revisão de documentos, síntese de longo contexto e fluxos de trabalho baseados em agentes.
- Direcione as solicitações mais difíceis ou de maior risco para um modelo de raciocínio de fronteira por meio da CometAPI.
- Adicione o Gemini 3.5 Pro ao conjunto de benchmarks quando o Google e a CometAPI o disponibilizarem.
Benchmarks do Gemini 3.6 Flash: o que melhorou?
Tabela de benchmarks do Google DeepMind
A página do Gemini 3.6 Flash do Google DeepMind lista as seguintes comparações com o Gemini 3.5 Flash:
| Benchmark | O que mede | Gemini 3.6 Flash | Gemini 3.5 Flash | Variação |
|---|---|---|---|---|
| SWE-Bench Pro | Tarefas diversas de codificação baseada em agentes | 58.7% | 55.1% | +3.6 pts |
| DeepSWE v1.1 | Engenharia de software de longo horizonte | 49% | 37% | +12 pts |
| Terminal-Bench 2.1 | Codificação em terminal baseada em agentes | 78.0% | 76.2% | +1.8 pts |
| MLE-Bench | Engenharia de machine learning | 63.9% | 49.7% | +14.2 pts |
| GDPval-AA v2 | Elo de trabalho do conhecimento | 1421 | 1349 | +72 Elo |
| OSWorld-Verified | Uso de computador baseado em agentes | 83.0% | 78.4% | +4.6 pts |
| CharXiv reasoning, no tools | Síntese de gráficos e informações | 85.2% | 84.2% | +1.0 pt |
| CharXiv reasoning, with tools | Síntese de gráficos e informações | 89.4% | 84.9% | +4.5 pts |
| GDM-MRCR v2, 128K average | Recuperação de longo contexto | 91.8% | 77.3% | +14.5 pts |
| GDM-MRCR v2, 1M pointwise | Recuperação de longo contexto | 54.0% | 26.6% | +27.4 pts |
Os maiores ganhos estão exatamente nas áreas que importam para agentes: codificação de longo horizonte, engenharia de machine learning, recuperação de longo contexto e uso de computador. Os ganhos menores em Terminal-Bench e CharXiv mostram que este não é um lançamento uniforme do tipo “tudo dobrou”. É uma melhoria direcionada em confiabilidade, eficiência de tokens e execução multietapas difícil.
Dados independentes do Artificial Analysis
Artificial Analysis fornece um contrapeso útil às tabelas de benchmark do fornecedor. Seu artigo de julho de 2026 diz que o Gemini 3.6 Flash mantém a mesma pontuação de Intelligence Index do Gemini 3.5 Flash: 50. Isso é importante porque sugere que o Gemini 3.6 Flash não é necessariamente um salto em inteligência bruta.
A grande melhoria é a eficiência:
| Métrica | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Artificial Analysis Intelligence Index | 50 | 50 |
| Tempo médio por tarefa | 1.3 minutes | 2.7 minutes |
| Custo médio por tarefa | $0.50 | $0.59 |
| Velocidade de saída | 251.3 tokens/s | Not in this table |
| Tempo até o primeiro token | 14.00s | Not in this table |
É por isso que a melhor manchete não é “o Gemini 3.6 Flash é mais inteligente do que tudo”. Uma manchete mais precisa é: o Gemini 3.6 Flash torna as cargas de trabalho de agentes mais baratas e rápidas sem sacrificar o nível de inteligência do Gemini 3.5 Flash.
DeepSWE: dados de codificação de longo horizonte
O DeepSWE da Datacurve é especialmente relevante porque foca em tarefas originais de engenharia de software de longo horizonte. Seu ranking descreve 113 tarefas em 91 repositórios e 5 linguagens.
No ranking de 21 de julho de 2026:
| Modelo | Pass@1 | Custo médio | Tokens de saída | Etapas do agente |
|---|---|---|---|---|
| Gemini 3.6 Flash alto | 49% ±5 | $3.53 | 97K | 108 |
| Gemini 3.5 Flash médio | 37% ±2 | $7.34 | 276K | 86 |
O número mais interessante não é apenas o ganho de 12 pontos em pass@1. É a queda nos tokens de saída: 97K versus 276K. Isso é aproximadamente 65% menos tokens de saída, em linha com a alegação de lançamento do Google. Para agentes de codificação, menos tokens de saída podem significar menos desvio, menos loops de reparo prolixos, menos poluição de contexto e menor custo por issue concluída.

Fonte: Gemini
Benchmarks do Gemini 3.5 Flash-Lite: por que isso importa
Flash-Lite é o modelo de alta vazão
O Gemini 3.5 Flash-Lite é projetado para execução em alto volume. É o modelo a testar quando seu sistema precisa processar milhares ou milhões de tarefas pequenas ou médias:
- extração de recibos,
- parsing de catálogo de produtos,
- rotulagem de fragmentos de documentos,
- tradução,
- classificação,
- síntese de resultados de busca,
- reescrita de consultas,
- roteamento de chamadas de ferramenta,
- tarefas leves de codificação,
- execução de subtarefas de agentes,
- extração de dados multimodal.
O Google diz que o Flash-Lite atinge 350 tokens de saída por segundo segundo o Artificial Analysis e tem preço de $0.30/M tokens de entrada e $2.50/M tokens de saída no nível padrão da Gemini API.
Flash-Lite versus Gemini 3.1 Flash-Lite
A ficha do modelo do Google DeepMind mostra ganhos importantes sobre o Gemini 3.1 Flash-Lite:
| Benchmark | Gemini 3.5 Flash-Lite | Gemini 3.1 Flash-Lite | Variação |
|---|---|---|---|
| SWE-Bench Pro | 54.2% | 38.3% | +15.9 pts |
| Terminal-Bench 2.1 | 54.0% | 31.0% | +23.0 pts |
| MLE-Bench | 39.2% | 22.0% | +17.2 pts |
| GDPval-AA v2 | 1140 | 642 | +498 Elo |
| OSWorld-Verified | 74.0% | 54.3% | +19.7 pts |
| CharXiv, no tools | 74.5% | 73.2% | +1.3 pts |
| CharXiv, with tools | 76.5% | 75.6% | +0.9 pts |
| GDM-MRCR v2, 128K average | 72.2% | 60.1% | +12.1 pts |
| GDM-MRCR v2, 1M pointwise | 21.3% | 12.3% | +9.0 pts |
O Artificial Analysis também relata um salto no Intelligence Index de 25 para o Gemini 3.1 Flash-Lite para 36 no Gemini 3.5 Flash-Lite, enquanto o tempo por tarefa cai de 1.0 minuto para 0.6 minutos. A compensação é que o custo por tarefa aumentou de $0.04 para $0.09 nesse conjunto de benchmarks porque o novo modelo tem preço mais alto que o 3.1 Flash-Lite.

Fonte: Gemini
Essa compensação é aceitável se a qualidade aprimorada reduzir novas tentativas posteriores, revisão humana ou escalonamento para um modelo mais caro. É menos atraente se sua carga de trabalho já for resolvida perfeitamente pelo Gemini 3.1 Flash-Lite. Teste antes de migrar todo o tráfego.
O significado do lançamento do Gemini
Confirma a mudança de “maior modelo” para “melhor cavalo de batalha”
O mercado de IA frequentemente foca em modelos carro-chefe de fronteira. O Gemini 3.6 Flash aponta em outra direção: sistemas de IA de produção precisam de modelos confiáveis, rápidos e eficientes em custo que consigam completar muitas tarefas reais sem desperdício.
É por isso que o lançamento enfatiza eficiência de tokens, menos chamadas de ferramenta, menor latência e menos loops de revisão. Para desenvolvedores, essas não são métricas secundárias. Elas determinam se um agente de IA pode operar em escala sem surpreender a equipe financeira.
Dá ao Google um modelo de produção mais forte enquanto o Gemini 3.5 Pro espera
O Gemini 3.5 Pro ainda está em testes com parceiros. Em vez de esperar pelo Pro, o Google lançou um modelo Flash mais forte e um Flash-Lite mais barato. Isso dá aos desenvolvedores duas opções imediatas:
- Gemini 3.6 Flash para uma inteligência de “workhorse” mais forte.
- Gemini 3.5 Flash-Lite para execução de alto volume, mais barata e rápida.
Esta é uma estratégia de produto prática. Muitas empresas não precisam do modelo mais caro em cada solicitação. Elas precisam de um portfólio de modelos e lógica de roteamento.
Torna o roteamento de modelos mais importante
O Gemini 3.6 Flash não deve ser usado em todos os lugares. Nem o Flash-Lite. Os melhores sistemas de IA de 2026 vão rotear dinamicamente:
- Comece barato quando a tarefa for simples.
- Use o Gemini 3.6 Flash quando raciocínio, entendimento multimodal ou uso de ferramentas importarem.
- Escale apenas quando uma solicitação falhar nos limiares de confiança.
- Faça cache de contexto longo repetido.
- Monitore o custo por tarefa bem-sucedida, não apenas o custo por token.
Esta é a recomendação mais forte da CometAPI no artigo: não escolha um único modelo como toda a sua estratégia de IA. Construa um roteador e faça cada modelo conquistar seu tráfego.
Perguntas frequentes
O Gemini 3.5 Pro está disponível agora?
Não como um modelo da Gemini API de disponibilidade geral no momento da escrita, em julho de 2026. O Google diz que o Gemini 3.5 Pro está em testes com parceiros e será lançado amplamente quando estiver pronto.
O Gemini 3.6 Flash é melhor do que o Gemini 3.5 Flash?
Para muitos fluxos de trabalho de agentes de produção e codificação, sim. O Google relata melhores resultados de benchmark e menor uso de tokens de saída. O Artificial Analysis relata qualidade semelhante no Intelligence Index, mas menor tempo por tarefa e menor custo por tarefa.
Para que o Gemini 3.5 Flash-Lite é melhor?
O Gemini 3.5 Flash-Lite é melhor para cargas de trabalho de alto volume, sensíveis à latência e ao custo, como extração, classificação, tradução, busca, roteamento e execução de subagentes.
Posso usar o Gemini 3.5 Flash Cyber pela Gemini API pública?
O Google descreve o Gemini 3.5 Flash Cyber como um modelo de acesso limitado disponível para governos e parceiros de confiança por meio do CodeMender. Ele não é posicionado como um modelo de API pública padrão.
Quanto custa o Gemini 3.6 Flash?
A precificação padrão da Gemini API lista o Gemini 3.6 Flash a $1.50 por 1M tokens de entrada e $7.50 por 1M tokens de saída. A CometAPI atualmente o lista a $1.20/M de entrada e $6.00/M de saída. Sempre verifique os preços ao vivo antes de colocar em produção.
Quanto custa o Gemini 3.5 Flash-Lite?
A precificação padrão da Gemini API lista o Gemini 3.5 Flash-Lite a $0.30 por 1M tokens de entrada e $2.50 por 1M tokens de saída. A CometAPI atualmente o lista a $0.24/M de entrada e $2.016/M de saída. Sempre verifique os preços ao vivo antes da implantação em produção.
Os desenvolvedores devem esperar pelo Gemini 3.5 Pro?
A maioria das equipes não deve esperar. Comece a testar o Gemini 3.6 Flash para fluxos de trabalho complexos e o Gemini 3.5 Flash-Lite para subtarefas de alto volume agora. Adicione o Gemini 3.5 Pro ao seu conjunto de benchmarks quando especificações públicas, preços e disponibilidade forem confirmados.
Veredito final
O lançamento do Gemini em julho de 2026 deve ser entendido como um lançamento de eficiência, não um lançamento com o Pro carro-chefe. O Gemini 3.6 Flash não elimina a necessidade de um futuro Gemini 3.5 Pro, mas oferece aos desenvolvedores algo imediatamente útil: um modelo de disponibilidade geral com forte desempenho em codificação, multimodalidade, longo contexto e fluxos de trabalho baseados em agentes, com menor custo de tokens de saída do que o Gemini 3.5 Flash.
O Gemini 3.5 Flash-Lite preenche a outra metade do stack de produção. É o modelo barato e rápido para subtarefas que não precisam de profundidade máxima de raciocínio. O Gemini 3.5 Flash Cyber aponta para um futuro de agentes especialistas em segurança defensiva, mas seu acesso limitado o torna mais relevante como um sinal estratégico do que como uma ferramenta geral para desenvolvedores hoje.
