TLDR: Gemini 3.7 Flash (ID do modelo gemini-3.7-flash), lançado em 13 de agosto de 2026, é o modelo de classe Flash mais capaz do Google para programação, fluxos de trabalho agentivos, desenvolvimento web e tarefas intensivas em conhecimento.
Ele oferece uma janela de contexto de 1.048.576 tokens, até 65.536 tokens de saída, níveis de raciocínio ajustáveis (baixo/médio/alto), forte suporte multimodal e preço introdutório de $0,75 por 1M de tokens de entrada / $3,75 por 1M de tokens de saída até 31 de dezembro de 2026. Acesse via Interactions API do Google ou, de forma mais conveniente para pilhas multi-modelo, através do endpoint unificado da CometAPI. Este guia cobre novidades, parâmetros da API, uso passo a passo com CometAPI, exemplos de código, benchmarks e melhores práticas.
Principais pontos
- Gemini 3.7 Flash traz grandes ganhos sobre o 3.6 Flash em programação (FrontierCode 1.1 Main: 43,6% vs 34,4%; DeepSWE v1.1: 65,3% vs ~49%), desenvolvimento web (WebDev Arena Elo 1588 vs 1538), processamento de documentos (GDP.pdf 34% vs 22%) e automação de negócios (AutomationBench 30,4% vs 17%).
- Use a Interactions API (
client.interactions.create) para os recursos mais recentes; thinking_level substitui os parâmetros antigos de orçamento. - A CometAPI fornece uma única chave de API e acesso compatível com OpenAI (ou nativo Gemini) ao Gemini 3.7 Flash e a mais de 500 outros modelos, simplificando cobrança, alternância e controle de custos.
- Entradas multimodais (texto, imagem, vídeo, áudio, PDF) com saída em texto; ferramentas integradas incluem chamadas de função, execução de código, grounding de pesquisa, uso de computador (prévia) e mais.
- $0,75 por 1M de tokens de entrada e $3,75 por 1M de tokens de saída até 31 de dezembro de 2026; o preço introdutório termina em 31 de dezembro de 2026; planeje a taxa padrão de $1,50 / $7,50 posteriormente.
- Ideal para agentes em produção, geração de código de alta precisão e fluxos multi-etapas em que eficiência de custos e confiabilidade importam.
O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026 — apenas três semanas após o Gemini 3.6 Flash — como seu modelo de trabalho mais inteligente até agora para programação e agentes. O alvo são a engenharia de software complexa, execução agentiva multi-etapas, geração web/UI com forte aderência a design e domínios densos em conhecimento como finanças, direito e biociências.
Importante: O Gemini 3.7 Flash introduz ou herda mudanças importantes de comportamento da API Gemini 3.x. Em especial, desenvolvedores migrando aplicações antigas do Gemini devem remover
temperature,top_petop_k, substituirthinking_budgetporthinking_level, removercandidate_count(não suportado) e parar de pré-preencher turnos do modelo.
O que é o Gemini 3.7 Flash?
O Gemini 3.7 Flash é o mais novo modelo generativo de classe Flash do Google, lançado em 13 de agosto de 2026.
O Google o descreve como seu “modelo de trabalho mais inteligente até agora para programação e agentes.” O lançamento é notável por ter ocorrido apenas três semanas após o Gemini 3.6 Flash, sugerindo que o Google está acelerando o ciclo de iteração para seus modelos Flash voltados a desenvolvedores.
Em vez de posicionar o Gemini 3.7 Flash simplesmente como um chatbot mais rápido, o Google está mirando cargas de trabalho em que um sistema de IA precisa:
- raciocinar por múltiplas etapas;
- escrever e depurar software;
- usar ferramentas;
- interagir com sistemas externos;
- analisar documentos extensos;
- transformar designs em interfaces funcionais;
- executar fluxos de negócios;
- operar como parte de um agente de IA.
Essa distinção importa.
Um chatbot tradicional pode responder:
“Como implemento OAuth?”
Um modelo de programação orientado a agentes deve entender o repositório, inspecionar arquivos, identificar dependências, propor mudanças, executar ferramentas, diagnosticar erros e iterar até que a implementação funcione.
O Gemini 3.7 Flash é muito mais focado no segundo cenário.
API do Gemini 3.7 Flash: Especificações centrais
A documentação oficial da API Gemini lista o Gemini 3.7 Flash como geralmente disponível, com as seguintes especificações de destaque.
| Especificação | Gemini 3.7 Flash |
|---|---|
| Model ID | gemini-3.7-flash |
| Disponibilidade | Disponível de forma geral |
| Janela de contexto | 1.000.000 tokens |
| Saída máxima | 64.000 tokens |
| Nível de raciocínio padrão | Médio |
| Níveis de raciocínio | Baixo, Médio, Alto |
| Entrada | Capacidades multimodais suportadas pela plataforma Gemini |
| Foco principal | Programação, agentes, desenvolvimento web, trabalho de conhecimento |
| Preço introdutório (entrada) | $0,75 / 1M tokens |
| Preço introdutório (saída) | $3,75 / 1M tokens |
| Validade do preço introdutório | 31 de dezembro de 2026 |
| Preço padrão após introdutório (entrada) | $1,50 / 1M tokens |
| Preço padrão após introdutório (saída) | $7,50 / 1M tokens |
A janela de contexto de 1M tokens é particularmente útil para grandes repositórios, documentação técnica extensa, documentos corporativos e sessões agentivas multi-etapas.
O que mudou na API do Gemini 3.7 Flash?
Esta é uma das seções mais importantes para desenvolvedores.
O Gemini 3.7 Flash não é simplesmente trocar:
gemini-3.6-flash
por:
gemini-3.7-flash
A geração Gemini 3.x do Google introduziu mudanças de comportamento na API que podem quebrar aplicações antigas. A documentação de migração do Gemini 3.7 destaca especificamente várias mudanças.
1. temperature, top_p e top_k estão obsoletos
Integrações antigas do Gemini comumente contêm configurações como:
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40
}
Para o Gemini 3.x, esses parâmetros de amostragem devem ser removidos.
O Google diz que esses parâmetros estão obsoletos e gerações futuras de modelos podem rejeitá-los em vez de aceitá-los silenciosamente.
Para o Gemini 3.7 Flash, use controles de raciocínio em vez disso:
generation_config = {
"thinking_level": "medium"
}
Esta é uma mudança conceitual significativa.
Em vez de controlar primariamente a aleatoriedade, os desenvolvedores podem controlar explicitamente a quantidade de esforço de raciocínio.
2. thinking_budget se torna thinking_level
Aplicações usando uma configuração de raciocínio mais antiga podem ter algo como:
{
"thinking_budget": 4096
}
O Gemini 3.7 Flash usa:
{
"thinking_level": "medium"
}
Os níveis suportados são:
lowmediumhigh
O Google descreve low como útil para tarefas sensíveis à latência, medium como o padrão e configuração de uso geral, e high como apropriado para raciocínio difícil, matemática, programação e tarefas agentivas.
3. candidate_count deve ser removido
A lista de verificação de migração do Google também diz para remover candidate_count, que não é suportado no Gemini 3.x.
Portanto, uma configuração legada como:
{
"candidate_count": 3
}
não deve simplesmente ser levada adiante para o Gemini 3.7 Flash.
4. Turnos do modelo pré-preenchidos não são mais suportados
Arquiteturas conversacionais antigas às vezes terminam uma requisição com um turno do modelo parcialmente pré-preenchido.
O comportamento mais novo da API do Gemini exige que os desenvolvedores repensem esse padrão.
O Google recomenda usar estado de conversa no servidor via previous_interaction_id para interações multi-turno e remover turnos pré-preenchidos.
5. Chamadas de função exigem cuidado adicional
A orientação de migração também destaca mudanças em chamadas de função.
Para aplicações que usam ferramentas, os desenvolvedores devem prestar atenção a:
- ativos multimodais;
- instruções inline;
- metadados de resposta de função;
call_id;- nomes de função;
- erros de chamada de função malformada.
Para a API generateContent especificamente, o Google diz que objetos FunctionResponse devem incluir tanto call_id quanto name.
Isso importa especialmente para aplicações de agentes porque chamadas de função não são mais um “nice-to-have” opcional. Elas são centrais para como agentes de programação e de workflow operam.
Como usar a API do Gemini 3.7 Flash com a CometAPI
A CometAPI é um gateway de API unificado que oferece acesso a 500+ modelos (incluindo toda a família Gemini) sob uma única chave de API, endpoints compatíveis com OpenAI e preços competitivos, além de gestão multi-fornecedor simplificada. Isso é especialmente útil se sua aplicação já usa SDKs da OpenAI ou precisa alternar entre Gemini, Claude, GPT e outros modelos sem reescrever autenticação ou lógica de cobrança.
A seguir está um passo a passo completo, orientado à produção. Cada etapa principal está estruturada como um H2 para clareza e SEO.
Cadastre-se na CometAPI e obtenha sua chave de API
- Visite https://www.cometapi.com/ e crie uma conta (Google, GitHub ou e-mail).
- Vá para a seção API Keys / Console: https://www.cometapi.com/console/token.
- Clique em Create API Key, dê um nome descritivo (por exemplo, gemini-3.7-flash-prod) e copie a chave.
- Armazene-a com segurança como uma variável de ambiente:Bash
export COMETAPI_KEY="your-key-here"
Nunca faça commit da chave no controle de versão nem a exponha em código cliente.
A CometAPI usa preços pague conforme o uso, com taxas tipicamente competitivas em relação ao fornecedor direto e sem mínimos mensais.
Instale os SDKs necessários
Para o estilo nativo do Gemini (recomendado para paridade total de recursos):
Bash
pip install google-genai
Para chamadas compatíveis com OpenAI (migração mais fácil):
Bash
pip install openai
Equivalentes para Node.js também estão disponíveis (@google/genai ou o OpenAI Node SDK).
Configure o cliente para a CometAPI
Opção A – Cliente nativo Google GenAI apontado para a CometAPI (preserva a Interactions API e controles de raciocínio):
Python
import os
from google import genai
client = genai.Client(
http_options={
"api_version": "v1beta",
"base_url": "https://api.cometapi.com"
},
api_key=os.environ.get("COMETAPI_KEY")
)
Opção B – Cliente compatível com OpenAI (ideal se seu código já é baseado em OpenAI):
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("COMETAPI_KEY"),
base_url="https://api.cometapi.com/v1"
)
Ambas as abordagens roteiam o tráfego pela CometAPI enquanto selecionam o modelo de origem via o parâmetro model.
Faça sua primeira chamada ao Gemini 3.7 Flash
Usando o estilo da Interactions API (via cliente GenAI configurado):
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Write a production-ready Three.js script that renders a realistic 3D black hole with accretion disk and gravitational lensing.",
generation_config={
"thinking_level": "medium"
}
)
print(interaction.output_text)
Estilo de chat completions compatível com OpenAI:
Python
response = client.chat.completions.create(
model="gemini-3.7-flash", # Confirm exact model ID in CometAPI dashboard if aliased
messages=[
{"role": "system", "content": "You are an expert software engineer."},
{"role": "user", "content": "Write a Python function that safely handles concurrent payment retries with proper locking."}
],
max_tokens=4096
)
print(response.choices[0].message.content)
Exemplo cURL (compatível com OpenAI):
Bash
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{"role": "user", "content": "Explain the key improvements in Gemini 3.7 Flash in 3 bullet points."}
]
}'
Sempre verifique a string exata do modelo disponível no dashboard de Modelos da CometAPI, pois agregadores às vezes usam identificadores ou aliases ligeiramente diferentes.
Configure o nível de raciocínio e opções avançadas de geração
Para programação complexa ou tarefas de agente, defina explicitamente o nível de raciocínio:
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Analyze this payment processing pipeline for race conditions and rewrite the locks safely.",
generation_config={
"thinking_level": "high" # or "low" / "medium"
}
)
- baixo: Mais rápido, adequado para chat em tempo real ou rascunhos simples.
- médio (padrão): Melhor equilíbrio para a maioria dos trabalhos de programação e agentivos.
- alto: Profundidade máxima de raciocínio e uso de ferramentas; maior consumo de tokens/custo.
Adicione entradas multimodais (imagens, PDFs, vídeo, áudio)
O Gemini 3.7 Flash aceita nativamente modalidades mistas. Exemplo com imagem + prompt de texto (usando o cliente GenAI):
Python
from google.genai import types
# Assume image bytes or file path handled appropriately
response = client.models.generate_content( # or interactions equivalent
model="gemini-3.7-flash",
contents=[
types.Part.from_bytes(data=image_bytes, mime_type="image/jpeg"),
"Describe the UI design system in this mockup and generate matching React + Tailwind code."
]
)
Padrões semelhantes funcionam para entradas em PDF, vídeo e áudio. Isso é poderoso para fluxos de design-para-código, Q&A de documentos e análise de vídeo.
Implemente chamadas de função / uso de ferramentas
Declare ferramentas na requisição e deixe o modelo decidir quando chamá-las. A CometAPI repassa isso para o backend Gemini subjacente. Siga o esquema oficial de chamadas de função do Gemini (name, description, parameters como JSON Schema). Após receber uma chamada de função, execute a ferramenta e retorne o resultado em um turno subsequente.
Parâmetros da API para o Gemini 3.7 Flash
Ao chamar via a Interactions API (recomendado), os principais parâmetros incluem:
- model: "gemini-3.7-flash" (obrigatório)
- input: String ou conteúdo estruturado (texto + partes multimodais)
- generation_config (objeto opcional):
- thinking_level: "low" | "medium" | "high" (padrão medium)
- Outros campos suportados para saídas estruturadas, segurança etc.
- tools / declarações de função para uso de ferramentas
- instruções de sistema (via role system ou campo dedicado dependendo do cliente)
- Configurações de ambiente/agente ao usar agentes gerenciados (por exemplo, Antigravity)
Chamadas no estilo nativo generateContent continuam disponíveis, mas a Interactions API é preferida para acesso completo a recursos e orquestração de agentes.
Contagem de tokens, cache (implícito + explícito), inferência em lote e opções de prioridade/flex são suportados.
Os parâmetros e conceitos de configuração mais importantes estão resumidos abaixo.
| Parâmetro | Finalidade | Orientação para Gemini 3.7 Flash |
|---|---|---|
| model | Selecionar o modelo | gemini-3.7-flash |
| input | Instrução do usuário na Interactions API | Obrigatório |
| generation_config | Controles de geração | Use campos suportados do Gemini 3.x |
| thinking_level | Controla o esforço de raciocínio | low, medium, high |
| contents | Entrada do Gemini generateContent | Usado com requisições no formato Gemini |
| parts | Componentes de conteúdo individuais | Conteúdo de texto/multimodal |
| temperature | Aleatoriedade de amostragem | Não usar |
| top_p | Amostragem nucleus | Não usar |
| top_k | Amostragem Top-K | Não usar |
| thinking_budget | Controle antigo de raciocínio | Substituir por thinking_level |
| candidate_count | Múltiplos candidatos | Não compatível no Gemini 3.x |
| previous_interaction_id | Continuidade de conversa | Recomendado para fluxos multi-turno na Interactions API |
A documentação de migração do Google destaca explicitamente os parâmetros obsoletos/não suportados e o novo padrão de conversa.
Melhores práticas de produção e dicas de migração
- Comece com thinking_level="medium" e meça qualidade versus latência/custo.
- Remova parâmetros obsoletos (temperature, top_p, top_k, orçamentos antigos de raciocínio).
- Prefira a Interactions API para fluxos agentivos multi-etapas e integração com Antigravity.
- Para aplicações multi-modelo, mantenha a base da CometAPI e apenas mude a string do modelo — sem necessidade de reautenticação.
- Teste exaustivamente com seus loops de agente específicos; o 3.7 Flash reduz loops com falhas, mas ainda se beneficia de instruções de sistema claras e esquemas de ferramentas bem definidos.
- Combine com outros modelos da CometAPI (por exemplo, geradores de imagem especializados ou modelos alternativos de raciocínio) quando o Gemini 3.7 Flash não for a melhor escolha para uma subtarefa.
Trate streaming, cache e requisições em lote
- Streaming é suportado via flags padrão de stream tanto nos clientes compatíveis com OpenAI quanto nos nativos.
- Cache de contexto (implícito e explícito) reduz custo para contextos grandes repetidos.
- Opções de inferência em lote e prioridade estão disponíveis para alto volume ou baixa latência — verifique a matriz de suporte atual da CometAPI e as opções de consumo oficiais do Gemini.
Monitore uso, custos e erros
Use o dashboard da CometAPI para uso em tempo real, rastreamento de custos e visibilidade de limites de taxa. Implemente backoff exponencial para erros 429 e respeite quaisquer limites documentados. Registre o uso de tokens nos metadados da resposta para atribuição precisa de custos.
Lista de verificação de migração da API do Gemini 3.7 Flash
Antes de implantar uma aplicação existente do Gemini, verifique cada item abaixo.
[ ] Change model ID to gemini-3.7-flash
[ ] Remove temperature
[ ] Remove top_p
[ ] Remove top_k
[ ] Replace thinking_budget with thinking_level
[ ] Remove candidate_count
[ ] Remove prefilled model turns
[ ] Review multi-turn conversation state
[ ] Review function-call handling
[ ] Check FunctionResponse call_id/name
[ ] Update SDK
[ ] Re-run production test suite
[ ] Benchmark low/medium/high thinking
[ ] Recalculate token costs
[ ] Test failure/retry behavior
O guia de migração do Google recomenda especificamente essas mudanças ao migrar para o Gemini 3.7 Flash.
Perguntas frequentes
O que é a API do Gemini 3.7 Flash?
A API do Gemini 3.7 Flash fornece acesso programático ao modelo Gemini 3.7 Flash do Google. O Google posiciona o modelo para programação, agentes, desenvolvimento web, trabalho de conhecimento e fluxos complexos de múltiplas etapas.
Quanto custa o Gemini 3.7 Flash?
Até 31 de dezembro de 2026, o preço introdutório é $0,75 por milhão de tokens de entrada e $3,75 por milhão de tokens de saída.
A partir de 1º de janeiro de 2027, o Google informa que o preço passa a $1,50 por milhão de tokens de entrada e $7,50 por milhão de tokens de saída.
Ainda posso usar temperature com o Gemini 3.7 Flash?
Você não deve. A documentação de migração do Gemini 3.x do Google diz que temperature, top_p e top_k estão obsoletos e devem ser removidos.
Posso usar o Gemini 3.7 Flash através da CometAPI?
A plataforma da CometAPI atualmente anuncia a disponibilidade do Gemini 3.7 Flash e fornece padrões de API no formato Gemini e compatíveis com OpenAI. Como o modelo foi recém-lançado, os desenvolvedores devem verificar a página atual do modelo e os recursos do endpoint antes de implantação em produção.
A CometAPI é melhor do que a API oficial do Gemini?
Nenhuma é universalmente “melhor.” A API oficial do Gemini é a escolha natural se você deseja o ecossistema nativo do Google e funcionalidades específicas do provedor. A CometAPI é mais atraente quando você precisa de uma interface unificada entre vários provedores de IA, gestão centralizada e alternância de modelos mais fácil.
Veredito final: Vale a pena usar o Gemini 3.7 Flash?
Para desenvolvedores construindo aplicações de IA em 2026, o Gemini 3.7 Flash merece atenção séria.
O lançamento é menos sobre tornar um chatbot marginalmente mais inteligente e mais sobre tornar um modelo relativamente barato melhor em realmente fazer coisas.
A maior consideração técnica é a migração.
Se sua aplicação foi escrita em torno de APIs antigas do Gemini, não troque apenas o nome do modelo. Remova parâmetros de amostragem obsoletos, migre para thinking_level, elimine candidate_count (não suportado), pare de pré-preencher turnos e revise o comportamento de chamadas de função.
Para equipes construindo exclusivamente com o Google, a API nativa do Gemini é o ponto de partida óbvio.
Para equipes construindo uma pilha de IA multi-modelo, a CometAPI oferece uma alternativa convincente: uma camada de API, acesso centralizado a modelos e a capacidade de experimentar o Gemini ao lado de outras grandes famílias de modelos sem criar uma integração separada para cada provedor.
A recomendação prática é simples:
Comece com o Gemini 3.7 Flash no nível médio de esforço de raciocínio, faça benchmark no seu workload real e, então, use baixo ou alto seletivamente com base em latência, qualidade e requisitos de custo. Se seu produto também precisa de vários provedores de IA, avalie o mesmo workload através da CometAPI para comparar modelos sem redesenhar a arquitetura da aplicação.
Essa combinação — desempenho agentivo mais forte, janela de contexto de 1M tokens, raciocínio configurável e preços agressivos em 2026 — torna o Gemini 3.7 Flash um dos lançamentos de API mais interessantes para desenvolvedores construindo agentes de IA em produção agora.
