TL;DR : Gemini 3.7 Flash (ID de modèle gemini-3.7-flash), publié le 13 août 2026, est le « cheval de bataille » de la classe Flash le plus performant de Google pour le code, les workflows agentiques, le développement web et les tâches intensives en connaissances.
Il offre une fenêtre de contexte de 1 048 576 tokens, jusqu’à 65 536 tokens en sortie, des niveaux de réflexion réglables (low/medium/high), une prise en charge multimodale robuste, et un tarif de lancement de 0,75 $ par 1 M de tokens en entrée / 3,75 $ par 1 M de tokens en sortie jusqu’au 31 décembre 2026. Accédez-y via l’Interactions API de Google ou, plus simplement pour des piles multi-modèles, via le point de terminaison unifié de CometAPI. Ce guide couvre les nouveautés, les paramètres d’API, un pas-à-pas avec CometAPI, des exemples de code, des benchmarks et des bonnes pratiques.
Points clés
- Gemini 3.7 Flash apporte de gros gains par rapport à 3.6 Flash en code (FrontierCode 1.1 Main : 43,6 % vs 34,4 % ; DeepSWE v1.1 : 65,3 % vs ~49 %), en développement web (WebDev Arena Elo 1588 vs 1538), en traitement de documents (GDP.pdf 34 % vs 22 %), et en automatisation métier (AutomationBench 30,4 % vs 17 %).
- Utilisez l’Interactions API (
client.interactions.create) pour les fonctionnalités les plus récentes ; thinking_level remplace les anciens paramètres de budget. - CometAPI fournit une clé API unique et un accès compatible OpenAI (ou Gemini natif) à Gemini 3.7 Flash plus 500+ autres modèles, simplifiant la facturation, le basculement et le contrôle des coûts.
- Entrées multimodales (texte, image, vidéo, audio, PDF) avec sortie texte ; les outils intégrés incluent l’appel de fonctions, l’exécution de code, l’ancrage via recherche, l’utilisation d’ordinateur (aperçu), et plus encore.
- 0,75 $ par 1 M de tokens en entrée et 3,75 $ par 1 M de tokens en sortie jusqu’au 31 décembre 2026 ; le prix de lancement se termine le 31 décembre 2026 ; prévoyez un tarif standard de 1,50 $ / 7,50 $ par la suite.
- Idéal pour des agents en production, la génération de code haute précision, et des workflows multi-étapes où l’efficacité coût/fiabilité compte.
Google a publié Gemini 3.7 Flash le 13 août 2026 — seulement trois semaines après Gemini 3.6 Flash — comme son modèle « cheval de bataille » le plus intelligent à ce jour pour le code et les agents. Il cible l’ingénierie logicielle complexe, l’exécution agentique multi-étapes, la génération web/UI avec forte conformité au design, et des domaines riches en connaissances tels que la finance, le droit et les biosciences.
Important : Gemini 3.7 Flash introduit ou hérite de changements importants de comportement de l’API Gemini 3.x. En particulier, les développeurs migrant d’anciennes applications Gemini doivent supprimer
temperature,top_pettop_k, remplacerthinking_budgetparthinking_level, supprimer lecandidate_countnon pris en charge, et cesser de préremplir les tours du modèle.
Qu’est-ce que Gemini 3.7 Flash ?
Gemini 3.7 Flash est le tout nouveau modèle génératif de la classe Flash de Google, publié le 13 août 2026.
Google le décrit comme son « modèle cheval de bataille le plus intelligent à ce jour pour le code et les agents ». Cette sortie est notable car elle intervient seulement trois semaines après Gemini 3.6 Flash, suggérant une accélération du cycle d’itération pour les modèles Flash orientés développeurs.
Plutôt que de positionner Gemini 3.7 Flash comme un simple chatbot plus rapide, Google cible des charges où un système d’IA doit :
- raisonner en plusieurs étapes ;
- écrire et déboguer du logiciel ;
- utiliser des outils ;
- interagir avec des systèmes externes ;
- analyser de longs documents ;
- transformer des designs en interfaces fonctionnelles ;
- exécuter des workflows métier ;
- opérer comme partie d’un agent d’IA.
Cette distinction est importante.
Un chatbot traditionnel pourrait répondre :
« Comment implémenter OAuth ? »
Un modèle de codage orienté agent est censé comprendre le dépôt, inspecter les fichiers, identifier les dépendances, proposer des changements, exécuter des outils, diagnostiquer des erreurs et itérer jusqu’à ce que l’implémentation fonctionne.
Gemini 3.7 Flash est bien davantage conçu pour ce second scénario.
API de Gemini 3.7 Flash : spécifications principales
La documentation officielle de l’API Gemini liste Gemini 3.7 Flash comme généralement disponible avec les spécifications suivantes.
| Spécification | Gemini 3.7 Flash |
|---|---|
| Model ID | gemini-3.7-flash |
| Availability | Generally Available |
| Context window | 1,000,000 tokens |
| Maximum output | 64,000 tokens |
| Default thinking level | Medium |
| Thinking levels | Low, Medium, High |
| Input | Multimodal capabilities supported through Gemini platform |
| Primary focus | Coding, agents, web development, knowledge work |
| Intro input price | $0.75 / 1M tokens |
| Intro output price | $3.75 / 1M tokens |
| Intro price expiration | December 31, 2026 |
| Standard input price after intro | $1.50 / 1M tokens |
| Standard output price after intro | $7.50 / 1M tokens |
La fenêtre de contexte d’1 M de tokens est particulièrement utile pour de grands dépôts, une documentation technique volumineuse, des documents d’entreprise et des sessions agentiques multi-étapes.
Qu’est-ce qui a changé dans l’API de Gemini 3.7 Flash ?
C’est l’une des sections les plus importantes pour les développeurs.
Gemini 3.7 Flash ne se réduit pas à remplacer :
gemini-3.6-flash
par :
gemini-3.7-flash
La génération 3.x de Gemini a introduit des changements de comportement d’API susceptibles de casser d’anciennes applications. La documentation de migration vers Gemini 3.7 appelle spécifiquement plusieurs changements.
1. temperature, top_p et top_k sont obsolètes
Les anciennes intégrations Gemini contiennent souvent une configuration comme :
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40
}
Pour Gemini 3.x, ces paramètres d’échantillonnage doivent être supprimés.
Google indique que ces paramètres sont obsolètes et que de futures générations de modèles peuvent les rejeter plutôt que de les accepter silencieusement.
Pour Gemini 3.7 Flash, utilisez les contrôles de réflexion à la place :
generation_config = {
"thinking_level": "medium"
}
C’est un changement conceptuel important.
Au lieu de contrôler principalement l’aléatoire, les développeurs peuvent contrôler explicitement la quantité d’effort de raisonnement.
2. thinking_budget devient thinking_level
Les applications utilisant une ancienne configuration de raisonnement peuvent avoir quelque chose comme :
{
"thinking_budget": 4096
}
Gemini 3.7 Flash utilise :
{
"thinking_level": "medium"
}
Les niveaux pris en charge sont :
lowmediumhigh
Google décrit low comme utile pour les tâches sensibles à la latence, medium comme le réglage par défaut et polyvalent, et high comme adapté au raisonnement difficile, aux mathématiques, au codage et aux tâches agentiques.
3. candidate_count doit être supprimé
La checklist de migration de Google indique également de supprimer candidate_count, non pris en charge dans Gemini 3.x.
Ainsi, une configuration héritée comme :
{
"candidate_count": 3
}
ne doit pas simplement être reportée dans Gemini 3.7 Flash.
4. Les tours de modèle préremplis ne sont plus pris en charge
D’anciennes architectures conversationnelles terminent parfois une requête par un tour de modèle partiellement prérempli.
Le nouveau comportement de l’API Gemini exige que les développeurs repensent ce schéma.
Google recommande d’utiliser l’état de conversation côté serveur via previous_interaction_id pour les interactions multi-tours et de supprimer les tours préremplis.
5. L’appel de fonctions demande une attention particulière
La guidance de migration souligne également des changements d’appel de fonctions.
Pour les applications utilisant des outils, les développeurs doivent être attentifs à :
- des ressources multimodales ;
- des instructions inline ;
- des métadonnées de réponse de fonction ;
call_id;- les noms de fonction ;
- les erreurs d’appel de fonction mal formé.
Pour l’API generateContent en particulier, Google indique que les objets FunctionResponse doivent inclure à la fois call_id et name.
Ceci est particulièrement important pour les applications d’agent, car l’appel de fonctions n’est plus un « nice-to-have » optionnel. C’est central pour le fonctionnement des agents de codage et de workflow.
Comment utiliser l’API Gemini 3.7 Flash avec CometAPI
CometAPI est une passerelle API unifiée offrant l’accès à 500+ modèles (y compris toute la famille Gemini) avec une clé API unique, des endpoints compatibles OpenAI, des tarifs compétitifs, et une gestion multi-fournisseurs simplifiée. C’est particulièrement utile si votre application utilise déjà les SDK OpenAI ou doit basculer entre Gemini, Claude, GPT et d’autres modèles sans réécrire l’authentification ou la facturation.
Ci-dessous, un guide complet orienté production. Chaque étape majeure est structurée en H2 pour la clarté et le SEO.
Inscrivez-vous à CometAPI et obtenez votre clé API
- Rendez-vous sur https://www.cometapi.com/ et créez un compte (Google, GitHub ou email).
- Accédez à la section Clés API / Console : https://www.cometapi.com/console/token.
- Cliquez sur Create API Key, donnez-lui un nom descriptif (par ex., gemini-3.7-flash-prod), et copiez la clé.
- Stockez-la en toute sécurité comme variable d’environnement : Bash
export COMETAPI_KEY="your-key-here"
Ne commitez jamais la clé dans le contrôle de version ni ne l’exposez dans du code côté client.
CometAPI fonctionne au paiement à l’usage avec des tarifs généralement compétitifs par rapport aux fournisseurs directs et sans minimum mensuel.
Installer les SDK requis
Pour le style Gemini natif (recommandé pour la parité fonctionnelle complète) :
Bash
pip install google-genai
Pour des appels compatibles OpenAI (migration la plus simple) :
Bash
pip install openai
Des équivalents Node.js sont également disponibles (@google/genai ou le SDK OpenAI pour Node).
Configurer le client pour CometAPI
Option A – Client Google GenAI natif pointé vers CometAPI (préserve l’Interactions API et les contrôles de réflexion) :
Python
import os
from google import genai
client = genai.Client(
http_options={
"api_version": "v1beta",
"base_url": "https://api.cometapi.com"
},
api_key=os.environ.get("COMETAPI_KEY")
)
Option B – Client compatible OpenAI (idéal si votre base de code est déjà basée sur OpenAI) :
Python
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ.get("COMETAPI_KEY"),
base_url="https://api.cometapi.com/v1"
)
Les deux approches routent le trafic via CometAPI tout en sélectionnant le modèle amont via le paramètre model.
Effectuez votre premier appel à Gemini 3.7 Flash
En style Interactions API (via client GenAI configuré) :
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Write a production-ready Three.js script that renders a realistic 3D black hole with accretion disk and gravitational lensing.",
generation_config={
"thinking_level": "medium"
}
)
print(interaction.output_text)
Style chat completions compatible OpenAI :
Python
response = client.chat.completions.create(
model="gemini-3.7-flash", # Confirm exact model ID in CometAPI dashboard if aliased
messages=[
{"role": "system", "content": "You are an expert software engineer."},
{"role": "user", "content": "Write a Python function that safely handles concurrent payment retries with proper locking."}
],
max_tokens=4096
)
print(response.choices[0].message.content)
Exemple cURL (compatible OpenAI) :
Bash
curl https://api.cometapi.com/v1/chat/completions \
-H "Authorization: Bearer $COMETAPI_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{"role": "user", "content": "Explain the key improvements in Gemini 3.7 Flash in 3 bullet points."}
]
}'
Vérifiez toujours la chaîne exacte du modèle disponible dans votre tableau de bord CometAPI Models, car les agrégateurs utilisent parfois des identifiants ou alias légèrement différents.
Configurer le niveau de réflexion et les options avancées de génération
Pour des tâches de codage ou d’agent complexes, définissez explicitement le niveau de réflexion :
Python
interaction = client.interactions.create(
model="gemini-3.7-flash",
input="Analyze this payment processing pipeline for race conditions and rewrite the locks safely.",
generation_config={
"thinking_level": "high" # or "low" / "medium"
}
)
- low : le plus rapide, adapté au chat temps réel ou au brouillon simple.
- medium (par défaut) : le meilleur compromis pour la plupart des travaux de code et agentiques.
- high : profondeur maximale de raisonnement et d’usage d’outils ; consommation de tokens/coûts plus élevée.
Ajouter des entrées multimodales (images, PDF, vidéo, audio)
Gemini 3.7 Flash accepte nativement des modalités mixtes. Exemple avec une image + un prompt texte (en utilisant le client GenAI) :
Python
from google.genai import types
# Assume image bytes or file path handled appropriately
response = client.models.generate_content( # or interactions equivalent
model="gemini-3.7-flash",
contents=[
types.Part.from_bytes(data=image_bytes, mime_type="image/jpeg"),
"Describe the UI design system in this mockup and generate matching React + Tailwind code."
]
)
Des schémas similaires fonctionnent pour les entrées PDF, vidéo et audio. C’est puissant pour les workflows design-to-code, Q&R sur documents et analyse vidéo.
Implémenter l’appel de fonctions / l’utilisation d’outils
Déclarez des outils dans la requête et laissez le modèle décider quand les appeler. CometAPI transmet ces éléments au backend Gemini sous-jacent. Suivez le schéma officiel d’appel de fonctions de Gemini (name, description, parameters en JSON Schema). Après réception d’un appel de fonction, exécutez l’outil et retournez le résultat dans un tour suivant.
Paramètres d’API pour Gemini 3.7 Flash
Lors d’appels via l’Interactions API (recommandé), les paramètres clés incluent :
- model : "gemini-3.7-flash" (obligatoire)
- input : chaîne ou contenu structuré (texte + parties multimodales)
- generation_config (objet optionnel) :
- thinking_level : "low" | "medium" | "high" (par défaut medium)
- Autres champs pris en charge pour des sorties structurées, la sécurité, etc.
- tools / déclarations de fonctions pour l’usage d’outils
- instructions système (via rôle system ou champ dédié selon le client)
- Paramètres d’environnement / d’agent lors de l’utilisation d’agents gérés (par ex., Antigravity)
Les appels de style generateContent natifs restent disponibles, mais l’Interactions API est préférée pour un accès complet aux fonctionnalités et à l’orchestration d’agents.
Le comptage de tokens, le caching (implicite + explicite), l’inférence par lot, et les options de priorité/flex sont pris en charge.
Les paramètres et concepts de configuration les plus importants sont résumés ci-dessous.
| Paramètre | Objectif | Recommandation pour Gemini 3.7 Flash |
|---|---|---|
| model | Sélection du modèle | gemini-3.7-flash |
| input | Instruction utilisateur (Interactions API) | Obligatoire |
| generation_config | Contrôles de génération | Utiliser les champs pris en charge par Gemini 3.x |
| thinking_level | Contrôle de l’effort de raisonnement | low, medium, high |
| contents | Input generateContent de Gemini | Utilisé avec les requêtes au format Gemini |
| parts | Composants de contenu individuels | Contenu texte/multimodal |
| temperature | Aléa d’échantillonnage | Ne pas utiliser |
| top_p | Nucleus sampling | Ne pas utiliser |
| top_k | Top-K sampling | Ne pas utiliser |
| thinking_budget | Ancien contrôle de réflexion | Remplacer par thinking_level |
| candidate_count | Multiples candidats | Non pris en charge dans Gemini 3.x |
| previous_interaction_id | Continuité de conversation | Recommandé pour les workflows multi-tours (Interactions API) |
La documentation de migration de Google met explicitement en avant les paramètres obsolètes/non pris en charge et le nouveau schéma de conversation.
Bonnes pratiques de production et conseils de migration
- Commencez avec thinking_level="medium" et mesurez qualité vs latence/coût.
- Supprimez les paramètres obsolètes (temperature, top_p, top_k, anciens budgets de réflexion).
- Préférez l’Interactions API pour les flux agentiques multi-étapes et l’intégration Antigravity.
- Pour les applications multi-modèles, conservez l’URL de base CometAPI et changez simplement la chaîne du modèle — aucune réauthentification nécessaire.
- Testez à fond vos boucles d’agent spécifiques ; 3.7 Flash réduit les boucles échouées mais bénéficie toujours d’instructions système claires et de schémas d’outils précis.
- Combinez avec d’autres modèles de CometAPI (par ex., générateurs d’images spécialisés ou modèles de raisonnement alternatifs) lorsque Gemini 3.7 Flash n’est pas optimal pour une sous-tâche.
Gérer le streaming, le caching et les requêtes par lot
- Le streaming est pris en charge via les indicateurs standard de flux dans les clients compatibles OpenAI et natifs.
- Le caching de contexte (implicite et explicite) réduit le coût pour des contextes volumineux répétés.
- Des options d’inférence par lot et de priorité sont disponibles pour les volumes élevés ou les charges sensibles à la latence — consultez la matrice de support actuelle de CometAPI et les options de consommation officielles de Gemini.
Surveiller l’utilisation, les coûts et les erreurs
Utilisez le tableau de bord CometAPI pour le suivi en temps réel de l’usage, des coûts et des limites de débit. Implémentez un backoff exponentiel pour les erreurs 429 et respectez les limites documentées. Journalisez l’usage de tokens depuis les métadonnées de réponse pour une imputation de coûts précise.
Liste de contrôle de migration vers l’API Gemini 3.7 Flash
Avant de déployer une application Gemini existante, vérifiez chaque point ci-dessous.
[ ] Change model ID to gemini-3.7-flash
[ ] Remove temperature
[ ] Remove top_p
[ ] Remove top_k
[ ] Replace thinking_budget with thinking_level
[ ] Remove candidate_count
[ ] Remove prefilled model turns
[ ] Review multi-turn conversation state
[ ] Review function-call handling
[ ] Check FunctionResponse call_id/name
[ ] Update SDK
[ ] Re-run production test suite
[ ] Benchmark low/medium/high thinking
[ ] Recalculate token costs
[ ] Test failure/retry behavior
Le guide de migration de Google recommande spécifiquement ces changements lors du passage à Gemini 3.7 Flash.
FAQ
Qu’est-ce que l’API Gemini 3.7 Flash ?
L’API Gemini 3.7 Flash fournit un accès programmatique au modèle Gemini 3.7 Flash de Google. Google positionne ce modèle pour le codage, les agents, le développement web, le travail de connaissance et les workflows complexes multi-étapes.
Combien coûte Gemini 3.7 Flash ?
Jusqu’au 31 décembre 2026, le tarif de lancement est de 0,75 $ par million de tokens en entrée et 3,75 $ par million de tokens en sortie.
À partir du 1er janvier 2027, Google indique que la tarification devient 1,50 $ par million de tokens en entrée et 7,50 $ par million de tokens en sortie.
Puis-je encore utiliser temperature avec Gemini 3.7 Flash ?
Vous ne devriez pas. La documentation de migration de Gemini 3.x de Google indique que temperature, top_p et top_k sont obsolètes et doivent être supprimés.
Puis-je utiliser Gemini 3.7 Flash via CometAPI ?
La plateforme CometAPI annonce actuellement la disponibilité de Gemini 3.7 Flash et propose des schémas d’API compatibles Gemini et OpenAI. Étant donné que le modèle est nouvellement publié, les développeurs doivent vérifier la page du modèle et les capacités d’endpoint actuelles avant un déploiement en production.
CometAPI est-il meilleur que l’API officielle Gemini ?
Aucun n’est universellement « meilleur ». L’API officielle Gemini est le choix naturel si vous voulez l’écosystème natif de Google et des fonctionnalités spécifiques au fournisseur. CometAPI est plus attractif lorsque vous avez besoin d’une interface unifiée entre plusieurs fournisseurs d’IA, d’une gestion centralisée et d’un basculement de modèle simplifié.
Verdict final : Gemini 3.7 Flash vaut-il la peine d’être utilisé ?
Pour les développeurs qui construisent des applications d’IA en 2026, Gemini 3.7 Flash mérite une attention sérieuse.
Cette sortie vise moins à rendre un chatbot marginalement plus intelligent qu’à rendre un modèle relativement peu coûteux meilleur pour réellement faire des choses.
La plus grande considération technique est la migration.
Si votre application a été écrite autour d’anciennes API Gemini, ne changez pas simplement le nom du modèle. Supprimez les paramètres d’échantillonnage obsolètes, migrez vers thinking_level, éliminez le candidate_count non pris en charge, cessez de préremplir les tours du modèle et revoyez le comportement d’appel de fonctions.
Pour les équipes bâtissant exclusivement autour de Google, l’API Gemini native est le point de départ évident.
Pour les équipes bâtissant une pile d’IA multi-modèles, CometAPI offre une alternative convaincante : une couche API unique, un accès centralisé aux modèles, et la possibilité d’expérimenter Gemini aux côtés d’autres grandes familles de modèles sans créer une intégration distincte pour chaque fournisseur.
La recommandation pratique est donc simple :
Commencez avec Gemini 3.7 Flash au niveau de réflexion medium, évaluez-le sur votre charge réelle, puis utilisez low ou high de façon sélective selon la latence, la qualité et les contraintes de coût. Si votre produit a aussi besoin de plusieurs fournisseurs d’IA, évaluez la même charge via CometAPI afin de comparer les modèles sans repenser votre architecture applicative.
Cette combinaison — meilleures performances agentiques, fenêtre de contexte 1 M de tokens, raisonnement configurable et tarification 2026 agressive — fait de Gemini 3.7 Flash l’une des sorties d’API les plus intéressantes pour les développeurs qui construisent des agents d’IA en production aujourd’hui.
