TL;DR
Gemini 3.6 Flash coûte $1.50/M en entrée et $7.50/M en sortie, avec un prix de sortie plus bas et de meilleures performances annoncées en codage et pour les agents que Gemini 3.5 Flash. En production, utilisez 3.6 Flash pour le raisonnement complexe et les agents, tout en aiguillant les charges simples et volumineuses vers le moins cher Gemini 3.5 Flash-Lite.
Gemini 3.6 Flash est plus qu’une simple mise à jour d’identifiant de modèle.
Pour les développeurs utilisant déjà Gemini 3.5 Flash, le plus grand changement est économique. Google a conservé le prix d’entrée inchangé à $1.50 par million de jetons, abaissé le prix de sortie de $9.00 à $7.50, et rapporte de meilleures performances sur plusieurs benchmarks de codage et d’agents.
La question pratique est de savoir si ces améliorations sont suffisamment importantes pour justifier la migration de charges de production.
La réponse dépend de la charge. Les agents de codage, l’analyse multimodale et l’utilisation d’outils multi-étapes peuvent en bénéficier davantage que l’extraction ou la classification simples. La migration exige aussi quelques vérifications de compatibilité API faciles à manquer si vous ne changez que le nom du modèle.
Ce guide couvre la tarification de l’API Gemini 3.6 Flash, l’accès au palier gratuit, les résultats de benchmarks, les changements de migration, des exemples Python, et ce qu’il faut tester avant de basculer le trafic de production.
Qu’est-ce que Gemini 3.6 Flash ?
Gemini 3.6 Flash est le nouveau modèle Flash de Google pour le codage, le raisonnement multimodal et les workflows d’agent multi-étapes. Sorti le 21 juillet 2026, il est conçu pour les charges de production nécessitant un raisonnement plus robuste et de meilleures performances d’agent tout en restant dans le palier de modèles Flash de Google.
Ses principales spécifications incluent :
| Élément | Gemini 3.6 Flash |
|---|---|
| ID du modèle | gemini-3.6-flash |
| Prix standard d’entrée | $1.50 / 1M tokens |
| Prix standard de sortie | $7.50 / 1M tokens |
| Entrée mise en cache (standard) | $0.15 / 1M tokens |
| Niveau de réflexion par défaut | medium |
| Contexte d’entrée | 1,048,576 tokens |
| Sortie maximale | 65,536 tokens |
| Entrées | Texte, image, vidéo, audio, PDF |
| Sortie | Texte |
| Idéal pour | Codage, raisonnement multimodal, agents complexes |
Google positionne Gemini 3.6 Flash pour des charges telles que le codage, le raisonnement spatial et multimodal, et les tâches agentiques multi-étapes.
Le modèle prend également en charge des fonctionnalités comme l’appel de fonctions, les sorties structurées, l’exécution de code, la mise en cache de contexte, File Search, le contexte d’URL, l’ancrage Google Search et l’ancrage Google Maps.
Vous pouvez consulter les dernières spécifications et les conseils de migration dans le Guide des derniers modèles Gemini de Google (https://ai.google.dev/gemini-api/docs/latest-model).
Pour les développeurs venant de la génération précédente, le guide de l’API Gemini 3.5 Flash de CometAPI (https://www.cometapi.com/how-to-use-gemini-3-5-flash-api/) fournit une base d’intégration utile.
Combien coûte l’API Gemini 3.6 Flash ?
Gemini 3.6 Flash coûte $1.50 par million de jetons d’entrée et $7.50 par million de jetons de sortie sur le palier Standard payant de Google.
Par rapport à Gemini 3.5 Flash, le prix d’entrée reste inchangé, tandis que le prix de sortie passe de $9.00 à $7.50 par million de jetons, soit une baisse de 16.7 %.
Google propose également des traitements Batch, Flex et Priority.
| Palier Gemini 3.6 Flash | Entrée / 1M | Entrée mise en cache / 1M | Sortie / 1M |
|---|---|---|---|
| Standard | $1.50 | $0.15 | $7.50 |
| Batch | $0.75 | $0.075 | $3.75 |
| Flex | $0.75 | $0.075 | $3.75 |
| Priority | $2.70 | $0.27 | $13.50 |
Important:** Les jetons de réflexion sont facturés au tarif des jetons de sortie. Une réponse visible courte peut donc consommer plus de jetons facturables que ne le suggère la longueur de la réponse finale.
La mise en cache du contexte peut également faire une différence significative pour les applications qui envoient à répétition le même grand prompt système, le contexte d’un dépôt, un ensemble de documents, ou l’historique d’une conversation.
Sur le palier Standard payant, l’entrée mise en cache de Gemini 3.6 Flash coûte $0.15 par million de jetons, contre $1.50 pour une entrée normale.
Exemple : 15,000 jetons d’entrée + 8,000 jetons de sortie
Considérons une tâche utilisant 15,000 jetons d’entrée et 8,000 jetons de sortie.
| Modèle | Coût estimé |
|---|---|
| Gemini 3.5 Flash | $0.0945 |
| Gemini 3.6 Flash au même volume de jetons | $0.0825 |
| Gemini 3.6 Flash avec 17% de jetons de sortie en moins | $0.0723 |
| Gemini 3.5 Flash-Lite au même volume de jetons | $0.0245 |
À utilisation de jetons identique, Gemini 3.6 Flash est environ 12.7 % moins cher que Gemini 3.5 Flash dans cet exemple.
Google rapporte également que Gemini 3.6 Flash a utilisé 17 % de jetons de sortie en moins sur l’Artificial Analysis Index. Si une charge de production reproduisait cette réduction, l’économie modélisée dans cet exemple augmenterait à environ 23.5 %.
Google rapporte séparément des réductions de jetons de sortie allant jusqu’à 65 % sur DeepSWE. Ces chiffres mesurent des charges différentes et ne doivent pas être considérés comme interchangeables : 17 % se réfère à l’Artificial Analysis Index, tandis que 65 % provient d’un benchmark de codage spécifique.
La formule de calcul de base du coût en jetons est :
Request cost =
(input tokens x input price + output tokens x output price) / 1,000,000
Pour les agents, le coût réel est plus large :
Total task cost =
initial model call
+ retries
+ fallback calls
+ paid tools
+ grounding or search costs
C’est pourquoi le modèle le moins cher par jeton n’est pas toujours le moins cher pour achever une tâche.
Gemini 3.6 Flash est-il gratuit ?
Oui. La tarification actuelle de l’API Gemini pour développeurs de Google indique un accès au palier gratuit pour l’usage Standard de Gemini 3.6 Flash.
La disponibilité du palier gratuit ne signifie pas une capacité de production illimitée. Les limites d’API dépendent du projet et du palier d’usage ; les développeurs doivent donc vérifier les limites de débit appliquées à leur propre projet plutôt que de se fier à un chiffre fixe de requêtes par minute issu d’un article tiers.
Pour la planification de production, utilisez la tarification actuelle de l’API Gemini (https://ai.google.dev/gemini-api/docs/pricing) et la documentation des limites de débit de Google pour estimer la capacité.
Les développeurs peuvent accéder à Gemini 3.6 Flash via l’API Gemini et Google AI Studio. Les équipes utilisant un workflow unifié multi-modèles peuvent également tester le modèle via la page du modèle Gemini 3.6 Flash sur CometAPI (https://www.cometapi.com/models/google/gemini-3-6-flash/).
Comment Gemini 3.6 Flash se compare-t-il à Gemini 3.5 Flash ?
Les résultats publiés par Google montrent les plus fortes améliorations en codage, exécution par agents, utilisation de l’ordinateur, et travaux de connaissance.
| Benchmark | Gemini 3.6 Flash | Gemini 3.5 Flash | Évolution |
|---|---|---|---|
| DeepSWE | 49.00% | 37.00% | +12.0 points |
| MLE-Bench | 63.90% | 49.70% | +14.2 points |
| OSWorld-Verified | 83.00% | 78.40% | +4.6 points |
| GDPval-AA v2 | 1,421 | 1,349 | 72 |
Google indique aussi que Gemini 3.6 Flash exécute des workflows multi-étapes avec moins d’étapes de raisonnement, moins de tours conversationnels, et moins d’appels d’outils que Gemini 3.5 Flash.
L’entreprise rapporte :
- 17 % de jetons de sortie en moins sur l’Artificial Analysis Index.
- Jusqu’à 65 % de jetons de sortie en moins sur DeepSWE.
- Moins de modifications de code indésirées et de boucles d’exécution.
- Un raisonnement multimodal et spatial amélioré.
Les résultats originaux sont disponibles dans l’annonce de lancement de Gemini 3.6 Flash par Google (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/).
Ces benchmarks font de 3.6 Flash un candidat solide à l’évaluation, en particulier pour les charges où une requête peut se transformer en plusieurs tours de raisonnement, d’appels d’outils et de corrections.
Ils ne doivent cependant pas se substituer à des tests sur votre propre application.
Google note également que 3.6 Flash peut effectuer davantage d’inspection programmatique en amont avant de modifier du code. Sur un grand dépôt, cela peut améliorer la précision. Sur une modification front-end à périmètre étroit, cela peut simplement ajouter une exploration inutile.
Des limites de fichiers claires, des critères d’acceptation et des consignes d’implémentation restent essentiels.
Gemini 3.6 Flash vs Gemini 3.5 Flash-Lite : lequel utiliser ?
Une fois que vous avez décidé que Gemini 3.6 Flash mérite d’être testé, la question suivante est de savoir si chaque requête en a réellement besoin.
Pour de nombreux systèmes de production, la réponse sera non.
Gemini 3.5 Flash-Lite est nettement moins cher et peut être un meilleur défaut pour des charges prévisibles et volumineuses.
| Élément | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite |
|---|---|---|
| Prix standard d’entrée | $1.50 / 1M tokens | $0.30 / 1M tokens |
| Prix standard de sortie | $7.50 / 1M tokens | $2.50 / 1M tokens |
| Entrée mise en cache (standard) | $0.15 / 1M tokens | $0.03 / 1M tokens |
| Niveau de réflexion par défaut | medium | minimal |
| Idéal pour | Raisonnement complexe, codage, agents | Extraction, aiguillage, classification |
Au tarif Standard, Flash-Lite est 5× moins cher en entrée et 3× moins cher en sortie que Gemini 3.6 Flash.
Commencez avec Gemini 3.5 Flash-Lite pour :
- Classification
- Aiguillage des requêtes
- Extraction JSON et structurée
- Traitement de documents
- Transformation de données
- Traduction à grande échelle
- Sous-agents légers
- Tâches volumineuses et répétables
Une stratégie d’aiguillage pratique peut ressembler à ceci :
| Charge de travail | Aiguillage initial | Escalade |
|---|---|---|
| Classification ou routage | Gemini 3.5 Flash-Lite | 3.6 Flash après échec de validation |
| Extraction structurée | Gemini 3.5 Flash-Lite | 3.6 Flash pour les documents complexes |
| Sous-agent léger | Gemini 3.5 Flash-Lite | Augmenter le niveau de réflexion ou utiliser 3.6 Flash |
| Codage multi-fichiers | Gemini 3.6 Flash | Repli plus fort si non résolu |
| Workflow d’outils complexe | Gemini 3.6 Flash | Repli après échec d’outil ou de validation |
| Raisonnement multimodal | Gemini 3.6 Flash | Repli spécifique à la tâche |
Pour du trafic de production mixte, la métrique la plus utile est :
Cost per successful task =
(model calls + retries + tools + fallbacks) / accepted tasks
Un premier appel peu cher devient moins attrayant s’il échoue à répétition et exige finalement un modèle plus robuste de toute façon.
L’inverse est tout aussi important. Il y a peu de raison d’envoyer des millions de requêtes de classification prévisibles à Gemini 3.6 Flash si Flash-Lite répond déjà au niveau de précision requis.
Pour les applications nécessitant ce type d’aiguillage, consultez notre guide pour appeler plusieurs modèles d’IA via une base d’URL compatible OpenAI (https://www.cometapi.com/how-to-call-multiple-ai-models-using-an-openai-compatible-base-url/).
Quels changements lors de la migration vers Gemini 3.6 Flash ?
Passer de Gemini 3.5 Flash à Gemini 3.6 Flash implique plus que de changer l’ID du modèle.
Les développeurs doivent examiner cinq domaines avant de basculer le trafic de production : paramètres d’échantillonnage dépréciés, contrôles de réflexion, candidate_count, tours de modèle préremplis, et état d’appel de fonctions.
1. Supprimez temperature, top_p et top_k
Google a déprécié ces contrôles d’échantillonnage pour Gemini 3.6 Flash et Gemini 3.5 Flash-Lite :
generation_config = {
"temperature": 0.7,
"top_p": 0.9,
"top_k": 40,
}
Les nouveaux modèles ignorent actuellement ces paramètres. Google indique que de futures générations de modèles Gemini pourraient renvoyer une erreur HTTP 400 lorsqu’ils sont fournis.
Pour des formats de sortie prévisibles, utilisez des consignes système plus claires et des sorties structurées à la place.
2. Remplacez thinking_budget par thinking_level
Gemini 3.6 Flash utilise par défaut une réflexion medium.
Les conseils de migration de Google recommandent de passer de configurations numériques thinking_budget à thinking_level.
Gemini 3.5 Flash-Lite utilise par défaut minimal, ce qui convient à de nombreuses charges volumineuses d’extraction, de classification et d’aiguillage.
Des niveaux de réflexion plus élevés doivent être testés lorsque la tâche implique un raisonnement multi-étapes, l’exécution de code ou l’utilisation d’outils.
3. Supprimez candidate_count
Google indique que candidate_count n’est pas pris en charge dans Gemini 3.x.
Cela peut être facile à manquer lorsque plusieurs modèles partagent la même configuration de génération. Supprimez-le avant de migrer les requêtes de production.
4. Cessez de préremplir des tours du modèle
Les requêtes ne peuvent plus se terminer par un tour model non vide.
Une application plus ancienne pourrait utiliser une charge utile comme :
{
"contents": [
{
"role": "user",
"parts": [{"text": "Translate 'Hello world' to Spanish."}]
},
{
"role": "model",
"parts": [{"text": "Translation:"}]
}
]
}
Ce schéma peut désormais renvoyer HTTP 400.
Si vous utilisiez précédemment le préremplissage pour imposer un format de réponse, transférez l’exigence dans system_instruction ou utilisez des sorties structurées à la place.
5. Retestez l’appel de fonctions et l’état multi-tours
Les agents utilisant des outils nécessitent des tests de migration dédiés.
Google recommande d’utiliser previous_interaction_id pour l’état multi-tours côté serveur dans l’API Interactions.
Lors du retour d’un résultat de fonction, conservez à la fois le nom de la fonction et l’ID d’appel original :
final_interaction = client.interactions.create(
model="gemini-3.6-flash",
previous_interaction_id=interaction.id,
tools=tools,
input=[
{
"type": "function_result",
"name": step.name,
"call_id": step.id,
"result": [
{
"type": "text",
"text": json.dumps(result),
}
],
}
],
)
Les applications utilisant generateContent doivent également vérifier leurs charges FunctionResponse et surveiller les erreurs d’appel d’outil après migration.
Voir le guide de migration vers les derniers modèles de Google (https://ai.google.dev/gemini-api/docs/latest-model) et la documentation sur l’appel de fonctions (https://ai.google.dev/gemini-api/docs/function-calling) pour les détails d’implémentation actuels.
Comment appeler Gemini 3.6 Flash en Python ?
Installez ou mettez à jour le SDK GenAI de Google :
pip install -U google-genai
Définissez votre clé API :
export GEMINI_API_KEY="your-api-key"
Puis appelez Gemini 3.6 Flash :
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input=(
"Review this migration plan and list the three "
"highest-risk compatibility issues."
),
)
print(interaction.output_text)
Pour une tâche nécessitant davantage de raisonnement, configurez le niveau de réflexion :
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this multi-step debugging problem.",
generation_config={
"thinking_level": "medium",
},
)
print(interaction.output_text)
La principale différence de migration peut se résumer ainsi :
# Older shared configuration
old_config = {
"temperature": 0.2,
"top_p": 0.9,
"top_k": 40,
"candidate_count": 1,
"thinking_budget": 4096,
}
# Gemini 3.6 Flash
new_config = {
"thinking_level": "medium",
}
N’en déduisez pas qu’un niveau de réflexion plus élevé est toujours meilleur. Mesurez la latence, la consommation de jetons et le taux de réussite sur vos propres tâches.
Comment tester Gemini 3.6 Flash avant la production ?
Vous n’avez pas besoin d’une grande suite de benchmarks publics pour décider si Gemini 3.6 Flash a sa place dans votre pile de production.
Un meilleur point de départ est 30 à 50 tâches récentes qui ressemblent à votre trafic réel.
Incluez un mélange de :
- Codage et débogage
- Utilisation d’outils multi-étapes
- Documents multimodaux
- Extraction de données
- Classification et aiguillage
Exécutez les mêmes entrées via :
- Votre modèle de production actuel
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
Conservez inchangés les prompts, outils, validateurs et critères d’acceptation.
Suivez :
- Jetons d’entrée
- Jetons de sortie et de réflexion
- Latence
- Appels d’outils
- Réessais
- Erreurs d’appel de fonction
- Taux de réussite des validateurs
- Temps de correction humaine
- Réussite finale de la tâche
Comparez ensuite le coût total nécessaire pour produire un résultat accepté.
Une requête de codage qui coûte $0.08 et réussit du premier coup peut être moins chère qu’une requête à $0.02 qui échoue deux fois et finit par être escaladée.
Dans le même temps, payer les prix de Gemini 3.6 Flash pour une tâche de classification simple a peu de sens si Flash-Lite la gère de manière fiable.
L’objectif n’est pas de trouver un modèle pour chaque requête. Il s’agit d’utiliser le modèle plus puissant uniquement là où sa capacité supplémentaire change réellement l’issue.
Les développeurs peuvent comparer les routes actuelles de Gemini 3.6 Flash (https://www.cometapi.com/models/google/gemini-3-6-flash/) et de Gemini 3.5 Flash-Lite (https://www.cometapi.com/models/google/gemini-3-5-flash-lite/) via CometAPI en utilisant le même jeu d’évaluation.
FAQ
Combien coûte l’API Gemini 3.6 Flash ?
Le tarif Standard de Google est de $1.50 par million de jetons d’entrée et $7.50 par million de jetons de sortie. L’entrée mise en cache standard coûte $0.15/M. Batch et Flex coûtent $0.75/M en entrée et $3.75/M en sortie.
Gemini 3.6 Flash est-il gratuit ?
Oui. La tarification actuelle de l’API Gemini pour développeurs de Google liste un accès Standard au palier gratuit pour Gemini 3.6 Flash. L’accès gratuit reste soumis aux limites de débit selon le projet et le palier d’usage.
Gemini 3.6 Flash est-il généralement disponible ?
Oui. Google a publié gemini-3.6-flash le 21 juillet 2026 et le liste comme modèle de production dans la documentation de l’API Gemini.
Quelle est la fenêtre de contexte de Gemini 3.6 Flash ?
Gemini 3.6 Flash prend en charge jusqu’à 1,048,576 jetons d’entrée et 65,536 jetons de sortie. Il accepte des entrées texte, image, vidéo, audio et PDF, et produit une sortie texte.
Gemini 3.6 Flash est-il moins cher que Gemini 3.5 Flash ?
Oui pour les jetons de sortie. Les deux modèles coûtent $1.50/M en jetons d’entrée standard, tandis que Gemini 3.6 Flash réduit le prix de sortie de $9.00/M à $7.50/M.
Dois-je utiliser Gemini 3.6 Flash ou Gemini 3.5 Flash-Lite ?
Utilisez Gemini 3.6 Flash lorsque la qualité de codage, le raisonnement multimodal ou l’exécution d’agents complexes peuvent réduire les échecs et les réessais. Commencez avec Flash-Lite pour l’extraction à grand volume, la classification, l’aiguillage et autres charges prévisibles où le coût inférieur compte davantage.
Que faut-il changer avant de migrer vers Gemini 3.6 Flash ?
Supprimez temperature, top_p, top_k et candidate_count ; remplacez thinking_budget par thinking_level ; supprimez les tours de modèle préremplis ; et retestez l’appel de fonctions et la gestion de l’état multi-tours.
Conclusion
Gemini 3.6 Flash mérite un benchmark si vous utilisez déjà Gemini 3.5 Flash pour le codage, le travail multimodal ou les workflows d’agent.
Son prix de sortie est plus bas, et les premiers résultats de Google suggèrent que certaines charges peuvent aussi nécessiter moins de jetons et moins d’étapes d’exécution. Pour des agents qui raisonnent à répétition, appellent des outils et réessaient des actions échouées, ces économies peuvent compter davantage que la différence de prix mise en avant.
Mais cela ne signifie pas que chaque requête doit passer à 3.6 Flash.
Gemini 3.5 Flash-Lite est nettement moins cher et peut suffire pour des travaux prévisibles comme l’extraction, la classification et l’aiguillage.
La meilleure stratégie de production est d’utiliser chaque modèle là où cela a du sens économiquement : Flash-Lite pour les tâches simples et volumineuses ; 3.6 Flash là où un raisonnement plus fort peut améliorer les chances de terminer correctement du premier coup.
Mesurez ensuite le résultat qui compte vraiment – le coût total pour obtenir une réponse acceptée.
Pour comparer les deux modèles via le même workflow, consultez la page du modèle Gemini 3.6 Flash (https://www.cometapi.com/models/google/gemini-3-6-flash/) et la page du modèle Gemini 3.5 Flash-Lite (https://www.cometapi.com/models/google/gemini-3-5-flash-lite/) sur CometAPI, ou examinez les routes de modèles actuelles sur la page des tarifs CometAPI (https://www.cometapi.com/pricing/).
