TL;DR : Le 30 septembre 2026, Google DeepMind a annoncé Gemini 4 Argon, son nouveau modèle de frontière et le début de la série Gemini 4. Il offre des performances à l’état de l’art en ingénierie logicielle à long horizon (77,9 % sur DeepSWE v1.1), en travail de connaissance en entreprise (en tête du Vals Index avec 68,9 %) et en cybersécurité défensive. Les améliorations clés incluent une limite de sortie de 1 million de jetons, leader du secteur (contre 64K auparavant).
Points clés
- Gemini 4 Argon est le modèle le plus performant de Google à ce jour, optimisé pour des workflows complexes et multi-étapes en codage, travail de connaissance juridique/financier et cyberdéfense.
- Argon est conçu pour un raisonnement soutenu à travers des workflows longs et multi-étapes plutôt que pour de simples conversations courtes. Google met l’accent sur l’ingénierie logicielle réelle, le travail juridique et financier, la compréhension multimodale et la défense en cybersécurité.
- Google a étendu la sortie maximale de 64 000 jetons auparavant à 1 million de jetons. Google n’a pas encore publié une spécification publique complète de l’API Gemini pour le contexte d’entrée d’Argon, ses modalités, le comportement des endpoints ou les limites de débit.
- Dans le tableau comparatif de Google, Argon obtient 68,9 % sur le Vals Index, 77,9 % sur DeepSWE v1.1, 91,7 % sur LVBench et 68 % sur CWE-bench v1. Il ne mène pas tous les tests : GPT-6 Astra gagne FrontierSWE v2 et Terminal-Bench Science, tandis que Claude Opus 5.5 mène Terminal-Bench 4.0 et PostTrainBench.
- Le prix d’introduction de l’API de Google est de 2 $ par million de jetons d’entrée et 10 $ par million de jetons de sortie. Après la période d’introduction, les tarifs passent à 4 $ et 20 $, respectivement. L’entrée mise en cache est annoncée à 95 % de réduction par rapport au prix des jetons d’entrée applicables.
- Le catalogue public de CometAPI listait
gemini-4-argoncomme disponible, et non à venir, au 1er octobre 2026.
Google a retrouvé une position de leader dans la course à l’IA de frontière avec le lancement de Gemini 4 Argon. Annoncé le 30 septembre 2026, ce modèle marque le début de l’ère Gemini 4 et se présente explicitement comme la “prochaine ère de l’intelligence de frontière” chez Google. Il cible les charges de travail réelles les plus difficiles : codage agentique soutenu, travail de connaissance en entreprise à forts enjeux (juridique, finance, fiscalité) et cybersécurité défensive.
Contrairement aux mises à jour incrémentales précédentes, Argon introduit une évolution fondamentale de la profondeur de capacité via une longueur de sortie radicalement étendue et un entraînement spécialisé pour les tâches à long horizon. Des milliers d’employés de Google l’utilisent déjà en interne pour des travaux d’ingénierie en production, tandis que l’accès externe commence prudemment avec des partenaires cybersécurité triés sur le volet.
Qu’est-ce que Gemini 4 Argon ?
Gemini 4 Argon est le dernier grand modèle linguistique de frontière de Google DeepMind et la première version de la famille Gemini 4. Il est conçu spécifiquement pour soutenir un raisonnement approfondi à travers des workflows complexes, multi-étapes et à long horizon que les modèles précédents peinaient à mener à bien de manière fiable en une seule trajectoire.
Selon Google, Argon “offre des performances de frontière dans des workflows complexes couvrant l’ingénierie logicielle réelle, le travail de connaissance en entreprise comme le juridique et la finance, et la défense en cybersécurité.” Il s’appuie sur les enseignements des efforts Gemini 3.5 Pro retardés ou annulés plus tôt en 2026 et sur la focalisation ultérieure sur la série Gemini 3.8 Flash.
Le modèle met l’accent sur des capacités agentiques — planification autonome, utilisation d’outils, génération et édition de code, découverte et remédiation de vulnérabilités, analyse multi-document et compréhension de longues vidéos — tout en intégrant des systèmes de sécurité renforcés pour une puissance de niveau frontière.
En interne, Argon apporte déjà un impact mesurable à l’échelle de Google :
- Les équipes de calcul quantique l’ont utilisé pour optimiser les ressources spatio-temporelles (qubits × portes), surpassant les baselines publiées de 40 % en quelques minutes.
- Des équipes d’agents ont analysé la télémétrie à l’échelle de la flotte et ont appliqué de manière autonome des optimisations mémoire, libérant plus de 300 TiB de mémoire dans les centres de données (avec des économies totales estimées entre 500 TiB et 1 PiB).
- Des migrations de code à grande échelle de C/C++ vers Rust sont en cours, incluant des dizaines de milliers de lignes dans des bibliothèques cœur (re2, libgav1) et plus de 800 000 lignes dans le noyau Zircon de Fuchsia. Un résultat notable : un décodeur vidéo à sécurité mémoire (libgav1) qui est 2.7× plus rapide que le précédent portage Rust après une optimisation guidée par profil.
Ces déploiements concrets soulignent qu’Argon n’est pas seulement un champion des benchmarks mais un multiplicateur de productivité pratique pour des organisations d’ingénierie complexes.
Accessibilité de Gemini 4 Argon au 1er octobre
Google adopte une approche volontairement échelonnée de sortie en raison des capacités avancées du modèle. Il est actuellement déployé auprès d’un ensemble de défenseurs du cyber de confiance via le programme Fairwind (qui a enrôlé plus de 650 organisations, dont de grandes entreprises de sécurité). Google participe également au processus volontaire d’accès anticipé aux modèles du gouvernement américain. Une disponibilité plus large pour les développeurs, les entreprises et les consommateurs — en commençant par les clients API payants et les abonnés à Google AI Ultra — est attendue “dès que possible” après de nouvelles itérations des garde-fous sur la base des premiers retours.
Caractéristiques clés de Gemini 4 Argon
1. Raisonnement à long horizon avec jusqu’à 1 M de jetons de sortie
Google indique que la sortie maximale d’Argon est de 1 million de jetons, contre 64 000 jetons pour la génération précédente. Il s’agit d’une limite maximale de génération, pas d’une indication que chaque réponse doive être énorme. Cela donne au modèle la marge nécessaire pour des trajectoires de raisonnement longues, de la génération de code multi-fichiers, de la recherche détaillée ou un travail d’agent prolongé sans imposer une nouvelle requête toutes les quelques étapes.
2. Ingénierie logicielle en conditions réelles
Le score de 77,9 % d’Argon sur DeepSWE v1.1 est la valeur la plus élevée du tableau comparatif de Google. DeepSWE se concentre sur des travaux d’ingénierie logicielle à long horizon, mieux alignés avec des agents de codage autonomes que les tests courts de complétion de code. Le modèle atteint également 91,9 % sur Vibe Code Bench.
Le tableau n’est pas univoque. GPT-6 Astra obtient 65,5 % sur FrontierSWE v2 contre 55,0 % pour Argon, et Claude Opus 5.5 atteint 66,4 % sur Terminal-Bench 4.0 contre 57,4 % pour Argon. Les acheteurs devraient donc tester séparément l’édition de dépôts, l’utilisation du shell, le débogage et les travaux de migration plutôt que de se fier à un seul score “coding”.
3. Travail de connaissance en entreprise
Google rapporte Argon à 68,9 % sur le Vals Index, qui pondère finance, codage, juridique et fiscalité par leur contribution au PIB américain. Il devance également les modèles comparés sur Vals Finance Agent v2, le benchmark Legal Agent de Harvey et AutomationBench.
Ces évaluations rendent Argon particulièrement pertinent pour des workflows à forte intensité de recherche : due diligence, revue de contrats, analyse financière, recherche fiscale et synthèse inter-documents. Elles n’éliminent pas la nécessité de vérifier les sources ou de procéder à une relecture professionnelle. Un leadership sur un benchmark mesure la performance dans un cadre précis ; il n’établit pas l’aptitude à des décisions juridiques ou financières non supervisées.
4. Compréhension multimodale et de longues vidéos
Argon obtient 71,6 % sur Chartography et 91,7 % sur LVBench, devançant de peu GPT-6 Astra sur la compréhension de graphiques et plus nettement sur la compréhension de longues vidéos. Google décrit également des workflows dans lesquels Argon interprète une séquence de documents et agit sur le résultat.
Cette combinaison est utile lorsque le texte seul ne suffit pas : analyser des graphiques de résultats aux côtés de dépôts, extraire des preuves à partir d’heures de vidéo, examiner des captures d’écran de produits avec des exigences écrites ou rapprocher des données entre PDFs et rapports visuels.
5. Cybersécurité défensive
Google a entraîné Argon à découvrir, valider et corriger des vulnérabilités critiques. Sur CWE-bench v1, Argon et GPT-6 Astra obtiennent tous deux 68 %, tandis que Claude Opus 5.5 atteint 67 %. Google affirme qu’Argon surpasse également Gemini 3.8 Flash Cyber dans ses évaluations internes de découverte de vulnérabilités et de tests d’intrusion en boîte noire.
L’accès initial reflète le risque. Des défenseurs du cyber de confiance peuvent utiliser le modèle via le programme Fairwind, et Google affirme que Wiz a utilisé Argon dans son initiative Scan for Good pour identifier une vulnérabilité critique affectant des logiciels de santé. Une distribution restreinte donne à Google le temps de réunir des preuves avant d’exposer plus largement des capacités cyber avancées.
6. Le taux d’hallucination est tombé à 10 %.
Gemini 4 Argon affiche un taux d’hallucination incroyablement bas sur Artificial Analysis. 15 %. Arena rapporte une estimation d’hallucinations d’outils de 0.10 % +/- 0.48 % pour Gemini 4 Argon High, contre 0.16 % +/- 0.09 % pour Gemini 3.8 Flash High. L’estimation ponctuelle est plus basse, ce qui suggère une amélioration. Toutefois, les intervalles d’incertitude se chevauchent largement, et l’intervalle d’Argon est bien plus large.
Performances de Gemini 4 Argon aux benchmarks
Les chiffres suivants proviennent du tableau comparatif de Google DeepMind. Google renvoie à un document de méthodologie séparé et précise que les scores sont des pass@1 sauf mention contraire. Traitez-les comme des résultats publiés par le fournisseur et validez-les sur vos charges de travail privées.
| Benchmark | Charge de travail | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Leader |
|---|---|---|---|---|---|
| Vals Index | Travail de connaissance pondéré PIB | 68,9% | 63,1% | 67,0% | Argon |
| AutomationBench | Automatisation métier de bout en bout | 51,3% | 41,4% | 42,5% | Argon |
| Vals Finance Agent v2 | Recherche financière multi-étapes | 65,4% | 53,5% | 58,6% | Argon |
| Harvey Legal Agent | Recherche et rédaction juridiques | 19,6% | 5,4% | 3,8% | Argon |
| DeepSWE v1.1 | Ingénierie logicielle à long horizon | 77,9% | 74,1% | 74,2% | Argon |
| FrontierSWE v2 | Codage agentique | 55,0% | 65,5% | 62,3% | Astra |
| Terminal-Bench 4.0 | Travail d’agent en terminal | 57,4% | 58,2% | 66,4% | Opus |
| Terminal-Bench Science 0.1 | Agents science et mathématiques | 57,6% | 68,1% | 63,3% | Astra |
| GraphWalks, 256K-1M | Parcours de graphes long-contexte, F1 | 84,2% | 71,8% | 66,8% | Argon |
| Agent's Last Exam | Utilisation de l’ordinateur | 39,5% | 34,2% | 38,2% | Argon |
| OSWorld 2.0 offline subset | Utilisation de l’ordinateur, score partiel | 69,2% | 72,6% | Not reported | Astra |
| Chartography | Compréhension de graphiques | 71,6% | 71,0% | 66,3% | Argon |
| LVBench | Compréhension de longues vidéos | 91,7% | 87,5% | 83,7% | Argon |
| CWE-bench v1 | Remédiation de vulnérabilités | 68,0% | 68,0% | 67,0% | Ex aequo |
Comment lire les résultats
L’avantage le plus net d’Argon est l’étendue de ses performances à travers le travail de connaissance professionnel, le long contexte, l’analyse de graphiques et les longues vidéos. Son résultat de 19,6 % comme agent juridique est plus de trois fois supérieur aux 5,4 % d’Astra, bien que les trois scores absolus montrent que le benchmark reste difficile. Argon mène également AutomationBench de 8,8 points devant Opus 5.5.
Le codage nécessite une conclusion plus nuancée. Argon devance DeepSWE et Vibe Code Bench, mais Astra mène FrontierSWE et Opus mène Terminal-Bench 4.0. Pour le travail terminal orienté sciences, Astra devance Argon de 10.5 points. Le bon titre n’est pas “Argon gagne tous les benchmarks”. C’est qu’Argon est exceptionnellement solide sur les workflows d’entreprise à long horizon, tandis que les concurrents conservent d’importants avantages spécifiques à certaines tâches.

Les preuves issues des benchmarks sont solides mais non universelles. GPT-6 Astra reste devant sur plusieurs mesures en sciences, codage et usage de l’ordinateur, tandis que Claude Opus 5.5 mène des tests importants de terminal et d’ingénierie ML. Des preuves indépendantes tout aussi nuancées : Artificial Analysis classe Argon n° 8 sur 223 modèles dans sa classe de comparaison, et Arena classe Gemini 4 Argon High #8 sur 46 modèles d’agents tout en le plaçant premier en pilotabilité. Le plus grand avantage d’Argon réside dans la combinaison de raisonnement à long horizon, de performances dans les domaines d’entreprise et de profondeur multimodale à un prix annoncé agressif.
Gemini 4 Argon est-il disponible ?
Au moment de l’annonce (30 septembre 2026) et des couvertures qui ont suivi, non — pas pour le grand public ni pour les développeurs standard. L’accès est restreint à :
- Membres de confiance du programme Fairwind (défenseurs du cyber, gouvernements, partenaires d’infrastructures critiques).
- Équipes internes de Google.
- Participants au processus volontaire d’accès anticipé aux modèles du gouvernement américain.
Google indique qu’il étendra “dès que possible” après avoir collecté des retours et itéré sur les garde-fous, en commençant par les clients API payants et les abonnés à Google AI Ultra, puis un accès plus large aux développeurs, entreprises et consommateurs. Aucune date publique précise n’a été donnée
Tarification de l’API Gemini 4 Argon
Le prix d’introduction de Google est de 2 $ par million de jetons d’entrée et 10 $ par million de jetons de sortie. Le tarif post-introduction est de 4 $ pour l’entrée et 20 $ pour la sortie. L’entrée mise en cache est tarifée avec une remise de 95 % par rapport au tarif d’entrée applicable, ce qui implique 0,10 $ par million durant la période d’introduction et 0,20 $ ensuite si la politique est appliquée exactement telle qu’annoncée.
Le prix est attractif par rapport à d’autres modèles de frontière premium, mais le coût par jeton n’est pas le coût par tâche accomplie. Un modèle qui génère des centaines de milliers de jetons de sortie ou effectue de nombreux appels d’outils peut tout de même produire une facture élevée. Définissez des plafonds de sortie, surveillez les boucles d’outils et mesurez le coût par résultat accepté.
Comment accéder à l’API Gemini 4 Argon via CometAPI
Une fois que Google ouvrira un accès API plus large, les plateformes agrégeant des modèles de frontière deviendront le moyen le plus rapide et souvent le plus rentable pour les développeurs d’expérimenter et d’industrialiser.
CometAPI fournit un endpoint unifié compatible OpenAI vers plus de 500 modèles d’OpenAI, Anthropic, Google et autres. Cela signifie que vous pouvez basculer entre les modèles Gemini, les variantes GPT-6 et les modèles Claude en ne changeant que le paramètre de modèle — sans gérer plusieurs comptes, systèmes de facturation ou SDKs.
Étapes recommandées pour se préparer et accéder via CometAPI :
- Inscrivez-vous sur cometapi.com et générez une clé API depuis le tableau de bord (commence par
sk-). - Utilisez l’URL de base
https://api.cometapi.com/v1. - Appelez les modèles avec le SDK OpenAI standard ou le format Gemini natif.
CometAPI prend déjà en charge la famille Gemini (y compris les modèles Pro et Flash antérieurs) avec une tarification compétitive, des crédits d’essai gratuits et un basculement transparent. Consultez régulièrement la page des modèles de CometAPI pour la disponibilité de Gemini 4 Argon. Cette approche évite les frictions d’intégration à Google Cloud et permet un A/B testing facile face à Claude Opus 5.5 ou GPT-6 Astra dans le même codebase.
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5
| Catégorie | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Fournisseur | OpenAI | Anthropic | |
| Statut de sortie au 1er oct. 2026 | Déploiement limité testeurs de confiance ; accès plus large à venir | Modèle API actif | Dernier modèle actif ; publié le 22 sept. 2026 |
| Meilleure adéquation | Travail de connaissance à long horizon, analyse multimodale, cyberdéfense, grandes sorties | Raisonnement complexe, sciences, utilisation de l’ordinateur, large écosystème d’outils | Codage agentique et travail de connaissance de longue durée |
| Contexte d’entrée | Pas encore publié en spécification API publique finale | 1,050,000 tokens | 1,000,000 tokens |
| Sortie maximale | 1,000,000 tokens | 128,000 tokens | 128,000 synchrones ; 300,000 Batch bêta |
| Entrées et sorties | Capacités multimodales mentionnées ; matrice d’API publique détaillée à venir | Texte et image en entrée ; texte en sortie | Texte et images en entrée ; texte en sortie |
| Contrôle du raisonnement | Raisonnement à long horizon ; contrôles d’API publics à venir | effort de raisonnement de faible à maximal | Réflexion adaptative toujours activée ; effort par défaut moyen |
| Prix standard par 1 M de jetons | Intro : 2 $ entrée / 10 $ sortie ; ensuite 4 $ / 20 $ | 10 $ entrée / 50 $ sortie | 4 $ entrée / 20 $ sortie |
| Victoires marquantes dans la table de Google | Vals, AutomationBench, DeepSWE, long contexte, LVBench | FrontierSWE, travail terminal scientifique, sous-ensemble OSWorld | Terminal-Bench 4.0, PostTrainBench |
| Principal écueil | Disponibilité API large et spécifications complètes encore en déploiement | Prix catalogue le plus élevé des trois | Ne domine pas la table de travail de connaissance de Google ; la réflexion adaptative ne peut pas être désactivée |
Quel modèle est le meilleur ?
Choisissez Gemini 4 Argon lorsque le travail de connaissance à long contexte, les preuves multimodales, la cybersécurité défensive ou des artefacts générés inhabituellement volumineux dominent la charge de travail. Choisissez GPT-6 Astra lorsque vous avez besoin de la surface d’outils mûre d’OpenAI, de solides performances en agents scientifiques ou de ses forces spécifiques d’utilisation de l’ordinateur. Choisissez Claude Opus 5.5 pour le codage agentique natif Claude et les workflows en terminal, surtout lorsque son comportement fonctionne déjà bien dans votre harnais d’évaluation.
Pour la plupart des entreprises, la meilleure stratégie n’est pas une décision monomodèle permanente. Routez les requêtes routinières vers un modèle moins coûteux, évaluez Argon, Astra et Opus sur la queue difficile, et conservez un fallback. CometAPI est utile ici car une seule couche d’intégration peut faciliter les tests croisés de modèles et le routage contrôlé.
Conclusion
Gemini 4 Argon marque le retour le plus fort de Google à l’absolu de la frontière, reprenant le leadership sur plusieurs benchmarks critiques pour l’entreprise et à long horizon tout en introduisant des avancées pratiques comme 1 M de jetons de sortie et une tarification d’introduction agressive. Son déploiement progressif et axé sur la sécurité priorise une mise en production responsable de capacités de cyberdéfense puissantes.
