Spécifications techniques de Gemini 4 Argon
| Spécification | Gemini 4 Argon |
|---|---|
| Fournisseur | Google DeepMind |
| Famille de modèles | Gemini 4 |
| ID du modèle | gemini-4-argon |
| Type de modèle | Modèle de raisonnement multimodal de pointe |
| Objectif principal | Flux de travail complexes, codage agentique, travail de connaissances en entreprise, cybersécurité |
| Capacités multimodales | Google décrit une compréhension multimodale ; la page publique du modèle ne fournit pas encore un schéma complet des modalités de l'API |
| Sortie maximale | Jusqu'à 1,000,000 jetons, selon les listes d'API tierces actuelles ; à ne pas confondre avec la fenêtre de contexte d'entrée |
| Fenêtre de contexte d'entrée | Pas clairement publiée par Google sur la page publique actuelle du modèle |
| Disponibilité de l'API publique | Accès limité/préversion ; Google n'a pas annoncé de date de sortie publique générale |
Qu'est-ce que Gemini 4 Argon ?
Gemini 4 Argon est le modèle phare qui ancre la génération Gemini 4 de Google. Google le décrit comme conçu pour des performances de pointe sur des charges de travail complexes, notamment l'ingénierie logicielle, le travail de connaissances en entreprise et la défense en cybersécurité. Son ensemble d'évaluations publiées couvre le travail de connaissances, le codage agentique, les sciences et les mathématiques, l'utilisation de l'ordinateur, la compréhension multimodale, les tâches à long contexte et la cybersécurité.
Le positionnement d'Argon est nettement axé sur les flux de travail plutôt que limité aux questions-réponses conversationnelles. Google met en avant la capacité à soutenir des tâches longues et multi-étapes et à opérer à travers des flux de travail complexes d'ingénierie logicielle et d'entreprise.
Principales fonctionnalités de Gemini 4 Argon
- Raisonnement pour des flux de travail complexes : Conçu pour des tâches longues et multi-étapes qui nécessitent un raisonnement soutenu plutôt qu'une seule réponse courte.
- Codage agentique : Google rapporte de solides résultats sur DeepSWE v1.1, Vibe Code Bench et d'autres évaluations de codage.
- Travail de connaissances en entreprise : Les évaluations publiées incluent des tâches de finance et d'agents juridiques ainsi que de l'automatisation d'entreprise de bout en bout.
- Compréhension multimodale : Google rapporte de bons résultats sur Chartography et LVBench, couvrant la compréhension multimodale et des vidéos longues.
- Performances en long contexte : Des résultats GraphWalks sont rapportés pour des plages jusqu'à 128K et de 256K à 1M.
- Défense en cybersécurité : Google positionne spécifiquement Argon pour la cybersécurité défensive et rapporte des résultats CWE-bench v1 pour la remédiation de vulnérabilités.
Performances de référence de Gemini 4 Argon
Google DeepMind rapporte les résultats suivants sur sa page d'évaluation actuelle de Gemini 4 Argon. Ce sont des résultats publiés par le fournisseur et ils ne doivent être comparés que dans le cadre de la méthodologie de référence indiquée. [1]
| Benchmark | Catégorie | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | Travail de connaissances | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | Travail de connaissances | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | Travail de connaissances | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | Travail de connaissances | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | Codage agentique | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | Codage agentique | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | Codage agentique | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | Codage agentique | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | Sciences & mathématiques | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | Sciences & mathématiques | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | Sciences & mathématiques | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | Contexte long | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | Contexte long | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | Compréhension multimodale | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | Compréhension multimodale | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | Cybersécurité | 68.0% | 68.0% | 58.0% | 67.0% |
Les résultats montrent que les performances d'Argon varient selon les tâches : il devance la comparaison citée sur plusieurs évaluations de travail de connaissances, de codage, de sciences, de long contexte et multimodales, tandis que d'autres modèles obtiennent de meilleurs scores sur certains benchmarks spécifiques de codage, de sciences ou d'utilisation de l'ordinateur. Ils ne doivent pas être réduits à un classement global unique.
Gemini 4 Argon vs GPT-6 Astra vs Claude Fable 5.1
| Domaine | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| Travail de connaissances | Résultats publiés solides sur Vals, AutomationBench, la finance et les évaluations d'agents juridiques | Solide sur le même ensemble d'évaluations | Solide sur plusieurs évaluations de travail de connaissances |
| Codage agentique | 77.9% sur DeepSWE v1.1 ; 91.9% sur Vibe Code Bench | 74.1% sur DeepSWE v1.1 ; 89.6% sur Vibe Code Bench | 67.4% sur DeepSWE v1.1 ; 90.3% sur Vibe Code Bench |
| Contexte long | 99.7% sur GraphWalks jusqu'à 128K ; 84.2% de 256K à 1M | 98.7% et 71.8% respectivement | 91.4% et 65.0% respectivement |
| Compréhension multimodale | 71.6% sur Chartography ; 91.7% sur LVBench | 71.0% ; 87.5% | 46.2% ; 79.7% |
| Cybersécurité | 68.0% sur CWE-bench v1 | 68.0% | 58.0% |
La comparaison est spécifique aux benchmarks. Par exemple, GPT-6 Astra obtient un score plus élevé qu'Argon sur FrontierSWE v2 et Terminal-Bench Science 0.1, tandis qu'Argon obtient un score plus élevé sur DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M et LVBench.
Cas d'utilisation représentatifs
- Ingénierie logicielle à l'échelle du dépôt — Codage de long horizon, refactorisation, débogage et développement agentique.
- Flux de travail de connaissances en entreprise — Recherche juridique, analyse financière et automatisation des processus métier.
- Défense en cybersécurité — Découverte, validation et remédiation des vulnérabilités dans des environnements contrôlés.
- Flux de travail scientifiques et mathématiques — Tâches reflétées par LABBench, RiemannBench et des évaluations orientées science.
- Analyse de longues vidéos et multimodale — Charges de travail nécessitant une interprétation sur des informations visuelles et temporelles.
- Agents à long contexte — Applications qui doivent maintenir des informations sur de très grandes trajectoires de tâches.