Tekniske specifikationer for Gemini 4 Argon
| Specifikation | Gemini 4 Argon |
|---|---|
| Udbyder | Google DeepMind |
| Modelfamilie | Gemini 4 |
| Model-ID | gemini-4-argon |
| Modeltype | Frontier-multimodal ræsonneringsmodel |
| Primært fokus | Komplekse arbejdsgange, agentbaseret kodning, virksomhedsvidensarbejde, cybersikkerhed |
| Multimodal kapabilitet | Google beskriver multimodal forståelse; den offentlige modelside giver endnu ikke et fuldstændigt API-modalitetsskema |
| Maksimalt output | Op til 1,000,000 tokens ifølge nuværende tredjeparts-API-lister; dette bør ikke forveksles med input-kontekstvinduet |
| Input-kontekstvindue | Ikke klart offentliggjort af Google på den nuværende offentlige modelside |
| Offentlig API-tilgængelighed | Begrænset/forudgivelsesadgang; Google har ikke annonceret en generel offentlig udgivelsesdato |
Hvad er Gemini 4 Argon?
Gemini 4 Argon er flagskibsmodellen, der forankrer Googles Gemini 4-generation. Google beskriver den som designet til frontier-ydelse på komplekse arbejdsbelastninger, herunder softwareengineering, virksomheds-vidensarbejde og defensiv cybersikkerhed. Det offentliggjorte evalueringssæt dækker vidensarbejde, agentbaseret kodning, naturvidenskab og matematik, computeranvendelse, multimodal forståelse, opgaver med lang kontekst og cybersikkerhed.
Argons positionering er markant arbejdsgangsorienteret snarere end begrænset til samtalebaseret spørgsmål-svar. Google fremhæver evnen til at opretholde lange, flertrinsopgaver og at operere på tværs af komplekse softwareingeniør- og virksomhedsarbejdsgange.
Hovedfunktioner for Gemini 4 Argon
- Ræsonnering over komplekse arbejdsgange: Designet til lange, flertrinsopgaver, der kræver vedvarende ræsonnering frem for et enkelt kort svar.
- Agentbaseret kodning: Google rapporterer stærke resultater på DeepSWE v1.1, Vibe Code Bench og andre kodnings-evalueringer.
- Virksomheds-vidensarbejde: Offentliggjorte evalueringer omfatter finans- og juridiske agentopgaver samt ende-til-ende automatisering af forretningsprocesser.
- Multimodal forståelse: Google rapporterer stærke resultater på Chartography og LVBench, som dækker multimodal forståelse og forståelse af lange videoer.
- Ydelse i lang kontekst: Resultater for GraphWalks er rapporteret for både op til 128K og 256K–1M token-intervaller.
- Cybersikkerhedsforsvar: Google positionerer specifikt Argon til defensiv cybersikkerhed og rapporterer CWE-bench v1-resultater for udbedring af sårbarheder.
Benchmark-ydelse for Gemini 4 Argon
Google DeepMind rapporterer følgende resultater på den aktuelle Gemini 4 Argon-evalueringsside. Dette er resultater publiceret af leverandøren og bør kun sammenlignes inden for den angivne benchmarkmetodologi. [1]
| Benchmark | Kategori | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | Vidensarbejde | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | Vidensarbejde | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | Vidensarbejde | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | Vidensarbejde | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | Agentbaseret kodning | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | Agentbaseret kodning | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | Agentbaseret kodning | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | Agentbaseret kodning | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | Naturvidenskab og matematik | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | Naturvidenskab og matematik | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | Naturvidenskab og matematik | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, op til 128K | Lang kontekst | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | Lang kontekst | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | Multimodal forståelse | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | Multimodal forståelse | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | Cybersikkerhed | 68.0% | 68.0% | 58.0% | 67.0% |
Resultaterne viser, at Argons ydeevne varierer efter opgave: den fører den citerede sammenligning på flere vidensarbejds-, kodnings-, naturvidenskabs-, langkontekst- og multimodale evalueringer, mens andre modeller scorer højere på specifikke kodnings-, videnskabs- eller computeranvendelses-benchmarks. De bør ikke sammenfattes til en enkelt samlet rangordning.
Gemini 4 Argon vs GPT-6 Astra vs Claude Fable 5.1
| Område | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| Vidensarbejde | Stærke offentliggjorte resultater på tværs af Vals, AutomationBench, finans- og juridiske agent-evalueringer | Stærk på det samme evalueringssæt | Stærk på flere vidensarbejds-evalueringer |
| Agentbaseret kodning | 77.9% på DeepSWE v1.1; 91.9% på Vibe Code Bench | 74.1% på DeepSWE v1.1; 89.6% på Vibe Code Bench | 67.4% på DeepSWE v1.1; 90.3% på Vibe Code Bench |
| Lang kontekst | 99.7% på GraphWalks op til 128K; 84.2% fra 256K–1M | 98.7% og 71.8% henholdsvis | 91.4% og 65.0% henholdsvis |
| Multimodal forståelse | 71.6% Chartography; 91.7% LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| Cybersikkerhed | 68.0% på CWE-bench v1 | 68.0% | 58.0% |
Sammenligningen er benchmark-specifik. For eksempel scorer GPT-6 Astra højere end Argon på FrontierSWE v2 og Terminal-Bench Science 0.1, mens Argon scorer højere på DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M og LVBench.
Repræsentative anvendelsestilfælde
- Softwareudvikling i repository-skala — Kodning med lang horisont, refaktorering, fejlfinding og agentbaseret udvikling.
- Virksomheds-vidensarbejdsgange — Juridisk research, finansiel analyse og automatisering af forretningsprocesser.
- Cybersikkerhedsforsvar — Opdagelse, validering og udbedring af sårbarheder i kontrollerede miljøer.
- Videnskabelige og matematiske arbejdsgange — Opgaver afspejlet i LABBench, RiemannBench og videnskabsorienterede evalueringer.
- Analyse af lange videoer og multimodale data — Opgaver der kræver tolkning på tværs af visuel og tidsmæssig information.
- Agenter med lang kontekst — Applikationer der skal bevare information på tværs af meget store opgaveforløb.