Specyfikacja techniczna modelu Gemini 4 Argon
| Specyfikacja | Gemini 4 Argon |
|---|---|
| Dostawca | Google DeepMind |
| Rodzina modeli | Gemini 4 |
| Identyfikator modelu | gemini-4-argon |
| Typ modelu | Frontierowy multimodalny model rozumujący |
| Główny obszar zastosowań | Złożone przepływy pracy, programowanie agentowe, prace oparte na wiedzy w przedsiębiorstwach, cyberbezpieczeństwo |
| Zdolności multimodalne | Google opisuje multimodalne rozumienie; publiczna strona modelu nie udostępnia jeszcze pełnego schematu modalności API |
| Maksymalne wyjście | Do 1,000,000 tokenów, zgodnie z bieżącymi zestawieniami API stron trzecich; nie należy mylić z oknem kontekstu wejściowego |
| Okno kontekstu wejściowego | Nieopublikowane w sposób jednoznaczny przez Google na obecnej publicznej stronie modelu |
| Dostępność publicznego API | Ograniczony/dostęp przedpremierowy; Google nie ogłosiło daty ogólnej dostępności |
Czym jest Gemini 4 Argon?
Gemini 4 Argon to flagowy model kotwiczący generację Gemini 4 od Google. Google opisuje go jako zaprojektowany do osiągania frontierowej wydajności w złożonych zadaniach, w tym inżynierii oprogramowania, pracach opartych na wiedzy w przedsiębiorstwach oraz obronie w zakresie cyberbezpieczeństwa. Opublikowany zestaw ewaluacji obejmuje prace oparte na wiedzy, programowanie agentowe, nauki ścisłe i matematykę, obsługę komputera, multimodalne rozumienie, zadania z długim kontekstem oraz cyberbezpieczeństwo.
Pozycjonowanie Argona jest wyraźnie zorientowane na przepływy pracy, a nie ograniczone do konwersacyjnego odpowiadania na pytania. Google podkreśla zdolność do utrzymywania długich, wieloetapowych zadań i działania w złożonych przepływach pracy związanych z inżynierią oprogramowania i środowiskiem przedsiębiorstw.
Główne cechy Gemini 4 Argon
- Złożone rozumowanie w ramach przepływów pracy: Zaprojektowany do długich, wieloetapowych zadań, które wymagają ciągłego rozumowania, a nie pojedynczej krótkiej odpowiedzi.
- Programowanie agentowe: Google raportuje silne wyniki na DeepSWE v1.1, Vibe Code Bench i innych ewaluacjach kodowania.
- Prace oparte na wiedzy w przedsiębiorstwie: Opublikowane ewaluacje obejmują zadania z zakresu finansów i prawa oraz kompleksową automatyzację procesów biznesowych.
- Multimodalne rozumienie: Google raportuje mocne wyniki na Chartography i LVBench, obejmujące multimodalne i długowideo rozumienie.
- Wydajność przy długim kontekście: Wyniki GraphWalks są raportowane zarówno dla zakresów do 128K, jak i 256K–1M tokenów.
- Obrona w zakresie cyberbezpieczeństwa: Google konkretnie pozycjonuje Argona do defensywnego cyberbezpieczeństwa i raportuje wyniki CWE-bench v1 dla remediacji podatności.
Wyniki benchmarków Gemini 4 Argon
Google DeepMind raportuje następujące wyniki na bieżącej stronie ewaluacyjnej Gemini 4 Argon. Są to wyniki publikowane przez dostawcę i należy je porównywać wyłącznie w ramach podanej metodologii benchmarków. [1]
| Benchmark | Kategoria | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | Prace oparte na wiedzy | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | Prace oparte na wiedzy | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | Prace oparte na wiedzy | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | Prace oparte na wiedzy | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | Programowanie agentowe | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | Programowanie agentowe | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | Programowanie agentowe | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | Programowanie agentowe | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | Nauka i matematyka | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | Nauka i matematyka | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | Nauka i matematyka | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | Długi kontekst | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | Długi kontekst | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | Multimodalne rozumienie | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | Multimodalne rozumienie | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | Cyberbezpieczeństwo | 68.0% | 68.0% | 58.0% | 67.0% |
Wyniki pokazują, że wydajność Argona zależy od zadania: prowadzi w cytowanym porównaniu w kilku ewaluacjach dotyczących prac opartych na wiedzy, kodowania, nauki, długiego kontekstu i multimodalności, podczas gdy inne modele uzyskują wyższe wyniki w określonych benchmarkach kodowania, nauki lub obsługi komputera. Nie należy ich sprowadzać do pojedynczej, ogólnej klasyfikacji.
Gemini 4 Argon vs GPT-6 Astra vs Claude Fable 5.1
| Obszar | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| Prace oparte na wiedzy | Silne opublikowane wyniki w Vals, AutomationBench, finansach i ewaluacjach agentów prawnych | Silne na tym samym zestawie ewaluacji | Silne w kilku ewaluacjach prac opartych na wiedzy |
| Programowanie agentowe | 77.9% na DeepSWE v1.1; 91.9% na Vibe Code Bench | 74.1% na DeepSWE v1.1; 89.6% na Vibe Code Bench | 67.4% na DeepSWE v1.1; 90.3% na Vibe Code Bench |
| Długi kontekst | 99.7% na GraphWalks do 128K; 84.2% w zakresie 256K–1M | 98.7% i 71.8% odpowiednio | 91.4% i 65.0% odpowiednio |
| Multimodalne rozumienie | 71.6% na Chartography; 91.7% na LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| Cyberbezpieczeństwo | 68.0% na CWE-bench v1 | 68.0% | 58.0% |
Porównanie ma charakter specyficzny dla benchmarków. Na przykład GPT-6 Astra uzyskuje wyższe wyniki niż Argon na FrontierSWE v2 i Terminal-Bench Science 0.1, podczas gdy Argon uzyskuje wyższe wyniki na DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M i LVBench.
Reprezentatywne przypadki użycia
- Inżynieria oprogramowania w skali repozytorium — długohoryzontowe kodowanie, refaktoryzacja, debugowanie i rozwój agentowy.
- Przepływy pracy oparte na wiedzy w przedsiębiorstwie — badania prawne, analiza finansowa i automatyzacja procesów biznesowych.
- Obrona w zakresie cyberbezpieczeństwa — wykrywanie, weryfikacja i remediacja podatności w kontrolowanych środowiskach.
- Naukowe i matematyczne przepływy pracy — zadania odzwierciedlane przez LABBench, RiemannBench i ewaluacje zorientowane na naukę.
- Analiza długich nagrań wideo i multimodalna — obciążenia wymagające interpretacji informacji wizualnych i czasowych.
- Agenci długiego kontekstu — aplikacje, które muszą utrzymywać informacje w ramach bardzo rozległych trajektorii zadań.