Technische Spezifikationen von Gemini 4 Argon
| Spezifikation | Gemini 4 Argon |
|---|---|
| Anbieter | Google DeepMind |
| Modellfamilie | Gemini 4 |
| Modell-ID | gemini-4-argon |
| Modelltyp | Frontier-Modell für multimodales Schlussfolgern |
| Primärer Fokus | Komplexe Workflows, agentisches Codieren, unternehmensbezogene Wissensarbeit, Cybersicherheit |
| Multimodale Fähigkeiten | Google beschreibt multimodales Verständnis; die öffentliche Modellseite stellt noch kein vollständiges API-Modalitätsschema bereit |
| Maximale Ausgabe | Bis zu 1,000,000 Tokens laut aktuellen Drittanbieter-API-Listings; dies darf nicht mit dem Eingabe-Kontextfenster verwechselt werden |
| Eingabe-Kontextfenster | Von Google auf der aktuellen öffentlichen Modellseite nicht eindeutig veröffentlicht |
| Verfügbarkeit der öffentlichen API | Eingeschränkter/Vorabzugang; Google hat kein allgemeines Veröffentlichungsdatum bekanntgegeben |
Was ist Gemini 4 Argon?
Gemini 4 Argon ist das Flaggschiffmodell der Gemini-4-Generation von Google. Google beschreibt es als für Spitzenleistung bei komplexen Workloads konzipiert, darunter Softwareentwicklung, unternehmensbezogene Wissensarbeit und defensive Cybersicherheit. Der veröffentlichte Evaluationssatz umfasst Wissensarbeit, agentisches Codieren, Naturwissenschaften und Mathematik, Computernutzung, multimodales Verständnis, Langkontextaufgaben und Cybersicherheit.
Die Positionierung von Argon ist deutlich arbeitsablauforientiert und nicht auf dialogbasiertes Fragenbeantworten beschränkt. Google hebt die Fähigkeit hervor, langandauernde, mehrschrittige Aufgaben durchzuhalten und über komplexe Software-Engineering- und Unternehmens-Workflows hinweg zu agieren.
Hauptfunktionen von Gemini 4 Argon
- Schlussfolgern über komplexe Workflows: Ausgelegt für lange, mehrschrittige Aufgaben, die anhaltendes Denken erfordern statt einer einzelnen kurzen Antwort.
- Agentisches Codieren: Google berichtet über starke Ergebnisse bei DeepSWE v1.1, Vibe Code Bench und weiteren Coding-Evaluierungen.
- Unternehmensbezogene Wissensarbeit: Veröffentlichten Evaluierungen zufolge umfasst dies Finanz- und Legal-Agent-Aufgaben sowie End-to-End-Geschäftsautomatisierung.
- Multimodales Verständnis: Google meldet starke Ergebnisse bei Chartography und LVBench, die multimodales sowie Langvideo-Verständnis abdecken.
- Leistung bei langem Kontext: Für GraphWalks werden Ergebnisse sowohl bis 128K als auch im Bereich 256K bis 1M Tokens berichtet.
- Defensive Cybersicherheit: Google positioniert Argon ausdrücklich für defensive Cybersicherheit und berichtet CWE-bench v1 Ergebnisse zur Behebung von Schwachstellen.
Benchmark-Leistung von Gemini 4 Argon
Google DeepMind berichtet auf der aktuellen Evaluationsseite zu Gemini 4 Argon die folgenden Ergebnisse. Dies sind vom Anbieter veröffentlichte Resultate und sollten nur innerhalb der angegebenen Benchmark-Methodik verglichen werden. [1]
| Benchmark | Kategorie | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | Wissensarbeit | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | Wissensarbeit | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | Wissensarbeit | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | Wissensarbeit | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | Agentisches Codieren | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | Agentisches Codieren | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | Agentisches Codieren | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | Agentisches Codieren | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | Naturwissenschaften & Mathematik | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | Naturwissenschaften & Mathematik | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | Naturwissenschaften & Mathematik | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | Langer Kontext | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | Langer Kontext | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | Multimodales Verständnis | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | Multimodales Verständnis | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | Cybersicherheit | 68.0% | 68.0% | 58.0% | 67.0% |
Die Ergebnisse zeigen, dass die Leistung von Argon je nach Aufgabe variiert: In mehreren Evaluierungen zu Wissensarbeit, Codierung, Wissenschaft, langem Kontext und multimodalem Verständnis liegt es in dem zitierten Vergleich vorn, während andere Modelle bei spezifischen Benchmarks zu Codierung, Wissenschaft oder Computernutzung höher abschneiden. Sie sollten nicht zu einem einzigen Gesamtranking verdichtet werden.
Gemini 4 Argon vs GPT-6 Astra vs Claude Fable 5.1
| Bereich | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| Wissensarbeit | Starke veröffentlichte Ergebnisse über Vals, AutomationBench, Finanz- und Legal-Agent-Evaluierungen hinweg | Stark auf demselben Evaluationssatz | Stark in mehreren Evaluierungen zur Wissensarbeit |
| Agentisches Codieren | 77.9% bei DeepSWE v1.1; 91.9% bei Vibe Code Bench | 74.1% bei DeepSWE v1.1; 89.6% bei Vibe Code Bench | 67.4% bei DeepSWE v1.1; 90.3% bei Vibe Code Bench |
| Langer Kontext | 99.7% bei GraphWalks bis 128K; 84.2% von 256K–1M | 98.7% bzw. 71.8% | 91.4% bzw. 65.0% |
| Multimodales Verständnis | 71.6% Chartography; 91.7% LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| Cybersicherheit | 68.0% bei CWE-bench v1 | 68.0% | 58.0% |
Der Vergleich ist benchmark-spezifisch. Beispielsweise erzielt GPT-6 Astra bei FrontierSWE v2 und Terminal-Bench Science 0.1 höhere Werte als Argon, während Argon bei DeepSWE v1.1, Vibe Code Bench, GraphWalks 256K–1M und LVBench höher punktet.
Repräsentative Anwendungsfälle
- Softwareentwicklung im Repository-Maßstab — Langfristiges Codieren, Refactoring, Debugging und agentische Entwicklung.
- Unternehmensbezogene Wissens-Workflows — Rechtsrecherche, Finanzanalyse und Geschäftsprozessautomatisierung.
- Defensive Cybersicherheit — Auffinden, Validieren und Beheben von Schwachstellen in kontrollierten Umgebungen.
- Wissenschaftliche und mathematische Workflows — Aufgaben, die sich in LABBench, RiemannBench und wissenschaftsorientierten Evaluierungen widerspiegeln.
- Langvideo- und multimodale Analyse — Workloads, die Interpretation über visuelle und zeitliche Informationen hinweg erfordern.
- Langkontext-Agenten — Anwendungen, die Informationen über sehr große Aufgabenverläufe hinweg aufrechterhalten müssen.