TLDR: Am 30. September 2026 kündigte Google DeepMind Gemini 4 Argon an, sein neues Frontier-Modell und den Start der Gemini-4-Reihe. Es liefert Spitzenleistungen in langfristiger Softwaretechnik (77.9% auf DeepSWE v1.1), unternehmensbezogener Wissensarbeit (führt den Vals Index mit 68.9%) und defensiver Cybersicherheit. Wichtige Upgrades umfassen ein branchenführendes Ausgabelimit von 1 Million Token (zuvor 64K).
Wichtigste Erkenntnisse
- Gemini 4 Argon ist Googles bislang leistungsfähigstes Modell, optimiert für komplexe, mehrstufige Workflows in Coding, rechtlicher/finanzieller Wissensarbeit und Cyberabwehr.
- Argon ist auf nachhaltiges Reasoning über lange, mehrstufige Workflows ausgelegt statt auf gewöhnlichen Kurzchat. Google betont reale Softwareentwicklung, Rechts- und Finanzarbeit, multimodales Verständnis und Cybersecurity-Abwehr.
- Google hat das maximale Ausgabevolumen vom bisherigen 64K-Token-Level auf 1 Million Token erweitert. Google hat noch keine vollständige öffentliche Gemini-API-Spezifikation für Argons Eingabekontext, Modalitäten, Endpunktverhalten oder Ratenlimits veröffentlicht.
- In Googles Vergleichstabelle erzielt Argon 68.9% auf dem Vals Index, 77.9% auf DeepSWE v1.1, 91.7% auf LVBench und 68% auf CWE-bench v1. Es führt nicht jeden Test an: GPT-6 Astra gewinnt FrontierSWE v2 und Terminal-Bench Science, während Claude Opus 5.5 Terminal-Bench 4.0 und PostTrainBench anführt.
- Googles Einführungspreis beträgt $2 pro Million Eingabetoken und $10 pro Million Ausgabetoken. Nach der Einführungsphase steigen die Preise auf $4 bzw. $20. Zwischengespeicherte Eingaben werden mit 95% Rabatt auf den jeweiligen Eingabetoken-Preis beworben.
- Der öffentliche Katalog von CometAPI führte
gemini-4-argonam 1. Oktober 2026 als verfügbar statt als „bald verfügbar“.
Mit der Einführung von Gemini 4 Argon hat Google eine führende Position im Rennen um Frontier-AI zurückerobert. Angekündigt am 30. September 2026 markiert dieses Modell den Beginn der Gemini-4-Ära und wird ausdrücklich als Googles „nächste Ära frontier-intelligenter Systeme“ positioniert. Es zielt auf die schwierigsten realen Arbeitslasten: nachhaltiges agentisches Coding, hochkritische unternehmensweite Wissensarbeit (Recht, Finanzen, Steuern) und defensive Cybersicherheit.
Im Gegensatz zu früheren inkrementellen Updates bringt Argon einen grundlegenden Sprung in der Fähigkeitstiefe durch drastisch erweiterte Ausgabelänge und spezielles Training für Langhorizont-Aufgaben. Tausende Google-Mitarbeitende nutzen es bereits intern für Produktions-Engineering, während der externe Zugriff zunächst eng mit geprüften Cybersecurity-Partnern beginnt.
Was ist Gemini 4 Argon?
Gemini 4 Argon ist Googles neuestes Frontier-Sprachmodell (LLM) von DeepMind und die erste Veröffentlichung der Gemini-4-Familie. Es ist speziell dafür ausgelegt, tiefes Reasoning über komplexe, mehrstufige, langfristige Workflows hinweg aufrechtzuerhalten, die frühere Modelle in einem einzelnen Verlauf nicht zuverlässig abschließen konnten.
Laut Google „liefert Argon Frontier-Performance in komplexen Workflows in realer Softwareentwicklung, unternehmensbezogener Wissensarbeit wie Recht und Finanzen sowie Cybersecurity-Abwehr.“ Es baut auf den Lehren aus den im Jahr 2026 verzögerten oder eingestellten Gemini-3.5-Pro-Initiativen und dem anschließenden Fokus auf die Gemini-3.8-Flash-Reihe auf.
Das Modell betont agentische Fähigkeiten – autonome Planung, Toolnutzung, Codegenerierung und -bearbeitung, Aufdeckung und Behebung von Schwachstellen, Analyse mehrerer Dokumente und Verständnis langer Videos – und integriert stärkere Sicherheitssysteme für Leistung auf Frontier-Niveau.
Intern liefert Argon bereits messbaren Impact im Google-Maßstab:
- Quantencomputing-Teams nutzten es zur Optimierung von Raumzeitressourcen (Qubits × Gates) und übertrafen veröffentlichte Baselines innerhalb von Minuten um 40%.
- Agenten-Teams analysierten Telemetrie über gesamte Flotten und wendeten autonom Speicheroptimierungen an; dadurch wurden über 300 TiB Speicher in Rechenzentren freigemacht (mit geschätzten Gesamteinsparungen von 500 TiB bis 1 PiB).
- Groß angelegte Code-Migrationen von C/C++ nach Rust sind im Gange, darunter Zehntausende Zeilen in Kernbibliotheken (re2, libgav1) und über 800.000 Zeilen im Fuchsia-Zircon-Kernel. Ein bemerkenswertes Ergebnis: ein speichersicherer Videodecoder (libgav1), der nach profilgesteuerter Optimierung 2.7× schneller läuft als der vorherige Rust-Port.
Diese realen Einsätze unterstreichen, dass Argon nicht nur ein Benchmark-Champion ist, sondern ein praktischer Produktivitätsmultiplikator für komplexe Engineering-Organisationen.
Zugänglichkeit von Gemini 4 Argon mit Stand 1. Oktober
Google verfolgt aufgrund der fortgeschrittenen Fähigkeiten einen bewusst gestaffelten Release. Derzeit rollt das Modell an einen Kreis vertrauenswürdiger Cyberverteidiger im Rahmen des Fairwind Program aus (über 650 Organisationen, darunter große Sicherheitsfirmen). Google nimmt außerdem am freiwilligen Vorabzugangsprozess der US-Regierung teil. Eine breitere Verfügbarkeit für Entwickler, Unternehmen und Verbraucher – beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten – wird „so schnell wie möglich“ nach weiterer Iteration der Schutzmaßnahmen auf Basis frühen Feedbacks erwartet.
Zentrale Funktionen von Gemini 4 Argon
1. Langfristiges Reasoning mit bis zu 1M Ausgabe-Token
Google gibt an, dass Argons maximale Ausgabe 1 Million Token beträgt, gegenüber 64.000 Token in der vorherigen Generation. Das ist ein maximales Generierungslimit, nicht die Aussage, dass jede Antwort riesig sein sollte. Es verschafft dem Modell Raum für lange Reasoning-Verläufe, mehrdateiige Codegenerierung, detaillierte Recherche oder ausgedehnte Agentenarbeit, ohne alle paar Schritte eine neue Anfrage zu erzwingen.
2. Praxisnahe Softwareentwicklung
Argons Score von 77.9% auf DeepSWE v1.1 ist der höchste Wert in Googles Vergleichstabelle. DeepSWE fokussiert langfristige Softwareentwicklungsarbeit, die besser zu autonomen Coding-Agenten passt als kurze Code-Completion-Tests. Das Modell erreicht außerdem 91.9% auf Vibe Code Bench.
Das Bild ist nicht einseitig. GPT-6 Astra erzielt 65.5% auf FrontierSWE v2 gegenüber Argons 55.0%, und Claude Opus 5.5 erreicht 66.4% auf Terminal-Bench 4.0 gegenüber Argons 57.4%. Käufer sollten daher Repository-Editing, Shell-Nutzung, Debugging und Migrationsarbeit separat testen, statt sich auf einen einzigen „Coding“-Score zu verlassen.
3. Unternehmensbezogene Wissensarbeit
Google meldet für Argon 68.9% auf dem Vals Index, der Finanzen, Coding, Recht und Steuern nach Beitrag zum US-BIP gewichtet. Es führt auch bei den verglichenen Modellen auf Vals Finance Agent v2, Harveys Legal-Agent-Benchmark und AutomationBench.
Diese Bewertungen machen Argon besonders relevant für forschungsintensive Arbeitsabläufe: Due Diligence, Vertragsprüfung, Finanzanalyse, Steuerrecherche und Quersynthese über Dokumente. Sie ersetzen nicht die Notwendigkeit der Quellverifikation oder der professionellen Prüfung. Ein Benchmark-Vorsprung misst die Leistung unter einem spezifischen Rahmen; er belegt nicht die Eignung für unbeaufsichtigte Rechts- oder Finanzentscheidungen.
4. Multimodales Verständnis und Long-Video-Verstehen
Argon erzielt 71.6% auf Chartography und 91.7% auf LVBench, liegt beim Diagrammverständnis knapp vor GPT-6 Astra und beim Verständnis langer Videos deutlicher vorne. Google beschreibt auch Workflows, in denen Argon eine Sequenz von Dokumenten interpretiert und auf Basis des Ergebnisses handelt.
Diese Kombination ist hilfreich, wenn Text allein nicht genügt: Analyse von Ertragsdiagrammen neben Einreichungen, Extraktion von Belegen aus Stunden an Video, Überprüfung von Produkt-Screenshots mit schriftlichen Anforderungen oder Abgleich von Daten über PDFs und visuelle Reports.
5. Defensive Cybersicherheit
Google trainierte Argon darauf, kritische Schwachstellen zu entdecken, zu validieren und zu patchen. Auf CWE-bench v1 erzielen Argon und GPT-6 Astra jeweils 68%, während Claude Opus 5.5 67% erreicht. Google sagt, dass Argon auch Gemini 3.8 Flash Cyber in internen Bewertungen zur Schwachstellenentdeckung und Black-Box-Penetrationstests übertrifft.
Der anfängliche Zugriff spiegelt das Risiko wider. Vertrauenswürdige Cyberverteidiger können das Modell über Googles Fairwind Program nutzen, und Google sagt, Wiz habe Argon in seiner Initiative Scan for Good eingesetzt, um eine kritische Schwachstelle zu identifizieren, die Gesundheitssoftware betrifft. Eine eingeschränkte Verteilung gibt Google Zeit, Evidenz zu sammeln, bevor fortgeschrittene Cyber-Fähigkeiten breiter zugänglich werden.
6. Die Halluzinationsrate sank auf 10%.
Gemini 4 Argon hat auf Artificial Analysis eine extrem niedrige Halluzinationsrate. 15%. Arena meldet eine Schätzung der Tool-Halluzination von 0.10% +/- 0.48% für Gemini 4 Argon High, verglichen mit 0.16% +/- 0.09% für Gemini 3.8 Flash High. Der Punktschätzer ist niedriger, was auf eine Verbesserung hindeutet. Die Unsicherheitsintervalle überlappen sich jedoch deutlich, und Argons Intervall ist wesentlich breiter.
Benchmark-Leistung von Gemini 4 Argon
Die folgenden Werte stammen aus Googles Vergleichstabelle. Google verlinkt ein separates Methodendokument und gibt an, dass die Scores pass@1 sind, sofern nicht anders vermerkt. Behandeln Sie dies als vom Anbieter veröffentlichte Ergebnisse und validieren Sie sie an privaten Workloads.
| Benchmark | Arbeitslast | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Spitzenreiter |
|---|---|---|---|---|---|
| Vals Index | Nach BIP gewichtete Wissensarbeit | 68.9% | 63.1% | 67.0% | Argon |
| AutomationBench | End-to-End-Geschäftsautomatisierung | 51.3% | 41.4% | 42.5% | Argon |
| Vals Finance Agent v2 | Mehrschrittige Finanzrecherche | 65.4% | 53.5% | 58.6% | Argon |
| Harvey Legal Agent | Juristische Recherche und Erstellung | 19.6% | 5.4% | 3.8% | Argon |
| DeepSWE v1.1 | Langfristige Softwareentwicklung | 77.9% | 74.1% | 74.2% | Argon |
| FrontierSWE v2 | Agentisches Codieren | 55.0% | 65.5% | 62.3% | Astra |
| Terminal-Bench 4.0 | Terminalbasierte Agentenarbeit | 57.4% | 58.2% | 66.4% | Opus |
| Terminal-Bench Science 0.1 | Wissenschafts- und Mathematikagenten | 57.6% | 68.1% | 63.3% | Astra |
| GraphWalks, 256K-1M | Graphdurchlauf mit langem Kontext, F1 | 84.2% | 71.8% | 66.8% | Argon |
| Agent's Last Exam | Computerbedienung | 39.5% | 34.2% | 38.2% | Argon |
| OSWorld 2.0 offline subset | Computerbedienung, Teilscore | 69.2% | 72.6% | Not reported | Astra |
| Chartography | Diagrammverständnis | 71.6% | 71.0% | 66.3% | Argon |
| LVBench | Verständnis langer Videos | 91.7% | 87.5% | 83.7% | Argon |
| CWE-bench v1 | Behebung von Schwachstellen | 68.0% | 68.0% | 67.0% | Gleichstand |
So lesen Sie die Ergebnisse
Argons klarster Vorteil ist die Breite über professionelle Wissensarbeit, langen Kontext, Diagrammanalyse und lange Videos. Das 19.6%-Ergebnis als Legal-Agent ist mehr als das Dreifache von Astras 5.4%, obwohl alle drei absoluten Werte zeigen, dass der Benchmark weiterhin schwierig ist. Argon führt zudem AutomationBench mit 8.8 Prozentpunkten Vorsprung vor Opus 5.5 an.
Beim Coding ist ein nuancierteres Fazit nötig. Argon führt DeepSWE und Vibe Code Bench an, aber Astra führt FrontierSWE, und Opus führt Terminal-Bench 4.0. Bei wissenschaftsorientierter Terminalarbeit liegt Astra um 10.5 Punkte vor Argon. Die richtige Überschrift lautet nicht „Argon gewinnt jeden Benchmark“. Sie lautet, dass Argon außergewöhnlich stark über langfristige Enterprise-Workflows ist, während Wettbewerber wichtige aufgabenspezifische Vorteile behalten.

Die Benchmarks liefern starke, aber nicht universelle Evidenz. GPT-6 Astra bleibt bei mehreren Messungen in Wissenschaft, Coding und Computerbedienung vorn, während Claude Opus 5.5 wichtige Terminal- und ML-Engineering-Tests anführt. Unabhängige Evidenz ist ähnlich nuanciert: Artificial Analysis platziert Argon auf Rang #8 von 223 Modellen in seiner Vergleichsklasse, und Arena führt Gemini 4 Argon High auf Rang #8 von 46 Agentenmodellen, bei gleichzeitiger Spitzenposition in der Steuerbarkeit. Argons größter Vorteil ist die Kombination aus Langhorizont-Reasoning, Leistung in Unternehmensdomänen und multimodaler Tiefe zu einem aggressiv angekündigten Preis.
Ist Gemini 4 Argon verfügbar?
Zum Zeitpunkt der Ankündigung (30. September 2026) und anschließender Berichte: nein – nicht für die Allgemeinheit oder Standardentwickler. Der Zugriff ist beschränkt auf:
- Vertrauenswürdige Mitglieder des Fairwind Program (Cyberverteidiger, Regierungen, Betreiber kritischer Infrastruktur).
- Interne Google-Teams.
- Teilnehmer am freiwilligen Vorabzugangsprozess der US-Regierung.
Google gibt an, nach Einholung von Feedback und Iteration der Schutzmaßnahmen „so schnell wie möglich“ zu expandieren – beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten, gefolgt von breiterem Zugang für Entwickler, Unternehmen und Verbraucher. Es wurde kein fester öffentlicher Termin genannt
Gemini 4 Argon API-Preise
Googles Einführungspreis beträgt $2 pro Million Eingabetoken und $10 pro Million Ausgabetoken. Der Preis nach der Einführungsphase liegt bei $4 für Eingaben und $20 für Ausgaben. Zwischengespeicherte Eingaben werden mit einem 95%-Rabatt gegenüber dem jeweiligen Eingabepreis ausgewiesen, was $0.10 pro Million in der Einführungsphase und $0.20 danach impliziert, wenn die Richtlinie exakt wie angekündigt angewendet wird.
Der Preis ist im Vergleich zu anderen Premium-Frontier-Modellen attraktiv, aber Kosten pro Token sind nicht gleich Kosten pro erledigter Aufgabe. Ein Modell, das Hunderttausende Ausgabetoken generiert oder viele Tool-Aufrufe durchführt, kann dennoch eine hohe Rechnung verursachen. Legen Sie Output-Limits fest, überwachen Sie Tool-Schleifen und messen Sie die Kosten pro akzeptiertem Ergebnis.
Zugriff auf die Gemini 4 Argon API über CometAPI
Sobald Google den breiteren API-Zugriff öffnet, werden Plattformen, die Frontier-Modelle aggregieren, zum schnellsten und oft kostengünstigsten Weg für Entwickler, zu experimentieren und in Produktion zu gehen.
CometAPI bietet einen einheitlichen, OpenAI-kompatiblen Endpunkt für 500+ Modelle von OpenAI, Anthropic, Google und anderen. Das bedeutet, dass Sie zwischen Gemini-Modellen, GPT-6-Varianten und Claude-Modellen wechseln können, indem Sie nur den model-Parameter ändern – ohne mehrere Konten, Abrechnungssysteme oder SDKs zu verwalten.
Empfohlene Schritte zur Vorbereitung und zum Zugriff über CometAPI:
- Registrieren Sie sich auf cometapi.com und generieren Sie einen API-Schlüssel im Dashboard (beginnt mit
sk-). - Verwenden Sie die Basis-URL
https://api.cometapi.com/v1. - Rufen Sie Modelle mit dem Standard-OpenAI-SDK oder im nativen Gemini-Format auf.
CometAPI unterstützt die Gemini-Familie (einschließlich früherer Pro- und Flash-Modelle) bereits mit wettbewerbsfähiger Preisgestaltung, kostenlosen Testguthaben und nahtlosem Wechsel. Prüfen Sie die CometAPI Models-Seite regelmäßig auf die Verfügbarkeit von Gemini 4 Argon. Dieser Ansatz vermeidet Reibung bei der Google-Cloud-Onboarding und ermöglicht einfaches A/B-Testing gegenüber Claude Opus 5.5 oder GPT-6 Astra im selben Codebestand.
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5
| Kategorie | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Anbieter | OpenAI | Anthropic | |
| Release-Status am 1. Okt. 2026 | Begrenzter Trusted-Tester-Rollout; breiterer Zugang folgt | Aktives API-Modell | Aktuelles Modell; veröffentlicht am 22. Sept. 2026 |
| Am besten geeignet | Langfristige Wissensarbeit, multimodale Analyse, defensive Cybersicherheit, große Ausgaben | Komplexes Reasoning, Wissenschaft, Computerbedienung, breites Tool-Ökosystem | Lang laufendes agentisches Codieren und Wissensarbeit |
| Eingabekontext | Noch nicht als endgültige öffentliche API-Spezifikation veröffentlicht | 1,050,000 tokens | 1,000,000 tokens |
| Max. Ausgabe | 1,000,000 tokens | 128,000 tokens | 128,000 synchron; 300,000 Batch beta |
| Eingaben und Ausgaben | Multimodale Fähigkeiten genannt; detaillierte öffentliche API-Matrix ausstehend | Text und Bild rein; Text raus | Text und Bilder rein; Text raus |
| Reasoning-Kontrolle | Langhorizont-Reasoning; öffentliche API-Kontrollen ausstehend | niedrig bis maximaler Reasoning-Aufwand | Adaptives Denken stets aktiv; Standardaufwand mittel |
| Standardpreis pro 1M Token | Intro: $2 Eingabe / $10 Ausgabe; später $4 / $20 | $10 Eingabe / $50 Ausgabe | $4 Eingabe / $20 Ausgabe |
| Hervorstechende Siege in Googles Tabelle | Vals, AutomationBench, DeepSWE, langer Kontext, LVBench | FrontierSWE, wissenschaftliche Terminalarbeit, OSWorld-Subset | Terminal-Bench 4.0, PostTrainBench |
| Haupteinschränkung | Breite API-Verfügbarkeit und vollständige Spezifikationen werden noch ausgerollt | Höchster Listenpreis der drei | Führt Googles Wissensarbeits-Tabelle nicht an; adaptives Denken kann nicht deaktiviert werden |
Welches Modell ist das beste?
Wählen Sie Gemini 4 Argon, wenn lange Kontext-Wissensarbeit, multimodale Evidenz, defensive Cybersicherheit oder ungewöhnlich große generierte Artefakte die Arbeitslast dominieren. Wählen Sie GPT-6 Astra, wenn Sie eine ausgereifte OpenAI-Toolfläche, starke Wissenschafts-Agentenleistung oder spezifische Stärken in der Computerbedienung benötigen. Wählen Sie Claude Opus 5.5 für Claude-native agentische Coding- und Terminal-Workflows, insbesondere wenn sein Verhalten in Ihrem Evaluationsrahmen bereits gut performt.
Für die meisten Unternehmen ist die bessere Strategie keine dauerhafte Ein-Modell-Entscheidung. Leiten Sie Routineanfragen an ein kostengünstigeres Modell, evaluieren Sie Argon, Astra und Opus am schwierigen Ende, und behalten Sie eine Fallback-Option. CometAPI ist hier hilfreich, da eine Integrationsschicht Cross-Modell-Tests und kontrolliertes Routing erleichtern kann.
Fazit
Gemini 4 Argon markiert Googles stärkstes Comeback an der absoluten Spitze, erobert die Führung bei mehreren unternehmenskritischen und langhorizontigen Benchmarks zurück und führt praktische Neuerungen wie 1M Ausgabetoken und aggressive Einführungspreise ein. Der gestaffelte, sicherheitsorientierte Rollout priorisiert den verantwortungsvollen Einsatz leistungsfähiger Cyber-Abwehrfunktionen.
