TLDR: Op 30 september 2026 kondigde Google DeepMind Gemini 4 Argon aan, het nieuwe frontier-model en de start van de Gemini 4-serie. Het levert state-of-the-art prestaties in langetermijn software-engineering (77,9% op DeepSWE v1.1), enterprise-kenniswerk (leidend in de Vals Index met 68,9%) en defensieve cyberbeveiliging. Belangrijke upgrades omvatten een toonaangevende outputlimiet van 1 miljoen tokens (vanuit 64K).
Key Takeaways
- Gemini 4 Argon is Google’s meest capabele model tot nu toe, geoptimaliseerd voor complexe, meerstaps-workflows in codering, juridisch/financieel kenniswerk en cyberdefensie.
- Argon is ontworpen voor volgehouden redeneren over lange, meerstaps-workflows in plaats van gewone korte chat. Google benadrukt echte software-engineering, juridisch en financieel werk, multimodale interpretatie en cyberbeveiligingsverdediging.
- Google vergrootte de maximale output van het eerdere 64K-token-niveau naar 1 miljoen tokens. Google heeft nog geen complete publieke Gemini API-specificatie gepubliceerd voor Argons invoercontext, modaliteiten, endpointgedrag of snelheidslimieten.
- In Google’s vergelijkingstabel scoort Argon 68,9% op de Vals Index, 77,9% op DeepSWE v1.1, 91,7% op LVBench en 68% op CWE-bench v1. Het leidt niet elke test: GPT-6 Astra wint FrontierSWE v2 en Terminal-Bench Science, terwijl Claude Opus 5.5 leidt op Terminal-Bench 4.0 en PostTrainBench.
- Google’s introductieprijs is $2 per miljoen inputtokens en $10 per miljoen outputtokens. Na de introductieperiode stijgt de prijs naar respectievelijk $4 en $20. Gecachete invoer wordt geadverteerd met 95% korting ten opzichte van de toepasselijke inputtokenprijs.
- CometAPI’s openbare catalogus vermeldde
gemini-4-argonals beschikbaar, in plaats van “binnenkort”, op 1 oktober 2026.
Google heeft met de lancering van Gemini 4 Argon de koppositie in de frontier AI-race heroverd. Aangekondigd op 30 september 2026, markeert dit model het begin van het Gemini 4-tijdperk en wordt het expliciet gepositioneerd als Google’s “volgende era van frontier intelligence.” Het richt zich op de moeilijkste real-world workloads: langdurige agentmatige codering, hoog-stakes enterprise-kenniswerk (juridisch, finance, belasting) en defensieve cyberbeveiliging.
In tegenstelling tot eerdere incrementele updates introduceert Argon een fundamentele sprong in diepte van capaciteiten door een drastisch uitgebreide outputlengte en gespecialiseerde training voor langetermijn taken. Duizenden Google-medewerkers gebruiken het al intern voor productie-engineeringwerk, terwijl externe toegang aanvankelijk beperkt is tot geverifieerde cybersecurity-partners.
What Is Gemini 4 Argon?
Gemini 4 Argon is Google DeepMind’s nieuwste frontier large language model en de eerste release in de Gemini 4-familie. Het is specifiek ontworpen om diepe redenering vol te houden over complexe, meerstaps, langetermijn-workflows die eerdere modellen niet betrouwbaar in één traject konden voltooien.
Volgens Google “levert Argon frontier-prestaties in complexe workflows over echte software-engineering, enterprise-kenniswerk zoals juridisch en finance, en cybersecurity-verdediging.” Het bouwt voort op lessen uit de vertraagde of geannuleerde Gemini 3.5 Pro-inspanningen eerder in 2026 en de daaropvolgende focus op de Gemini 3.8 Flash-serie.
Het model legt de nadruk op agentische capaciteiten—autonome planning, toolgebruik, codegeneratie en -bewerking, het ontdekken en verhelpen van kwetsbaarheden, multi-documentanalyse en begrip van lange video’s—terwijl het sterkere veiligheidssystemen integreert voor vermogen op frontier-niveau.
Intern levert Argon al meetbare impact op Google-schaal:
- Teams voor kwantumcomputing gebruikten het om ruimtetijdbronnen (qubits × gates) te optimaliseren en versloegen gepubliceerde baselines met 40% binnen minuten.
- Agentteams analyseerden telemetrie over de hele vloot en pasten autonoom geheugenoptimalisaties toe, waardoor meer dan 300 TiB aan geheugen werd vrijgemaakt in datacenters (met een geschatte totale besparing van 500 TiB tot 1 PiB).
- Grootschalige codemigraties van C/C++ naar Rust zijn aan de gang, inclusief tienduizenden regels in kernbibliotheken (re2, libgav1) en meer dan 800.000 regels in de Fuchsia Zircon-kernel. Een opmerkelijk resultaat: een geheugenveilige videodecoder (libgav1) die 2,7× sneller draait dan de eerdere Rust-port na profielgestuurde optimalisatie.
Deze real-world implementaties onderstrepen dat Argon niet alleen een benchmarkkampioen is, maar ook een praktische productiviteitsvermenigvuldiger voor complexe engineeringorganisaties.
Gemini 4 Argon Accessibility as of October 1st
Google hanteert een bewust gefaseerde release vanwege de geavanceerde capaciteiten van het model. Het wordt momenteel uitgerold naar een set vertrouwde cyberverdedigers via het Fairwind Program (waar meer dan 650 organisaties aan deelnemen, inclusief grote beveiligingsbedrijven). Google neemt ook deel aan het vrijwillige pre-releaseproces van de Amerikaanse regering. Brede beschikbaarheid voor ontwikkelaars, enterprises en consumenten—beginnend met betalende API-klanten en Google AI Ultra-abonnees—wordt “zo snel mogelijk” verwacht na verdere iteraties van waarborgen op basis van vroege feedback.
Gemini 4 Argon Key Features
1. Long-Horizon Reasoning With Up to 1M Output Tokens
Volgens Google is Argons maximale output 1 miljoen tokens, tegen 64.000 tokens in de vorige generatie. Dat is een maximale generatielimiet, geen uitspraak dat elke respons enorm moet zijn. Het geeft het model ruimte voor lange redeneertrajecten, multi-bestands codegeneratie, gedetailleerd onderzoek of uitgebreide agentwerkzaamheden zonder elke paar stappen een nieuw verzoek te moeten doen.
2. Real-World Software Engineering
Argons score van 77,9% op DeepSWE v1.1 is de hoogste waarde in Google’s vergelijkingstabel. DeepSWE richt zich op langetermijn software-engineering, wat beter aansluit bij autonome coderingsagents dan korte code-completiontests. Het model behaalt ook 91,9% op Vibe Code Bench.
Het beeld is niet eenduidig. GPT-6 Astra scoort 65,5% op FrontierSWE v2 tegenover Argons 55,0%, en Claude Opus 5.5 scoort 66,4% op Terminal-Bench 4.0 tegenover Argons 57,4%. Kopers moeten daarom repository-bewerking, shellgebruik, debuggen en migratiewerk afzonderlijk testen in plaats van te vertrouwen op één “coding”-score.
3. Enterprise Knowledge Work
Google rapporteert Argon op 68,9% op de Vals Index, die finance, codering, juridisch en belastingwerk weegt naar bijdrage aan het bbp van de VS. Het leidt ook de vergeleken modellen op Vals Finance Agent v2, Harvey’s Legal Agent Benchmark en AutomationBench.
Deze evaluaties maken Argon bijzonder relevant voor onderzoek-intensieve workflows: due diligence, contractreview, financiële analyse, belastingonderzoek en cross-document synthese. Ze nemen niet de noodzaak weg van bronverificatie of professionele review. Een benchmarklead meet prestaties onder een specifiek harnas; het bewijst geen geschiktheid voor onbewaakte juridische of financiële beslissingen.
4. Multimodal and Long-Video Understanding
Argon scoort 71,6% op Chartography en 91,7% op LVBench, nipt voor op GPT-6 Astra in grafiekbegrip en duidelijker leidend in begrip van lange video’s. Google beschrijft ook workflows waarin Argon een reeks documenten interpreteert en op basis van het resultaat handelt.
Deze combinatie is handig wanneer tekst alleen onvoldoende is: het analyseren van winstgrafieken naast filings, het extraheren van bewijs uit uren video, het beoordelen van productscreenshots met geschreven requirements of het reconciliëren van data over pdf’s en visuele rapporten.
5. Defensive Cybersecurity
Google trainde Argon om kritieke kwetsbaarheden te ontdekken, valideren en patchen. Op CWE-bench v1 scoren Argon en GPT-6 Astra beide 68%, terwijl Claude Opus 5.5 67% scoort. Volgens Google overtreft Argon ook Gemini 3.8 Flash Cyber in interne evaluaties voor kwetsbaarheidsdetectie en blackbox-penetratietesten.
De initiële toegang weerspiegelt het risico. Vertrouwde cyberverdedigers kunnen het model gebruiken via Google’s Fairwind Program, en Google zegt dat Wiz Argon gebruikte in zijn Scan for Good-initiatief om een kritieke kwetsbaarheid te identificeren die software in de gezondheidszorg treft. Beperkte distributie geeft Google tijd om bewijs te verzamelen voordat geavanceerde cybercapabiliteit breder wordt blootgesteld.
6. The hallucination rate dropped to 10%.
Gemini 4 Argon heeft een waanzinnig lage hallucinatiegraad op Artificial Analysis. 15%. Arena rapporteert een 0,10% +/- 0,48% tool-hallucinatieschatting voor Gemini 4 Argon High, vergeleken met 0,16% +/- 0,09% voor Gemini 3.8 Flash High. De puntschatting is lager, wat op verbetering duidt. De onzekerheidsintervallen overlappen echter substantieel, en Argons interval is veel breder.
Gemini 4 Argon Benchmark Performance
De volgende cijfers komen uit Google DeepMind’s vergelijkingstabel. Google verwijst naar een apart methodologiedocument en stelt dat scores pass@1 zijn, tenzij vermeld. Behandel dit als door de leverancier gepubliceerde resultaten en valideer ze tegen private workloads.
| Benchmark | Werkbelasting | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Koploper |
|---|---|---|---|---|---|
| Vals Index | BBP-gewogen kenniswerk | 68,9% | 63,1% | 67,0% | Argon |
| AutomationBench | End-to-end bedrijfsautomatisering | 51,3% | 41,4% | 42,5% | Argon |
| Vals Finance Agent v2 | Meertraps financieel onderzoek | 65,4% | 53,5% | 58,6% | Argon |
| Harvey Legal Agent | Juridisch onderzoek en drafting | 19,6% | 5,4% | 3,8% | Argon |
| DeepSWE v1.1 | Langetermijn software-engineering | 77,9% | 74,1% | 74,2% | Argon |
| FrontierSWE v2 | Agentmatige codering | 55,0% | 65,5% | 62,3% | Astra |
| Terminal-Bench 4.0 | Terminal-gebaseerd agentwerk | 57,4% | 58,2% | 66,4% | Opus |
| Terminal-Bench Science 0.1 | Science- en wiskunde-agents | 57,6% | 68,1% | 63,3% | Astra |
| GraphWalks, 256K-1M | Lange-context graaftraversal, F1 | 84,2% | 71,8% | 66,8% | Argon |
| Agent's Last Exam | Computergebruik | 39,5% | 34,2% | 38,2% | Argon |
| OSWorld 2.0 offline subset | Computergebruik, gedeeltelijke score | 69,2% | 72,6% | Not reported | Astra |
| Chartography | Grafiekbegrip | 71,6% | 71,0% | 66,3% | Argon |
| LVBench | Begrip van lange video’s | 91,7% | 87,5% | 83,7% | Argon |
| CWE-bench v1 | Verhelpen van kwetsbaarheden | 68,0% | 68,0% | 67,0% | Gelijk |
How to Read the Results
Argons duidelijkste voordeel is breedte over professioneel kenniswerk, lange context, grafiekanalyse en lange video. De 19,6% legal-agentresultaat is meer dan driemaal Astra’s 5,4%, hoewel alle drie de absolute scores laten zien dat de benchmark moeilijk blijft. Argon leidt AutomationBench met 8,8 procentpunt boven Opus 5.5.
Codering vereist een genuanceerdere conclusie. Argon leidt DeepSWE en Vibe Code Bench, maar Astra leidt FrontierSWE en Opus leidt Terminal-Bench 4.0. Voor wetenschap-georiënteerd terminalwerk leidt Astra Argon met 10,5 punten. De juiste headline is niet “Argon wint elke benchmark.” Het is dat Argon uitzonderlijk sterk is in langetermijn enterprise-workflows, terwijl concurrenten belangrijke taak-specifieke voordelen behouden.

Het benchmarkbewijs is sterk maar niet universeel. GPT-6 Astra blijft voor op verschillende maatstaven voor wetenschap, codering en computergebruik, terwijl Claude Opus 5.5 belangrijke terminal- en ML-engineeringtests leidt. Onafhankelijk bewijs is evenzeer genuanceerd: Artificial Analysis plaatst Argon op #8 van 223 modellen in zijn klasse, en Arena plaatst Gemini 4 Argon High op #8 van 46 agentmodellen, terwijl het op de eerste plaats staat voor stuurbaarheid. Argons grootste voordeel is de combinatie van langetermijnredeneren, prestaties in enterprise-domeinen en multimodale diepte tegen een agressieve aangekondigde prijs.
Is Gemini 4 Argon Available?
Vanaf de aankondiging (30 september 2026) en daaropvolgende berichtgeving: nee—niet voor het grote publiek of standaardontwikkelaars. Toegang is beperkt tot:
- Vertrouwde leden van het Fairwind Program (cyberverdedigers, overheden, partners in kritieke infrastructuur).
- Interne Google-teams.
- Deelnemers aan het vrijwillige pre-releaseproces van de Amerikaanse regering.
Google stelt dat het “zo snel mogelijk” zal uitbreiden na het verzamelen van feedback en itereren op waarborgen, beginnend met betalende API-klanten en Google AI Ultra-abonnees, en daarna bredere toegang voor ontwikkelaars, enterprises en consumenten. Er is geen vaste publieke datum gegeven
Gemini 4 Argon API Pricing
Google’s introductieprijs is $2 per miljoen inputtokens en $10 per miljoen outputtokens. Het tarief na de introductieperiode is $4 voor input en $20 voor output. Gecachete invoer is geprijsd met 95% korting ten opzichte van het toepasselijke inputtarief, wat impliceert $0,10 per miljoen tijdens de introductieperiode en $0,20 daarna als het beleid exact wordt toegepast zoals aangekondigd.
De prijs is aantrekkelijk ten opzichte van andere premium frontier-modellen, maar kosten per token zijn geen kosten per voltooide taak. Een model dat honderdduizenden outputtokens genereert of veel tool-calls uitvoert, kan nog steeds een grote rekening opleveren. Stel uitvoerlimieten in, monitor tool-loops en meet kosten per geaccepteerd resultaat.
How to Access Gemini 4 Argon API Through CometAPI
Zodra Google bredere API-toegang opent, worden platforms die frontier-modellen aggregeren de snelste en vaak meest kosteneffectieve manier voor ontwikkelaars om te experimenteren en te operationaliseren.
CometAPI biedt een uniforme, OpenAI-compatibele endpoint voor 500+ modellen van OpenAI, Anthropic, Google en anderen. Dit betekent dat je tussen Gemini-modellen, GPT-6-varianten en Claude-modellen kunt schakelen door alleen de modelparameter te wijzigen—zonder meerdere accounts, facturatiesystemen of SDK’s te beheren.
Aanbevolen stappen om je voor te bereiden en toegang te krijgen via CometAPI:
- Meld je aan op cometapi.com en genereer een API-sleutel vanuit het dashboard (begint met
sk-). - Gebruik de basis-URL
https://api.cometapi.com/v1. - Roep modellen aan met de standaard OpenAI SDK of in native Gemini-formaat.
CometAPI ondersteunt al de Gemini-familie (inclusief eerdere Pro- en Flash-modellen) met concurrerende prijzen, gratis proefcredits en naadloos schakelen. Controleer regelmatig de CometAPI Models-pagina voor beschikbaarheid van Gemini 4 Argon. Deze aanpak voorkomt onboardingfrictie bij Google Cloud en maakt eenvoudige A/B-tests mogelijk tegen Claude Opus 5.5 of GPT-6 Astra in dezelfde codebase.
Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5
| Categorie | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| Aanbieder | OpenAI | Anthropic | |
| Release-status op 1 okt. 2026 | Beperkte trusted-tester uitrol; bredere toegang komt | Actief API-model | Actueel nieuwste model; uitgebracht 22 sep. 2026 |
| Best geschikt voor | Langetermijn kenniswerk, multimodale analyse, defensieve cyber, grote outputs | Complexe redenering, wetenschap, computergebruik, breed toolecosysteem | Langdurige agentmatige codering en kenniswerk |
| Invoercontext | Nog niet gepubliceerd als definitieve publieke API-specificatie | 1,050,000 tokens | 1,000,000 tokens |
| Max output | 1,000,000 tokens | 128,000 tokens | 128,000 synchroon; 300,000 Batch beta |
| Invoer en uitvoer | Multimodale capaciteiten vermeld; gedetailleerde publieke API-matrix in voorbereiding | Tekst en afbeelding in; tekst uit | Tekst en afbeeldingen in; tekst uit |
| Besturing van redeneren | Langetermijnredeneren; publieke API-controls in voorbereiding | lage tot maximale redeneerinspanning | Adaptief denken altijd aan; standaard inspanning medium |
| Standaardprijs per 1M tokens | Intro: $2 input / $10 output; later $4 / $20 | $10 input / $50 output | $4 input / $20 output |
| Opvallende resultaten in Google’s tabel | Vals, AutomationBench, DeepSWE, lange context, LVBench | FrontierSWE, wetenschapsterminalwerk, OSWorld-subset | Terminal-Bench 4.0, PostTrainBench |
| Belangrijkste kanttekening | Brede API-beschikbaarheid en volledige specificaties rollen nog uit | Hoogste lijstprijs van de drie | Leidt Google’s kenniswerk-tabel niet; adaptief denken kan niet worden uitgeschakeld |
Which Model Is Best?
Kies Gemini 4 Argon wanneer lang-context kenniswerk, multimodale evidence, defensieve cyberbeveiliging of ongewoon grote gegenereerde artefacten de workload domineren. Kies GPT-6 Astra wanneer je een volwassen OpenAI-toolomgeving nodig hebt, sterke prestaties voor wetenschap-agents of zijn specifieke sterktes in computergebruik. Kies Claude Opus 5.5 voor Claude-native agentmatige codering en terminalworkflows, vooral wanneer zijn gedrag al goed presteert in je evaluatiekader.
Voor de meeste bedrijven is de betere strategie niet een permanente single-modelbeslissing. Routeer routineverzoeken naar een goedkoper model, evalueer Argon, Astra en Opus op de moeilijke staart, en houd een fallback aan. CometAPI is hierbij nuttig omdat één integratielaag cross-model testen en gecontroleerde routing makkelijker kan maken.
Conclusion
Gemini 4 Argon markeert Google’s sterkste herintrede in het absolute frontier, herwint leiderschap op verschillende enterprise-kritische en langetermijnbenchmarks en introduceert praktische verbeteringen zoals 1M outputtokens en agressieve introductieprijzen. De gefaseerde, security-first uitrol geeft prioriteit aan verantwoorde inzet van krachtige cyberverdedigingscapaciteiten.
