Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
new/CometAPI-forskning

Gemini 4 Argon: Benchmarktester, funksjoner, pris og API-tilgang

Utforsk Gemini 4 Argons benchmark-resultater, 1M-token-utdata, sikkerhet, pris, tilgjengelighet og sammenligning med GPT-6 Astra og Claude Opus 5.

CometAPI
AnnaForskerteam for AI-modeller og API
Oppdatert Oct 1, 2026 12 min lesetid
Gemini 4 Argon: Benchmarktester, funksjoner, pris og API-tilgang
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR: 30. september 2026 annonserte Google DeepMind Gemini 4 Argon, deres nye frontier-modell og starten på Gemini 4-serien. Den leverer banebrytende ytelse i langsiktig programvareingeniørarbeid (77,9 % på DeepSWE v1.1), kunnskapsarbeid for virksomheter (leder Vals Index med 68,9 %) og defensiv cybersikkerhet. Viktige oppgraderinger inkluderer en bransjeledende utdata-grense på 1 million tokens (opp fra 64K).

Hovedpunkter

  • Gemini 4 Argon er Googles mest kapable modell til nå, optimalisert for komplekse, flertrinns arbeidsflyter innen koding, juridisk/finansielt kunnskapsarbeid og cyberforsvar.
  • Argon er designet for vedvarende resonnering på lange, flertrinns arbeidsflyter fremfor vanlig kortform-chat. Google vektlegger reell programvareutvikling, juridisk og finansielt arbeid, multimodal forståelse og cybersikkerhetsforsvar.
  • Google utvidet maksimal utdata fra forrige 64K-token-nivå til 1 million tokens. Google har ennå ikke publisert en komplett offentlig Gemini API-spesifikasjon for Argons inngangskontekst, modaliteter, endepunktsatferd eller ratebegrensninger.
  • I Googles sammenligningstabell scorer Argon 68,9 % på Vals Index, 77,9 % på DeepSWE v1.1, 91,7 % på LVBench og 68 % på CWE-bench v1. Den leder ikke alle tester: GPT-6 Astra vinner FrontierSWE v2 og Terminal-Bench Science, mens Claude Opus 5.5 leder Terminal-Bench 4.0 og PostTrainBench.
  • Googles introduksjonspris er $2 per million input-tokens og $10 per million output-tokens. Etter introduksjonsperioden øker prisen til henholdsvis $4 og $20. Bufret input annonseres til 95 % under gjeldende input-token-pris.
  • CometAPIs offentlige katalog listet gemini-4-argon som tilgjengelig, ikke kommende, 1. oktober 2026.

Google har gjenvunnet en ledende posisjon i frontier-AI-kappløpet med lanseringen av Gemini 4 Argon. Annonsert 30. september 2026 markerer denne modellen begynnelsen på Gemini 4-æraen og er eksplisitt posisjonert som Googles “neste æra av frontier intelligence.” Den retter seg mot de vanskeligste virkelige arbeidslastene: vedvarende agentisk koding, kunnskapsarbeid med høy risiko i virksomheter (jus, finans, skatt) og defensiv cybersikkerhet.

I motsetning til tidligere inkrementelle oppdateringer introduserer Argon et fundamentalt skifte i kapasitetsdybde gjennom dramatisk utvidet utdata-lengde og spesialisert trening for langsiktige oppgaver. Tusenvis av Google-ansatte bruker den allerede internt til produksjonsingeniørarbeid, mens ekstern tilgang begynner smalt med verifiserte cybersikkerhetspartnere.

Hva er Gemini 4 Argon?

Gemini 4 Argon er Google DeepMinds nyeste frontier-stor språkmodell og den første utgaven i Gemini 4-familien. Den er designet spesifikt for å opprettholde dyp resonnering på komplekse, flertrinns, langsiktige arbeidsflyter som tidligere modeller slet med å fullføre pålitelig i én enkelt trajektorie.

Ifølge Google “leverer Argon frontier-ytelse i komplekse arbeidsflyter på reell programvareutvikling, kunnskapsarbeid i virksomheter som jus og finans, og cybersikkerhetsforsvar.” Den bygger på erfaringer fra de forsinkede eller kansellerte Gemini 3.5 Pro-innsatsene tidligere i 2026 og den påfølgende satsingen på Gemini 3.8 Flash-serien.

Modellen vektlegger agentiske kapabiliteter—autonom planlegging, verktøybruk, kodegenerering og -redigering, sårbarhetsoppdagelse og -utbedring, multidokumentanalyse og forståelse av lange videoer—samtidig som den inkorporerer sterkere sikkerhetssystemer for frontier-nivå kraft.

Internt leverer Argon allerede målbare effekter i Google-skala:

  • Kvantedatateam brukte den til å optimalisere romtid-ressurser (qubits × gates), og slo publiserte baselinjer med 40 % på minutter.
  • Agent-team analyserte telemetri i hele flåten og anvendte autonomt minneoptimaliseringer, noe som frigjorde over 300 TiB minne på tvers av datasentre (med estimert totalsparing på 500 TiB til 1 PiB).
  • Storskala kodemigreringer fra C/C++ til Rust er i gang, inkludert titusenvis av linjer i kjernebiblioteker (re2, libgav1) og over 800 000 linjer i Fuchsia Zircon-kjernen. Ett bemerkelsesverdig resultat: en minnesikker videodekoder (libgav1) som kjører 2,7× raskere enn den forrige Rust-porten etter profilstyrt optimalisering.

Disse reelle utrullingene understreker at Argon ikke bare er en benchmark-mester, men en praktisk produktivitetsmultiplikator for komplekse ingeniørorganisasjoner.

Tilgjengelighet for Gemini 4 Argon per 1. oktober

Google tar en bevisst fasevis tilnærming til lansering på grunn av modellens avanserte kapabiliteter. Den rulles for tiden ut til et sett av betrodde cyberforsvarere gjennom Fairwind Program (som har registrert over 650 organisasjoner, inkludert store sikkerhetsselskaper). Google deltar også i den amerikanske regjeringens frivillige prosess for forhåndstilgang til modeller. Bredere tilgjengelighet for utviklere, virksomheter og forbrukere—med start hos betalende API-kunder og Google AI Ultra-abonnenter—er forventet “så snart som mulig” etter ytterligere guardrail-iterasjon basert på tidlig tilbakemelding.

Nøkkelfunksjoner i Gemini 4 Argon

1. Langsiktig resonnering med opptil 1M utgangstokens

Google sier Argons maksimal utdata er 1 million tokens, opp fra 64 000 tokens i forrige generasjon. Det er en maksimal generasjonsgrense, ikke en påstand om at hvert svar bør være enormt. Det gir modellen rom for lange resonneringstrajektorier, flerfil-kodegenerering, detaljert forskning eller utvidet agentarbeid uten å tvinge frem en ny forespørsel hvert få steg.

Gemini 4 Argon: Benchmarktester, funksjoner, pris og API-tilgang

2. Programvareutvikling i praksis

Argons 77,9 % på DeepSWE v1.1 er den høyeste verdien i Googles sammenligningstabell. DeepSWE fokuserer på langsiktig programvareingeniørarbeid, som passer bedre til autonome kodeagenter enn korte kodefullførings-tester. Modellen oppnår også 91,9 % på Vibe Code Bench.

Bildet er ikke ensidig. GPT-6 Astra scorer 65,5 % på FrontierSWE v2 mot Argons 55,0 %, og Claude Opus 5.5 scorer 66,4 % på Terminal-Bench 4.0 mot Argons 57,4 %. Kjøpere bør derfor teste repo-redigering, skallbruk, debugging og migreringsarbeid separat i stedet for å stole på én “kode”-score.

Gemini 4 Argon: Benchmarktester, funksjoner, pris og API-tilgang

3. Kunnskapsarbeid i virksomheter

Google rapporterer Argon på 68,9 % på Vals Index, som vektlegger finans, koding, jus og skatt etter bidrag til USAs BNP. Den leder også de sammenlignede modellene på Vals Finance Agent v2, Harveys Legal Agent Benchmark og AutomationBench.

Disse evalueringene gjør Argon spesielt relevant for forskningsintensive arbeidsflyter: due diligence, kontraktsgjennomgang, finansiell analyse, skatteforskning og syntese på tvers av dokumenter. De fjerner ikke behovet for kildeverifisering eller profesjonell gjennomgang. En benchmark-ledelse måler ytelse under en spesifikk rigg; den etablerer ikke egnethet for uovervåkede juridiske eller finansielle beslutninger.

4. Multimodal og forståelse av lange videoer

Argon scorer 71,6 % på Chartography og 91,7 % på LVBench, og leder så vidt GPT-6 Astra på diagramforståelse og mer tydelig på forståelse av lange videoer. Google beskriver også arbeidsflyter der Argon tolker en sekvens av dokumenter og handler på resultatet.

Denne kombinasjonen er nyttig når tekst alene er utilstrekkelig: analysere resultatdiagrammer sammen med dokumenter, hente bevis fra timer med video, vurdere produkt-skjermbilder med skriftlige krav, eller forene data på tvers av PDF-er og visuelle rapporter.

5. Defensiv cybersikkerhet

Google trente Argon til å oppdage, validere og patche kritiske sårbarheter. På CWE-bench v1 scorer Argon og GPT-6 Astra begge 68 %, mens Claude Opus 5.5 scorer 67 %. Google sier Argon også overgår Gemini 3.8 Flash Cyber i interne evalueringer av sårbarhetsoppdagelse og black-box penetrasjonstesting.

Innledende tilgang reflekterer risikoen. Betrodde cyberforsvarere kan bruke modellen gjennom Googles Fairwind Program, og Google sier Wiz brukte Argon i sitt Scan for Good-initiativ til å identifisere en kritisk sårbarhet som påvirker helseprogramvare. Begrenset distribusjon gir Google tid til å samle bevis før bredere eksponering av avansert cyberkapabilitet.

6. Hallusinasjonsraten falt til 10 %.

Gemini 4 Argon har en ekstremt lav hallusinasjonsrate på Artificial Analysis. 15 %. Arena rapporterer et 0,10 % +/- 0,48 % verktøy-hallusinasjonsestimat for Gemini 4 Argon High, sammenlignet med 0,16 % +/- 0,09 % for Gemini 3.8 Flash High. Punktestimatet er lavere, noe som tyder på forbedring. Imidlertid overlapper usikkerhetsintervallene betydelig, og Argons intervall er mye bredere.

Gemini 4 Argon: Benchmarktester, funksjoner, pris og API-tilgang

Ytelse på Gemini 4 Argon-benchmarks

Følgende tall kommer fra Google DeepMinds sammenligningstabell. Google lenker et separat metodologidokument og oppgir at score er pass@1 med mindre annet er angitt. Behandle disse som leverandørpubliserte resultater og valider dem mot private arbeidslaster.

BenchmarkArbeidsoppgaveGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Leder
Vals IndexBNP-vektet kunnskapsarbeid68,9%63,1%67,0%Argon
AutomationBenchHelhetlig forretningsautomatisering51,3%41,4%42,5%Argon
Vals Finance Agent v2Flertrinns finansanalyse65,4%53,5%58,6%Argon
Harvey Legal AgentJuridisk research og utarbeidelse19,6%5,4%3,8%Argon
DeepSWE v1.1Langsiktig programvareingeniørarbeid77,9%74,1%74,2%Argon
FrontierSWE v2Agentbasert koding55,0%65,5%62,3%Astra
Terminal-Bench 4.0Terminalbasert agentarbeid57,4%58,2%66,4%Opus
Terminal-Bench Science 0.1Vitenskaps- og matematikk-agenter57,6%68,1%63,3%Astra
GraphWalks, 256K-1MLangkontekst grafløp, F184,2%71,8%66,8%Argon
Agent's Last ExamDatabruk39,5%34,2%38,2%Argon
OSWorld 2.0 offline subsetDatabruk, delscore69,2%72,6%Ikke rapportertAstra
ChartographyDiagramforståelse71,6%71,0%66,3%Argon
LVBenchForståelse av lange videoer91,7%87,5%83,7%Argon
CWE-bench v1Utbedring av sårbarheter68,0%68,0%67,0%Uavgjort

Slik leses resultatene

Argons klareste fordel er bredde på tvers av profesjonelt kunnskapsarbeid, lang kontekst, diagramanalyse og lange videoer. Dets 19,6 % på legal-agent er mer enn tre ganger Astras 5,4 %, selv om alle tre absolutte score viser at benchmarken fortsatt er vanskelig. Argon leder også AutomationBench med 8,8 prosentpoeng over Opus 5.5.

Koding krever en mer nyansert konklusjon. Argon leder DeepSWE og Vibe Code Bench, men Astra leder FrontierSWE, og Opus leder Terminal-Bench 4.0. For vitenskapsorientert terminalarbeid leder Astra Argon med 10,5 poeng. Den riktige overskriften er ikke “Argon vinner hver benchmark.” Det er at Argon er eksepsjonelt sterk på langsiktige arbeidsflyter i virksomheter, mens konkurrenter beholder viktige oppgavespesifikke fordeler.

Gemini 4 Argon: Benchmarktester, funksjoner, pris og API-tilgang

Benchmark-beviset er sterkt men ikke universelt. GPT-6 Astra ligger fortsatt foran på flere mål for vitenskap, koding og databruk, mens Claude Opus 5.5 leder viktige terminal- og ML-ingeniørtester. Uavhengig bevis er tilsvarende nyansert: Artificial Analysis rangerer Argon som nr. 8 av 223 modeller i sin sammenligningsklasse, og Arena rangerer Gemini 4 Argon High som nr. 8 av 46 agentmodeller samtidig som den plasseres først på styrbarhet. Argons største fordel er kombinasjonen av langsiktig resonnering, ytelse i virksomhetsdomener og multimodal dybde til en offensiv annonsert pris.

Er Gemini 4 Argon tilgjengelig?

Per annonseringen (30. september 2026) og påfølgende dekning, nei—ikke for allmennheten eller standardutviklere. Tilgang er begrenset til:

  • Betrodde medlemmer av Fairwind Program (cyberforsvarere, myndigheter, partnere for kritisk infrastruktur).
  • Interne Google-team.
  • Deltakere i den amerikanske regjeringens frivillige prosess for forhåndstilgang til modeller.

Google oppgir at det vil utvide “så snart som mulig” etter innhenting av tilbakemelding og iterasjon på guardrails, med start hos betalende API-kunder og Google AI Ultra-abonnenter, deretter bredere utvikler-, virksomhets- og forbrukertilgang. Ingen fast offentlig dato er gitt

Priser for Gemini 4 Argon API

Googles introduksjonspris er $2 per million input-tokens og $10 per million output-tokens. Etter introduksjonsperioden er satsen $4 for input og $20 for output. Bufret input er priset med 95 % rabatt mot gjeldende input-sats, hvilket impliserer $0,10 per million under introduksjonsperioden og $0,20 etterpå dersom policyen anvendes nøyaktig som annonsert.

Prisen er attraktiv relativt til andre premium frontier-modeller, men kostnad per token er ikke kostnad per fullført oppgave. En modell som genererer hundretusenvis av output-tokens eller utfører mange verktøykall kan fortsatt skape en stor regning. Sett utdatabegrensninger, overvåk verktøysløyfer, og mål kostnad per akseptert resultat.

Slik får du tilgang til Gemini 4 Argon API via CometAPI

Når Google åpner bredere API-tilgang, blir plattformer som samler frontier-modeller den raskeste og ofte mest kostnadseffektive måten for utviklere å eksperimentere og sette i produksjon.

CometAPI tilbyr et samlet, OpenAI-kompatibelt endepunkt til 500+ modeller fra OpenAI, Anthropic, Google og andre. Dette betyr at du kan bytte mellom Gemini-modeller, GPT-6-varianter og Claude-modeller ved kun å endre modellparameteren—uten å administrere flere kontoer, faktureringssystemer eller SDK-er.

Anbefalte trinn for å forberede og få tilgang via CometAPI:

  1. Registrer deg på cometapi.com og generer en API-nøkkel fra dashbordet (starter med sk-).
  2. Bruk base-URL-en https://api.cometapi.com/v1.
  3. Kall modeller med standard OpenAI-SDK eller native Gemini-format.

CometAPI støtter allerede Gemini-familien (inkludert tidligere Pro- og Flash-modeller) med konkurransedyktige priser, gratis prøve-kreditter og sømløs switching. Sjekk CometAPI Models-siden regelmessig for tilgjengelighet av Gemini 4 Argon. Denne tilnærmingen unngår friksjon ved onboarding til Google Cloud og muliggjør enkel A/B-testing mot Claude Opus 5.5 eller GPT-6 Astra i samme kodebase.

Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5

CategoryGemini 4 ArgonGPT-6 AstraClaude Opus 5.5
ProviderGoogleOpenAIAnthropic
Release status on Oct. 1, 2026Begrenset betrodd-tester utrulling; bredere tilgang kommerAktiv API-modellAktiv nyeste modell; utgitt 22. september 2026
Best fitLangkontekst kunnskapsarbeid, multimodal analyse, defensiv cyber, store utdataKompleks resonnering, vitenskap, databruk, bredt verktøyøkosystemLangvarig agentisk koding og kunnskapsarbeid
Input contextIkke publisert som endelig offentlig API-spesifikasjon1 050 000 tokens1 000 000 tokens
Max output1 000 000 tokens128 000 tokens128 000 synkron; 300 000 Batch beta
Inputs and outputsMultimodale kapabiliteter oppgitt; detaljert offentlig API-matrise avventesTekst og bilde inn; tekst utTekst og bilder inn; tekst ut
Reasoning controlLangsiktig resonnering; offentlige API-kontroller avventeslav til maks resonneringsinnsatsAdaptiv tenkning alltid på; standard innsats middels
Standard price per 1M tokensIntro: $2 input / $10 output; senere $4 / $20$10 input / $50 output$4 input / $20 output
Standout wins in Google's tableVals, AutomationBench, DeepSWE, lang kontekst, LVBenchFrontierSWE, vitenskaps-terminalarbeid, OSWorld-subsettTerminal-Bench 4.0, PostTrainBench
Main caveatBred API-tilgjengelighet og fullstendige spesifikasjoner rulles fortsatt utHøyeste listepris av de treLeder ikke Googles kunnskapsarbeids-tabell; adaptiv tenkning kan ikke deaktiveres

Hvilken modell er best?

Velg Gemini 4 Argon når langkontekst kunnskapsarbeid, multimodale bevis, defensiv cybersikkerhet eller uvanlig store genererte artefakter dominerer arbeidslasten. Velg GPT-6 Astra når du trenger en moden OpenAI-verktøyflate, sterk ytelse for vitenskaps-agenter, eller dens spesifikke styrker i databruk. Velg Claude Opus 5.5 for Claude-native agentisk koding og terminal-arbeidsflyter, spesielt når atferden allerede presterer godt i din evalueringsrigg.

For de fleste virksomheter er den bedre strategien ikke en permanent enkeltmodell-beslutning. Ruter rutineforespørsler til en rimeligere modell, evaluer Argon, Astra og Opus på den vanskelige halen, og bevar en fallback. CometAPI er nyttig her fordi ett integrasjonslag kan gjøre kryssmodell-testing og kontrollert ruting enklere.

Konklusjon

Gemini 4 Argon markerer Googles sterkeste retur til den absolutte frontier, gjenvinner lederskap på flere virksomhetskritiske og langsiktige benchmarks, samtidig som den introduserer praktiske forbedringer som 1M output-tokens og aggressiv introduksjonsprising. Dens fasevise, sikkerhetsførste utrulling prioriterer ansvarlig distribusjon av kraftige cyberforsvarskapabiliteter.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Oct 1, 2026
Sist oppdatert Oct 1, 2026
2,950 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Les mer