GPT-6 Sol, GPT-6 Luna, and Claude Opus 5.5 are now live on CometAPI →
ai-model/CometAPI-forskning

GPT-6 Astra-benchmarks: Hva tallene faktisk sier

Analyser benchmarkresultater for GPT-6 Astra på tvers av koding, bruk av datamaskin, lang kontekst, ARC-AGI-3, cybersikkerhet, effektivitet og produksjonskostnad.

CometAPI
Mia MarenForskerteam for AI-modeller og API
Oppdatert Sep 14, 2026 17 min lesetid
GPT-6 Astra-benchmarks: Hva tallene faktisk sier
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Sammendrag

GPT-6 Astra leverer eksepsjonelt sterke toppscore. De største gevinstene kommer når resonnering må omsettes til handling: terminalarbeid, programvarebruk, automatisering, langkontekst-gjenfinning, vitenskapelige arbeidsflyter og cybersikkerhet. På allerede mettet akademisk testing er forbedringen over forrige OpenAI-generasjon ofte langt mindre.

Modellen kombinerer et 1,050,000-token kontekstvindu med omfattende verktøystøtte. OpenAIs publiserte utførelsesbenchmarker antyder at den praktiske oppgraderingen er sterkest i langsiktig arbeid, men utforming av rammeverk, resonnementinnsats, ventetid og verktøytilgang påvirker resultatet vesentlig.

Viktige punkter

  • Astras tydeligste gevinster ligger i agentisk utførelse, ikke i alle former for spørsmål–svar.
  • Terminal-Bench, AutomationBench, computer-use og database-migrering viser langt større bevegelse enn GPQA eller DeepSWE.
  • ARC-AGI-3 viser at modelltilstand, konteksthåndtering og evalueringsrammeverk kan dominere sluttresultatet.
  • Et stort kontekstvindu betyr lite uten gjenfinning nær grensen; MRCR er mer informativt enn kun den annonserte kapasiteten.
  • Høyere tokenpriser betyr ikke automatisk høyere oppgavekost hvis modellen trenger færre tokens, færre omganger, færre retrier eller færre menneskelige rettinger.
  • Produksjonsbeslutninger bør sammenligne suksessrate, forløpt tid, totalkostnad, verktøyets pålitelighet og korrekturbørde samlet.

GPT-6 Astra i korte trekk

OpenAI spesifiserer opptil 128,000 utgående tokens, tekst- og bildeinngang, tekstutgang og resonnementinnsats fra lav til maks. Disse spesifikasjonene muliggjør store, flertrinns arbeidsflyter, men beviser ikke at en modell vil hente riktig evidens eller fullføre en oppgave pålitelig.

Offisiell spesifikasjonGPT-6 Astra i CometAPIPraktisk betydning
Modell-IDgpt-6-astraStabil identifikator for API-ruting
Kontekstvindu1,050,000 tokensStøtter store repositorier, arkiver og agenthistorikk
Maksimum utgang128,000 tokensTillater store rapporter, patcher og strukturerte artefakter
KunnskapsgrenseApril 30, 2026Senere fakta krever verktøy eller tilførte kilder
InndataTekst og bilderStøtter dokumenter, skjermbilder, diagrammer og blandet evidens
UtdataTekstProduserer prosa, kode og strukturert tekst
Resonneringsinnsatslow, medium, high, xhigh, maxBytter latenstid og kostnad mot dypere søk
AgentkapabiliteterFunction calling, structured outputs, computer use, web/file search, hosted shell, Apply Patch, MCPMuliggjør ende-til-ende arbeidsflyter fremfor isolerte svar
OpenAI Standard inndata$10 per million tokensInndatastørrelse og cache-gjenbruk påvirker totalkost
OpenAI bufret inndata$1 per million tokensGjelder når prompt-prefiks gjenbrukes fra cache
OpenAI cache-skrivinger$12.50 per million tokensPrises til 1.25× av ukachet inndata-rate
OpenAI Standard utdata$50 per million tokensOrdrike utdata kan dominere oppgavekost
Forespørsler over 272K inntokenerInndata- og cacherater ×2; utdata-rate ×1.5De høyere ratene gjelder hele forespørselen

En kontekstgrense måler kapasitet, ikke brukbar gjenkalling. En verktøyliste måler tilgjengelighet, ikke vellykket utførelse. Benchmarker trengs for å teste om spesifikasjonene oversettes til fullført arbeid.

Hva viser GPT-6 Astras benchmarkresultater?

Porteføljen viser et ujevnt mønster. Astra beveger seg knapt forbi Sol på noen akademiske og programvare-resonneringsprøver, men leverer tosifrede gevinster på terminalarbeid, automatisering, database-migrering, visuell interaksjon, langkontekst-gjenfinning og avansert matematikk.

Publisert benchmarkGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Astra vs. Sol
Terminal-Bench 4.057.9%37.3%55.8%+20.6 pp
DeepSWE v1.174.1%72.7%67.4%+1.4 pp
Database Migration Tasks63.9%42.7%57.8%+21.2 pp
OSWorld 2.072.6%65.7%—+6.9 pp
ScreenSpot-Pro92.7%76.9%—+15.8 pp
AutomationBench41.4%18.1%31.4%+23.3 pp
BenchCAD95.9%83.3%84.3%+12.6 pp
FrontierMath Tier 4 v297.6%83.0%87.8%+14.6 pp
GPQA Diamond96.0%94.6%93.7%+1.4 pp
MRCR v2, 512K–1M96.3%73.8%—+22.5 pp
AA Intelligence Index v4.1.161.260.965.7+0.3
ARC-AGI-3, Provider Adapter99.9%7.8%—+92.1 pp

Tre klynger trer frem. For det første indikerer 1,4-poengsgapene på DeepSWE og GPQA begrenset inkrementell bevegelse på oppgaver der sterke modeller allerede gjør det bra. For det andre viser gevinster over 20 poeng på Terminal-Bench, AutomationBench, database-migrering og million-token gjenfinning en langt større endring i utførelse. For det tredje er ARC-AGI-3 et avvik hvis tolkning avhenger av rammeverket.

Uavhengig testresultat

Artificial Analysis rapporterer Astra og Sol på omtrent 61 på Intelligence Index, samtidig som den viser en langt klarere gevinst på sin Coding Agent Index. Dette forsterker uavhengig mønsteret i OpenAIs data: den største forbedringen er konsentrert i agentisk utførelse.

Med maks innsats i Codex-harness skal Astra visstnok bruke omtrent en tredjedel så mange tokens som Sol på Coding Agent Index. Tokenbruk på Intelligence Index faller bare med ca. 10%. Fordi Astras per-token-rate er høyere, skaper disse to effektivitetsprofilene ulik økonomi.

Uavhengig evalueringObservert resultatProduksjonsfortolkning
Intelligence IndexLite skille fra SolBred resonnering rettferdiggjør kanskje ikke stor prispremie
Coding Agent IndexKlar agentisk forbedringFærre tokens kan oppveie høyere tokenrate
AA-OmniscienceHallusinasjonsrate faller fra 92% til 51% ved maksBedre avståelse kan bety mye for forsknings- og gjenfinningssystemer
Langsiktig kunnskapsarbeidBlandede fremskritt på tvers av oppgaverLokal evaluering er fortsatt nødvendig

Ingen uavhengig benchmark sertifiserer produksjonsfaktisitet eller sikkerhet. Team bør separat score riktige svar, berettiget usikkerhet, uunderbygde påstander og brudd på kildekontroll.

Hvorfor er Astra bedre egnet for langsiktig agentisk arbeid?

GPT-6 Astra legger til tre kontroller designet for arbeid som endrer seg mens det kjører. Langvarig pålitelighet avhenger også av hele kontektsystemet: kontekstvinduet setter kapasiteten; komprimering styrer hvordan eldre materiale kondenseres; vedvarende resonnement bærer relevant modelltilstand videre; gjenfinning holder tidligere evidens søkbar; og applikasjonen må bevare viktige verktøyutdata, testresultater, mislykkede tilnærminger og brukerkrav. Disse mekanismene bør testes sammen med agentrammeverket.

  • Asynkron verktøykalling: Astra kan fortsette uavhengig resonnement eller kalle andre verktøy mens en applikasjon kjører et langvarig verktøy.
  • Styring midt i turen: en applikasjon kan sende en korreksjon eller nytt krav over WebSocket uten å forkaste fullført arbeid.
  • Justering av resonnement midt i samtalen: en konfigurasjonsoppdatering kan heve eller senke resonnneringsinnsatsen mens cachet prompt-prefiks bevares.

Hvor GPT-6 Astra faktisk forbedres

Agentisk koding: Terminalarbeid er den større oppgraderingen

Terminal-Bench 4.0 evaluerer om en agent kan arbeide gjennom vanskelige terminaloppgaver snarere enn bare generere et isolert kode-svar. Astra når 57.9%, 20.6 prosentpoeng over Sol og 2.1 poeng over Fable. Det er en betydelig generasjonsforbedring for OpenAI, men en langt smalere fordel over et annet frontiersystem for agentisk arbeid.

DeepSWE forteller en annen historie: 74.1% for Astra og 72.7% for Sol. Det 1.4-poengs gapet advarer mot å generalisere fra én kodebenchmark. Astra ser ut til å vinne mest når koding krever miljøinteraksjon, iterasjon, tilstandsbevaring og verifikasjon.

Database Migration Tasks forsterker den tolkningen. Resultatet på 63.9% er 21.2 poeng over Sol og 6.1 poeng over Fable. Migreringsarbeid kombinerer kodeforståelse, verktøybruk, sekvensering og operasjonell dømmekraft—en sammensatt arbeidsflyt der små resonnneringsforbedringer kan akkumulere til langt større fullføringsgevinster.

For kodeagenter, evaluer modellen og rammeverket sammen. Instruksjoner i repo, terminalverktøy, retry-oppførsel, kontekstbevaring og testkjøring bidrar alle til målt resultat.

Datamaskinbruk: Suksessrate og kjøretid betyr begge noe

På Agents’ Last Exam scorer GPT-6 Astra 59.3%, sammenlignet med 53.6% for GPT-5.6 Sol: en gevinst på 5.7 prosentpoeng. Dette legger til et bredere agent-oppgaveresultat til OSWorld 2.0- og ScreenSpot-Pro-scorene i benchmark-oversikten over.

Utover nøyaktighet legger OSWorlds kjøretids-sammenligning til en annen praktisk dimensjon: OpenAI rapporterer omtrent 40 minutter per oppgave for Astra mot ca. 75 minutter for Sol, eller omtrent 47% kortere forløpt tid samtidig som oppgavesuksess øker.

En agent som lykkes litt oftere og blir ferdig mye raskere kan levere en stor gjennomstrømningsforbedring. Anskaffelsestester bør derfor rapportere suksessrate, forløpt tid, verktøykall, retrier og menneskelige intervensjoner—ikke bare nøyaktighet.

Automatisering og profesjonelt arbeid

AutomationBench stiger fra 18.1% til 41.4%, en gevinst på 23.3 poeng. Den absolutte scoren er fortsatt langt fra perfekt, men endringen i feilprofil er mer meningsfull enn en ett-poengs bevegelse nær metning. På BenchCAD når Astra 95.9%, foran Sol med 12.6 poeng og Fable med 11.6 poeng.

Disse resultatene støtter en spesifikk påstand: Astra er bedre til å konvertere instruksjoner til sekvenser av validerte handlinger. De beviser ikke like store gevinster for hver forretningsarbeidsflyt. En produksjonsprosess kan introdusere autentiseringstrinn, proprietære grensesnitt, tvetydige retningslinjer eller dataformater som ikke finnes i benchmarken.

Vitenskap

Vitenskap er en av Astras tydeligste kapabilitetsgevinster. På FrontierMath Tier 4 v2 når Astra 97.6%, sammenlignet med 83.0% for Sol og 87.8% for Fable. Ledelsen på 14.6 poeng over Sol er betydelig, selv om benchmarken dekker en utvalgt oppgavefordeling snarere enn hele den vitenskapelige arbeidsflyten.

Cybersikkerhet

Cybersikkerhet er en andre stor gevinst, med høyere stakes enn en vanlig topplistebevegelse. På ExploitBench som dekker juni til august 2026 scorer Astra 39.0% mot Sols 5.5%. OpenAI rapporterer at dette nyere settet målretter sårbarheter fra de foregående tre månedene for å redusere historisk eksponering. I OpenAIs cybersikkerhetsevaluering demonstrerte Astra evnen til å oppdage og utnytte to tidligere ukjente zero-day-sårbarheter under kontrollert testing. Dette er viktig fordi evalueringen var designet rundt nylig offentliggjorte sårbarheter i stedet for lenge kjente sikkerhetsproblemer, noe som reduserer sannsynligheten for at benchmarkprestasjonen skyldtes memoriserte eksempler. Resultatet bidro til at Astra nådde OpenAIs kritiske cybersikkerhetskapabilitetsterskel og endret dermed sikringstiltakene som kreves ved utrulling. Signifikansen er ikke at Astra kan gjennomføre ubegrensede cyberoperasjoner autonomt, men at kapabilitetsnivået endrer kravene til utrullingsvern. Systemer med sterkere sårbarhetsoppdagelse og utnyttelsesmulighet krever strengere tilgangskontroller, overvåking, sandboxing og menneskelige vurderingsmekanismer.

Langvarige oppgaver: Kontekstvinduet er ikke hele historien

Astras kontekstvindu på 1,050,000 tokens beskriver kapasitet, ikke kontinuitet. Langvarig ytelse avhenger også av komprimering, vedvarende tilstand, søkbar tidligere kontekst, bevart resonnneringstilstand og bevaring av verktøyutdata. I MRCR v2 scorer Astra 100.0% ved 256K–512K og 96.3% ved 512K–1M, mens Sol registrerer 91.5% og 73.8%. Gapet på 22.5 poeng i det lengste området viser at brukbar gjenfinning nær grensen betyr mer enn den annonserte kapasiteten alene.

MRCR er fortsatt en syntetisk gjenfinningsprøve, så produksjonsevaluering bør bevare evidensen som sammendrag ofte mister: hvorfor en tidligere fiks feilet, oppførselen til en bestemt komponent, testresultater, historiske krav og detaljer begravet i verktøyutdata. Repositorier og forskningsarkiver bør også testes med dupliserte navn, kryssreferanser, foreldede policyer, motstridende kilder og lange distraktorspenn. Dette skiller rå kontekstkapasitet fra kontekstbevaring og gjenfinningsatferd som en langsiktig agent faktisk trenger.

Kontekstbevaring: hvorfor Astra er forskjellig fra tradisjonelle langkontekst-systemer

Tradisjonelle langkontekst-arbeidsflyter følger vanligvis et mønster:

context → compaction → summary → continue

Denne tilnærmingen reduserer tokenbruk, men den introduserer en kritisk risiko: viktig mellomliggende informasjon kan forsvinne under oppsummering.

Den tapte informasjonen er ofte ikke selve sluttsvaret, men de operative detaljene som kreves for fremtidige beslutninger:

  • hvorfor en tidligere fiks feilet;
  • hvilken komponent viste unormal oppførsel;
  • hvilket testresultat endret implementeringsretningen;
  • hvilket brukerkrav ble lagt til senere;
  • hvilket verktøyutdata inneholdt viktig evidens.

GPT-6 Astra adresserer denne begrensningen ved å kombinere kontekstbevaring og gjenfinningsmekanismer inne i langvarige agentarbeidsflyter.

I stedet for å stole kun på komprimerte sammendrag kan systemet bevare viktige notater, hente tidligere informasjon ved behov og opprettholde kontinuitet mellom flere verktøyinteraksjoner.

For kodeagenter som Codex betyr dette at en lang feilsøkingsoppgave kan beholde:

  • tidligere mislykkede eksperimenter;
  • endringer i repo;
  • testutdata;
  • arkitektoniske beslutninger;
  • uløste problemer.

Derfor ligger verdien av Astras kontekstvindu på 1M tokens ikke bare i mengden informasjon det kan motta, men om systemet kan bevare og gjenfinne riktig informasjon etter timer med interaksjon.

Resonnering og tolkning

ARC-AGI-3: Rammeverket er en del av resultatet

ARC-AGI-3 gir den tydeligste demonstrasjonen av at en frontierbenchmark kan måle et system snarere enn en isolert modell. ARC Prize rapporterer 62.7% med Standard-harness ved maks innsats og 99.9% med Provider Adapter ved høy innsats.

ARC Prize-evalueringStandard HarnessProvider AdapterAdapter-gevinst
max62.7%98.6%+35.9 pp
xhigh59.3%98.4%+39.1 pp
high54.8%99.9%+45.1 pp
medium38.6%98.4%+59.8 pp
low17.5%98.0%+80.5 pp

GPT-6 Astra-benchmarks: Hva tallene faktisk sier

ARC Prize-sammenligning av Astras handlings-effektivitet på tvers av evalueringsrammeverk

Den leverandørnøytrale rammeverkspolicyen krever at modellen bevarer viktig informasjon i synlig tilstand. Provider Adapter beholder ytterligere resonnneringstilstand og bruker leverandørspesifikk konteksthåndtering. På tvers av delte løste game-resonneringspar rapporterer ARC Prize 3.66× raskere utførelse og 49% færre totale tokens med adapteren.

99.9%-resultatet måler et spesifikt modell–leverandør–adapter-system og bør ikke behandles som et rammeverksuavhengig mål på rå modellintelligens. Kontekstarkitektur er en del av det benchmarkede systemet.

Resonneringsinnsats skalerer ikke lineært

Tabellen for ARC viser også at maksimal innsats ikke alltid gir høyest score. Høy innsats når 99.9% med Provider Adapter, mens maks når 98.6%. I Standard-harness presterer maks best.

OpenAI bemerker at lanserings-tabeller generelt bruker den best observerte resonnneringsinnstillingen. Den tilnærmingen estimerer et ytelsestak, men identifiserer ikke den beste produksjonskonfigurasjonen. Team bør teste flere innsatsnivåer og beregne marginal kvalitet vunnet per ekstra sekund og dollar.

Matematikk og akademisk resonnering

FrontierMath Tier 4 v2 stiger fra 83.0% til 97.6%, en gevinst på 14.6 poeng. Det er en stor benchmarkforbedring, men det er ikke evidens for at frontiersmatematikk er løst. Evalueringen dekker en utvalgt oppgavefordeling og måler ikke alle stadier i matematisk forskning, inkludert problemvalg, formell bevisverifikasjon, langsiktig programutvikling eller adversarial fagfellevurdering.

GPQA Diamond gir det motsatte mønsteret: 96.0% for Astra, 94.6% for Sol, 93.7% for Fable og 95.3% for Gemini 3.8 Flash. Modellene klustrer tett nær taket. Å rapportere 1.4-poengs forskjellen mellom Astra og Sol er korrekt, men å kalle det en bred intelligensrevolusjon ville overdrive evidensen.

Kritisk kapabilitet + sikringstiltak

CybersikkerhetsevalueringAstraSolAbsolutt gevinst
ExploitBench100.0%78.5%+21.5 pp
ExploitGym42.4%30.3%+12.1 pp
ExploitBench, June–August 202639.0%5.5%+33.5 pp
SRE-Bench88.0%55.9%+32.1 pp
SEC-Bench Pro85.4%79.1%+6.3 pp

OpenAI opprettet ExploitBench (juni–august 2026) fra sårbarheter avslørt i de foregående tre månedene, noe som reduserer sjansen for at historisk sårbarhetseksponering blåste opp resultatet. Astra scorer 39.0% på dette settet mot Sols 5.5%, og OpenAI rapporterer at Astra fant og utnyttet to tidligere ukjente zero-day-sårbarheter. Disse resultatene bidro til at Astra ble OpenAIs første bredt utplasserte modell som nådde kritisk cybersikkerhetskapabilitetsterskel, noe som direkte påvirket sikringstiltak og tilgangspolicy.

Slik leser du score nær metning

Score over 90% krever mer forsiktig språk enn midt-range resultater. Å gå fra 50% til 60% løser ti ekstra oppgaver per hundre. Å gå fra 95% til 96% løser bare én ekstra oppgave per hundre, selv om det reduserer gjenværende feil fra fem til fire—en 20% reduksjon i feil. Begge beskrivelser er matematisk korrekte, men de understøtter svært ulike overskrifter.

Den motsatte advarselen gjelder for lavt scorende benchmarker. En økning fra 18.1% til 41.4% er fortsatt langt under pålitelig autonom drift, men den mer enn dobler antall vellykkede tilfeller og kan transformere en overvåket arbeidsflyt. Absolutt score avgjør om systemet er klart; forbedringsstørrelse indikerer hvor raskt kapabiliteten endres. Produksjonsbeslutninger trenger begge.

En multidimensjonal sammenligning

DimensjonAstraSolFableBeslutningssignal
Generell akademisk resonneringUtmerket; ofte nær metningTett bakKonkurransedyktigSmå gap avgjør sjelden utrulling alene
TerminalutførelseToppnivåStor generasjonsforskjellTett konkurrentTest hele koderammeverket
DatamaskinbrukHøyere suksess og lavere kjøretidSaktere og mindre nøyaktigUtilstrekkelige sammenlignbare data i lanseringstabellenMål suksess per time
Langkontekst-gjenfinningSterk nær 1M tokensMateriell degradering nær grensenUtilstrekkelige direkte sammenlignbare dataBruk produksjonsnære gjenfinningsprøver
Resonneringskontrolllow til maxAnnen innsatskurveAdaptiv-tenkningstilnærmingTuning av konfigurasjon, ikke kun modellnavn
CyberkapabilitetKvalitativt høyere risikonivåLavere publiserte resultaterIkke sammenlignet herSikringstiltak og tilgangspolicy betyr mye
TokenøkonomiHøyere rate; noen ganger færre tokensLavere rateAvhengig av arbeidslastSammenlign kost per vellykket oppgave

Resultatet er arbeidslastavhengig. Astra er mest overbevisende når oppgaven krever vedvarende interaksjon med verktøy og miljøer, gjenoppretting etter feil eller pålitelig gjenfinning på tvers av svært store kontekster. Sol kan fortsatt være mer økonomisk for avgrenset arbeid med moderat kontekst og begrenset iterasjon. Fable er en tett konkurrent på terminalarbeid og leder noen eksterne akademiske evalueringer, så en applikasjonsnivåbenchmark er mer nyttig enn en leverandørnivåkonklusjon.

Hvem bør bruke GPT-6 Astra?

BrukstilfelleAnbefaling
Enkel klassifiseringIkke nødvendigvis verdt å bruke Astra
Enkel oppsummeringIkke nødvendigvis verdt å bruke Astra
Standard RAGBenchmark kost vs. ytelse først
Langdokument-syntese og analyseVerdt å teste Astra
Agentisk kodingSterkt anbefalt å teste
DatamaskinbrukSterkt anbefalt å teste
Flertrinns automatiseringSterkt anbefalt å teste
Kompleks forskningVerdt å teste
Vitenskapelig databehandling / spesialisert programvareVerdt å teste
CybersikkerhetSterke kapabiliteter, men krever passende sikringstiltak
Høy-gjennomstrømning, enkle oppgaverLavkost-modeller kan være mer kosteffektive

Rettferdiggjør Astras ytelsesgevinster den høyere prisen?

GPT-6 Astra er betydelig dyrere enn GPT-5.6 Sol, men benchmarkforbedringer er ikke jevnt fordelt over arbeidslaster. Prisingsspørsmålet kan derfor ikke besvares ved å sammenligne tokenrater alene.

ScenarioYtelsesgevinstKostnadsrettferdiggjøring
Enkel Q&ALiten forbedringVanligvis ikke verdt premien
KodeagentStor forbedringPremie kan rettferdiggjøres
LangkontekstanalyseBetydelig forbedringAvhenger av gjenfinningsbehov
DatamaskinautomatiseringSterk forbedringOfte verdt å teste
Generell resonneringBegrenset forbedringSammenlign kost nøye

Ved OpenAI Standard-rater koster GPT-6 Astra $10 per million inntokens, $1 per million bufrede inntokens, $12.50 per million cache-skrivetokens og $50 per million utgående tokens. Standard inndata og utdata er 2.5× $4 og $20 for GPT-5.6 Sol. Når en forespørsel overstiger 272K inntokens, dobles Astras inndata- og cacherater og utdata-raten øker med 1.5× for hele forespørselen.

Prispremien samsvarer klarest med agentisk arbeid. Astra vinner mer enn 20 prosentpoeng på Terminal-Bench, AutomationBench, database-migrering og lengste MRCR; uavhengig testing rapporterer også omtrent en tredjedel av tokenbruken til Sol på Coding Agent Index. Matchen er svakere på bred resonnering, der Intelligence Index er nesten likt og tokenbruken faller med bare ca. 10%. Kjøpsbeslutningen bør derfor sammenligne kost per vellykket oppgave, inkludert utdata, cache-aktivitet, verktøybruk, forløpt tid, retrier, feil og menneskelig korrigering.

Kost per vellykket oppgave

Kost per vellykket oppgave = (Inndatakost + Utdatakost + Verktøykost + Retry-kost + Kost for menneskelig gjennomgang) / Vellykkede oppgaver

Forventet forretningskost

Forventet forretningskost = API-kost + Verktøykost + Retry-kost + Kost for menneskelig gjennomgang + Feilkost

Beslutningsmetrikk bør være totalkost delt på vellykkede oppgaver, evaluert ved en akseptabel kvalitetsgrense—ikke katalogpris per million tokens.

Hvordan utviklere bør benchmarke Astra

Offentlige topplister bør avgjøre hva som fortjener testing, ikke ta den endelige utrullingsbeslutningen. Bygg et representativt oppgavesett med rutinesaker, vanskelige saker, manglende kontekst, verktøyfeil og adversarielle instruksjoner. Bruk samme produksjonsprompt, tillatelser, kildefiler, tidsbudsjett og fullføringskriterier for hver modell.

EvalueringsdimensjonMålHvorfor det betyr noe
OppgavesuksessAkseptkriterier passertHindrer at overbevisende, men ufullstendige svar scorer som suksess
PålitelighetSuksessfordeling over gjentatte kjøringerAvslører ustabile enkelttreff
VerktøyutførelseVerifiserte vellykkede handlingerSkiller verktøykall fra riktige utfall
FaktisitetUnderbygde faktiske påstanderMåler evidenskvalitet og avståelse
LatenstidMedian- og hale-fullføringstidFanger operasjonell gjennomstrømning
KostTotalkost per vellykket oppgaveInkluderer retrier og mislykkede forsøk
Menneskelig innsatsKorrekturer og gjennomgangsminutterDominerer ofte reell utrullingskost
StyrebarhetGjenoppretting etter endrede kravTester langsiktig agentatferd

Astra-APIet i CometAPI bruker modell-ID gpt-6-astra. Et multi-modell API gjør det praktisk å kjøre samme evaluering på tvers av Astra, Sol, Fable og Gemini uten å redesigne benchmarken rundt én leverandørs lanseringstabell. Ruter krevende agentiske oppgaver til modellen som fortjener sin premie, og bruk lavkost-modeller der den målte fordelen forsvinner.

Konklusjon

Astras benchmark-ark er imponerende, men de mest spektakulære scorene er ikke automatisk de mest nyttige. ARC-AGI-3 demonstrerer potensialet til et leverandørspesifikt agentrammeverk; Standard-harness-scoren viser hvor sterkt infrastrukturen bidrar. GPQA og den uavhengige Intelligence Index viser at ordinære resonneringsgevinster kan være beskjedne. Terminalarbeid, automatisering, datamaskinbruk, langkontekst-gjenfinning, vitenskapelige arbeidsflyter og cybersikkerhet forteller den viktigere historien.

Lanseringen handler mindre om at en chatbot blir proporsjonalt smartere på hvert spørsmål og mer om at frontier-intelligens blir bedre til å fullføre arbeid. Om oppgraderingen er verdt å betale for avhenger av hele modell–system-konfigurasjonen og økonomien i vellykkede produksjonsoppgaver.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Sep 14, 2026
Sist oppdatert Sep 14, 2026
98 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Klar til å redusere AI-utviklingskostnadene med 20 %?

Kom i gang gratis på minutter. Gratis prøvekreditter inkludert. Ingen kredittkort nødvendig.

Les mer