Tekniske spesifikasjoner for gpt-oss-20b-free
| Spesifikasjon | gpt-oss-20b |
|---|---|
| Leverandør | OpenAI |
| Modellfamilie | gpt-oss-modeller med åpne vekter for resonnering |
| Modell | gpt-oss-20b-free |
| Modell-ID i CometAPI | gpt-oss-20b-free |
| Arkitektur | Mixture of Experts (MoE) |
| Totalt antall parametere | 21B |
| Aktive parametere | 3.6B |
| Kontekstvindu | 131,072 tokens |
| Maksimalt antall utdata-tokens | 131,072 |
| Inndata / utdata | Tekst inn, tekst ut |
| Resonneringsinnsats | Lav, middels, høy |
| Lisens | Apache 2.0, underlagt gpt-oss-brukspolicyen |
| Funksjonskall | Støttes |
| Strukturerte utdata | Støttes |
| Strømming | Støttes |
| Finjustering | Støttes gjennom åpne verktøy/infrastruktur |
| Naturlig distribusjonsmål | Lokal, edge, privat infrastruktur eller hostet inferens |
| Kunnskapsavgrensning | 1. juni 2024 |
Hva er gpt-oss-20b?
gpt-oss-20b er OpenAIs mindre resonneringsmodell med åpne vekter i gpt-oss-familien. CometAPI tilbyr også gratis bruk av gpt-oss-20b; ID-en er gpt-oss-20b-free. Den har totalt 21 milliarder parametere, men aktiverer omtrent 3,6 milliarder parametere per fremoverpassering ved å bruke en Mixture-of-Experts-arkitektur for å redusere inferenskrav samtidig som den beholder betydelig resonneringskapasitet. OpenAI posisjonerer den for arbeidsbelastninger med lavere ventetid, lokale og spesialiserte behov, snarere enn som en direkte erstatning for de største proprietære modellene.
Modellen er kun tekst og er utformet for resonnerings- og agentiske arbeidsflyter. De åpne vektene kan lastes ned, tilpasses, finjusteres og distribueres på infrastruktur som kontrolleres av utvikleren. OpenAI og Hugging Face dokumenterer en egen MXFP4-kvantisering som gjør at modellen kan kjøre innen omtrent 16 GB minne, noe som gjør den uvanlig tilgjengelig for en modell i denne parameterklassen.
Hovedfunksjoner i gpt-oss-20b
- Effektiv MoE-arkitektur: 21B totale parametere med bare 3.6B aktive parametere per fremoverpassering, med mål om lavere ventetid og lavere krav til distribusjon.
- Konfigurerbar resonnering: Utviklere kan velge lav, middels eller høy resonneringsinnsats for å bytte mellom svartid/ressursbruk og resonneringskvalitet.
- Agent-basert verktøybruk: Modellen støtter arbeidsflyter som omfatter funksjonskall, nettsurfing, Python-kjøring og strukturerte utdata når kjøreruntime eksponerer disse verktøyene.
- Tilpasning med åpne vekter: Apache 2.0-lisensen tillater bred modifikasjon og kommersiell distribusjon, underlagt gpt-oss-brukspolicyen.
- Lokal og privat distribusjon: Modellen er ment å kjøre på infrastruktur kontrollert av utviklere, inkludert lokale eller private miljøer.
- Lang kontekst: Produksjonsdokumentasjonen oppgir et kontekstvindu på 131,072 tokens og en maksimal grense for utdata-tokens på 131,072.
Benchmark-ytelse for gpt-oss-20b
OpenAIs publiserte evalueringsresultater viser at gpt-oss-20b er spesielt sterk på matematisk resonnering og koding relativt til størrelsen. Ved høy resonneringsinnsats med verktøy oppnår den 98,7% på AIME 2025, 96,0% på AIME 2024, 60,7% på SWE-Bench Verified og 54,8% på Tau-Bench Retail. På kunnskaps- og resonneringsevalueringer rapporterer OpenAI 85,3% på MMLU, 71,5% på GPQA Diamond uten verktøy, og 17,3% på Humanity's Last Exam med verktøy. Resultater varierer betydelig med resonneringsinnsats og verktøystøtte, så disse tallene bør ikke behandles som universelle produksjonsnøyaktighetsrater.
| Benchmark | Resultat for gpt-oss-20b | Evalueringsbetingelse |
|---|---|---|
| AIME 2024 | 96,0% | Høy resonnering, med verktøy |
| AIME 2025 | 98,7% | Høy resonnering, med verktøy |
| GPQA Diamond | 71,5% | Høy resonnering, uten verktøy |
| MMLU | 85,3% | Høy resonnering |
| SWE-Bench Verified | 60,7% | Høy resonnering |
| Tau-Bench Retail | 54,8% | Høy resonnering |
| Humanity's Last Exam | 17,3% | Høy resonnering, med verktøy |
OpenAIs egen sammenligning plasserer gpt-oss-20b nær o3-mini på flere evalueringskategorier, mens den større gpt-oss-120b generelt har en fordel på bred kunnskap og agentiske arbeidsbelastninger.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Modell | Primær fordel | Kontekst | Best egnet |
|---|---|---|---|
| gpt-oss-20b | Effektiv resonnering med åpne vekter | 131K | Lokal inferens, koding, matematikk, spesialiserte agenter |
| gpt-oss-120b | Høyere total kapasitet | 131K | Mer krevende resonnering og produksjonsarbeidsbelastninger |
| o3-mini | Proprietær resonneringsmodell | Varierer per distribusjon | Administrert resonnering når åpne vekter ikke er påkrevd |
Den praktiske forskjellen er kontroll over distribusjonen. gpt-oss-20b er det bedre valget når utviklere trenger åpne vekter, lokal/privat kjøring, tilpasning eller relativt beskjedne maskinvarekrav. gpt-oss-120b er å foretrekke når høyere samlet resonnerings- og kunnskapsytelse rettferdiggjør et større distribusjonsfotavtrykk.
Begrensninger ved gpt-oss-20b
gpt-oss-20b er kun tekst og aksepterer ikke bilder, lyd eller video som input. Det lavere antallet parametere skaper også et ytelsesgap på noen kunnskapsintensive og agentiske evalueringer sammenlignet med gpt-oss-120b. I tillegg overfører distribusjon med åpne vekter mer operasjonelt ansvar til utvikleren: hosting, skalering, overvåking, sikkerhetskontroller og runtime-konfigurasjon håndteres ikke på samme måte som via et fulladministrert proprietært API.
OpenAI påpeker også at modeller med åpne vekter har en annen sikkerhetsprofil enn hostede modeller fordi utviklere kan modifisere eller finjustere vektene. Produksjonsdistribusjoner bør derfor legge til passende applikasjonsnivå-tiltak for sikkerhet og tilgangskontroll.
Bruksområder for gpt-oss-20b
gpt-oss-20b passer godt for:
- Lokale kodeassistenter der utviklere ønsker resonnering og kodegenerering uten å sende kode til en proprietær hostet modell.
- Matematisk og teknisk resonnering der høy resonneringsinnsats kan aktiveres for vanskelige problemer.
- Private bedriftsarbeidsbelastninger som krever distribusjon i et kontrollert miljø.
- Verktøybrukende agenter som kombinerer modellen med funksjonskall, Python-kjøring, nettsøk eller applikasjonsspesifikke verktøy.
- Domenespesifikke assistenter med finjustering der åpne vekter er mer verdifulle enn tilgang til en administrert proprietær modell.
- Ressursbegrenset inferens der minnemålet på omtrent 16 GB muliggjort av MXFP4-kvantisering er viktig.
Tilgang til gpt-oss-20b via CometAPI
CometAPI oppgir for tiden gpt-oss-20b-free som en OpenAI-modell og beskriver den som en 21B-parameter åpen kildekode MoE-modell med 3.6B aktive parametere og en kontekst i 128K-klassen. Den er gratis å bruke og eksponerer modellen gjennom CometAPIs forente API. CometAPIs endringslogg oppgir at modellen følger OpenAIs standard chatformat.
For integrasjon med CometAPI er den generelle arbeidsflyten å opprette en CometAPI-nøkkel, bruke CometAPI-base-URL-en, og sende modellenavnet i forespørselen. CometAPI dokumenterer integrasjon kompatibel med OpenAI-SDK og oppgir for tiden https://api.cometapi.com/v1 som hurtigstart-base-URL.