Tekniske specifikationer for gpt-oss-20b-free
| Specifikation | gpt-oss-20b |
|---|---|
| Udbyder | OpenAI |
| Modelfamilie | gpt-oss-reasoningmodeller med åbne vægte |
| Model | gpt-oss-20b-free |
| Model-ID i CometAPI | gpt-oss-20b-free |
| Arkitektur | Mixture of Experts (MoE) |
| Samlet antal parametre | 21B |
| Aktive parametre | 3.6B |
| Kontekstvindue | 131,072 tokens |
| Maksimalt antal output-tokens | 131,072 |
| Input / output | Tekst ind, tekst ud |
| Ræsonneringsindsats | Lav, middel, høj |
| Licens | Apache 2.0, underlagt gpt-oss-brugspolitikken |
| Funktionskald | Understøttet |
| Strukturerede output | Understøttet |
| Streaming | Understøttet |
| Finetuning | Understøttet via åbne værktøjer/infrastruktur |
| Native udrulningsmål | Lokal, edge, privat infrastruktur eller hostet inferens |
| Vidensskæringsdato | 1. juni 2024 |
Hvad er gpt-oss-20b?
gpt-oss-20b er OpenAIs mindre reasoningmodel med åbne vægte i gpt-oss-familien. CometAPI tilbyder også gratis brug af gpt-oss-20b; ID'et er gpt-oss-20b-free. Den har i alt 21 milliarder parametre, men aktiverer omkring 3,6 milliarder parametre pr. forward pass ved hjælp af en Mixture-of-Experts-arkitektur for at reducere inferenskravene og samtidig bevare betydelig ræsonneringskapacitet. OpenAI positionerer den til arbejdsbelastninger med lavere latenstid, lokale og specialiserede scenarier frem for som en direkte erstatning for sine største proprietære modeller.
Modellen er kun tekstbaseret og designet til ræsonnerings- og agentiske arbejdsgange. Dens åbne vægte kan downloades, tilpasses, finetunes og udrulles på infrastruktur, som udvikleren kontrollerer. OpenAI og Hugging Face dokumenterer native MXFP4-kvantisering, der gør det muligt at køre modellen inden for cirka 16 GB hukommelse, hvilket gør den usædvanligt tilgængelig for en model i denne parameterklasse.
Hovedfunktioner i gpt-oss-20b
- Effektiv MoE-arkitektur: 21B samlede parametre med kun 3,6B aktive parametre pr. forward pass, målrettet lavere latenstid og lavere udrulningskrav.
- Konfigurerbar ræsonnering: Udviklere kan vælge lav, middel eller høj ræsonneringsindsats for at bytte svartid og compute mod ræsonneringskvalitet.
- Agentbaseret værktøjsbrug: Modellen understøtter arbejdsgange med funktionskald, webbrowsing, Python-udførelse og strukturerede output, når runtime-miljøet stiller disse værktøjer til rådighed.
- Tilpasning med åbne vægte: Apache 2.0-licensen tillader bred ændring og kommerciel udrulning, underlagt gpt-oss-brugspolitikken.
- Lokal og privat udrulning: Modellen er tiltænkt kørsel på infrastruktur, som udviklere kontrollerer, herunder lokale eller private miljøer.
- Lang kontekst: Produktionsmodellens dokumentation angiver et kontekstvindue på 131,072 tokens og en maksimal output-token-grænse på 131,072.
Benchmark-ydelse for gpt-oss-20b
OpenAIs offentliggjorte evalueringsresultater viser, at gpt-oss-20b er særligt stærk i matematisk ræsonnering og kodning i forhold til sin størrelse. Ved høj ræsonneringsindsats med værktøjer når den 98.7% på AIME 2025, 96.0% på AIME 2024, 60.7% på SWE-Bench Verified og 54.8% på Tau-Bench Retail. På viden- og ræsonneringsevalueringer rapporterer OpenAI 85.3% på MMLU, 71.5% på GPQA Diamond uden værktøjer og 17.3% på Humanity's Last Exam med værktøjer. Resultaterne varierer betydeligt med ræsonneringsindsatsen og adgang til værktøjer, så disse tal bør ikke betragtes som universelle produktionsnøjagtighedsrater.
| Benchmark | gpt-oss-20b-resultat | Evalueringsbetingelse |
|---|---|---|
| AIME 2024 | 96.0% | Høj ræsonnering, med værktøjer |
| AIME 2025 | 98.7% | Høj ræsonnering, med værktøjer |
| GPQA Diamond | 71.5% | Høj ræsonnering, uden værktøjer |
| MMLU | 85.3% | Høj ræsonnering |
| SWE-Bench Verified | 60.7% | Høj ræsonnering |
| Tau-Bench Retail | 54.8% | Høj ræsonnering |
| Humanity's Last Exam | 17.3% | Høj ræsonnering, med værktøjer |
OpenAIs egen sammenligning placerer gpt-oss-20b tæt på o3-mini i flere evalueringskategorier, mens den større gpt-oss-120b generelt har en fordel på bred viden og agentiske arbejdsbelastninger.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Model | Primær fordel | Kontekst | Bedst egnet |
|---|---|---|---|
| gpt-oss-20b | Effektiv reasoning med åbne vægte | 131K | Lokal inferens, kodning, matematik, specialiserede agenter |
| gpt-oss-120b | Højere overordnet kapabilitet | 131K | Mere krævende ræsonnering og produktionsarbejdsbelastninger |
| o3-mini | Proprietær ræsonneringsmodel | Varierer efter udrulning | Administreret ræsonnering, hvor åbne vægte ikke er påkrævet |
Den praktiske forskel er kontrol over udrulningen. gpt-oss-20b er det bedre valg, når udviklere har brug for åbne vægte, lokal/privat kørsel, tilpasning eller relativt beskedne hardwarekrav. gpt-oss-120b er at foretrække, når højere overordnet ræsonnerings- og videnperformance retfærdiggør et større udrulningsaftryk.
Begrænsninger ved gpt-oss-20b
gpt-oss-20b er kun tekstbaseret og accepterer ikke oprindeligt billede-, lyd- eller video-input. Dens mindre parameterantal skaber også en performancemæssig kløft på nogle videntunge og agentiske evalueringer sammenlignet med gpt-oss-120b. Derudover flytter udrulning med åbne vægte mere operationelt ansvar til udvikleren: hosting, skalering, overvågning, sikkerhedskontroller og runtime-konfiguration håndteres ikke på samme måde som via et fuldt administreret proprietært API.
OpenAI bemærker også, at modeller med åbne vægte har en anden sikkerhedsprofil end hostede modeller, fordi udviklere kan ændre eller finetune vægtene. Produktionsudrulninger bør derfor tilføje passende applikationsniveau-sikkerhedsforanstaltninger og adgangskontroller.
Anvendelsestilfælde for gpt-oss-20b
gpt-oss-20b passer godt til:
- Lokale kodeassistenter, hvor udviklere ønsker ræsonnering og kodegenerering uden at sende kode til en proprietær hostet model.
- Matematisk og teknisk ræsonnering, hvor høj ræsonneringsindsats kan aktiveres til svære problemer.
- Private virksomhedslaster, der kræver udrulning i et kontrolleret miljø.
- Værktøjsbrugende agenter, der kombinerer modellen med funktionskald, Python-udførelse, websøgning eller applikationsspecifikke værktøjer.
- Finetunede domæneassistenter, hvor åbne vægte er mere værdifulde end adgang til en administreret proprietær model.
- Ressourcebegrænset inferens, hvor det cirka 16 GB hukommelsesbehov muliggjort af MXFP4-kvantisering er vigtigt.
Adgang til gpt-oss-20b via CometAPI
CometAPI oplister aktuelt gpt-oss-20b-free som en OpenAI-model og beskriver den som en open source MoE-model med 21B parametre, 3.6B aktive parametre og kontekst i 128K-klassen. Den er gratis at bruge og eksponerer modellen via CometAPIs samlede API. CometAPIs ændringslog angiver, at modellen følger OpenAIs chat-standardformat.
For CometAPI-integration er den generelle arbejdsgang at oprette en CometAPI-nøgle, bruge CometAPIs basis-URL og sende modelnavnet i anmodningen. CometAPI dokumenterer OpenAI-SDK-kompatibel integration og oplister aktuelt https://api.cometapi.com/v1 som quickstart-basis-URL.