Technische specificaties van gpt-oss-20b-free
| Specificatie | gpt-oss-20b |
|---|---|
| Aanbieder | OpenAI |
| Modelfamilie | gpt-oss open-weight reasoning models |
| Model | gpt-oss-20b-free |
| Model-ID in CometAPI | gpt-oss-20b-free |
| Architectuur | Mixture-of-Experts (MoE) |
| Totaal aantal parameters | 21B |
| Actieve parameters | 3.6B |
| Contextvenster | 131,072 tokens |
| Maximale output-tokens | 131,072 |
| Invoer / uitvoer | Tekst in, tekst uit |
| Redeneringsinspanning | Laag, gemiddeld, hoog |
| Licentie | Apache 2.0, onderworpen aan het gpt-oss-gebruiksbeleid |
| Functie-aanroepen | Ondersteund |
| Gestructureerde uitvoer | Ondersteund |
| Streaming | Ondersteund |
| Fine-tuning | Ondersteund via open tooling/infrastructuur |
| Natief implementatiedoel | Lokaal, edge, private infrastructuur, of gehoste inferentie |
| Kennisafkapdatum | 1 juni 2024 |
Wat is gpt-oss-20b?
gpt-oss-20b is OpenAI's kleinere open-weight redeneermodel in de gpt-oss-familie. CometAPI biedt ook gratis gebruik van gpt-oss-20b; de ID is gpt-oss-20b-free. Het heeft in totaal 21 miljard parameters maar activeert ongeveer 3,6 miljard parameters per forward pass, met een Mixture-of-Experts-architectuur om de inferentie-eisen te verlagen en toch aanzienlijke redeneercapaciteit te behouden. OpenAI positioneert het voor workloads met lagere latentie, lokaal en gespecialiseerd, in plaats van als directe vervanging voor de grootste propriëtaire modellen.
Het model is alleen-tekst en is ontworpen voor redenerings- en agentische workflows. De open gewichten kunnen worden gedownload, aangepast, fijn-afgestemd en uitgerold op infrastructuur die door de ontwikkelaar wordt beheerd. OpenAI en Hugging Face documenteren native MXFP4-kwantisering die het mogelijk maakt het model te draaien binnen ongeveer 16 GB geheugen, wat het ongewoon toegankelijk maakt voor een model in deze parameterklasse.
Belangrijkste kenmerken van gpt-oss-20b
- Efficiënte MoE-architectuur: 21B totale parameters met slechts 3,6B actieve parameters per forward pass, gericht op lagere latentie en lagere inzetvereisten.
- Configureerbare redenering: Ontwikkelaars kunnen lage, gemiddelde of hoge redeneringsinspanning kiezen om responstijd en compute af te ruilen tegen redeneerkwaliteit.
- Agentisch gebruik van tools: Het model ondersteunt workflows met functie-aanroepen, web-browsen, Python-uitvoering en gestructureerde uitvoer wanneer de serving-runtime die tools aanbiedt.
- Aanpasbaarheid met open gewichten: De Apache 2.0-licentie staat brede modificatie en commerciële inzet toe, onder voorbehoud van het gpt-oss-gebruiksbeleid.
- Lokale en private implementatie: Het model is bedoeld om te draaien op infrastructuur die door ontwikkelaars wordt beheerd, inclusief lokale of private omgevingen.
- Lange context: De productdocumentatie vermeldt een contextvenster van 131.072 tokens en een maximum van 131.072 output-tokens.
Benchmarkprestaties van gpt-oss-20b
Door OpenAI gepubliceerde evaluatieresultaten tonen dat gpt-oss-20b bijzonder sterk is in wiskundige redenering en coderen in verhouding tot zijn grootte. Bij hoge redeneringsinspanning met tools behaalt het 98,7% op AIME 2025, 96,0% op AIME 2024, 60,7% op SWE-Bench Verified en 54,8% op Tau-Bench Retail. Op kennis- en redeneerevaluaties rapporteert OpenAI 85,3% op MMLU, 71,5% op GPQA Diamond zonder tools en 17,3% op Humanity's Last Exam met tools. Resultaten variëren aanzienlijk met redeneringsinspanning en tooltoegang, dus deze cijfers moeten niet als universele productie-nauwkeurigheidspercentages worden beschouwd.
| Benchmark | resultaat gpt-oss-20b | Evaluatieconditie |
|---|---|---|
| AIME 2024 | 96,0% | Hoge redeneringsinspanning, met tools |
| AIME 2025 | 98,7% | Hoge redeneringsinspanning, met tools |
| GPQA Diamond | 71,5% | Hoge redeneringsinspanning, zonder tools |
| MMLU | 85,3% | Hoge redeneringsinspanning |
| SWE-Bench Verified | 60,7% | Hoge redeneringsinspanning |
| Tau-Bench Retail | 54,8% | Hoge redeneringsinspanning |
| Humanity's Last Exam | 17,3% | Hoge redeneringsinspanning, met tools |
OpenAI's eigen vergelijking plaatst gpt-oss-20b dicht bij o3-mini op verschillende evaluatiecategorieën, terwijl de grotere gpt-oss-120b over het algemeen een voordeel heeft bij brede kennis- en agentische workloads.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Model | Primair voordeel | Context | Beste toepassing |
|---|---|---|---|
| gpt-oss-20b | Efficiënt redeneren met open gewichten | 131K | Lokale inferentie, coderen, wiskunde, gespecialiseerde agenten |
| gpt-oss-120b | Hogere algehele capaciteit | 131K | Zwaardere redenerings- en productie-workloads |
| o3-mini | Propriëtair redeneermodel | Verschilt per implementatie | Beheerde redenering waar open gewichten niet vereist zijn |
Het praktische onderscheid is controle over deployment. gpt-oss-20b is de betere keuze wanneer ontwikkelaars open gewichten, lokale/private uitvoering, maatwerk of relatief bescheiden hardwarevereisten nodig hebben. gpt-oss-120b verdient de voorkeur wanneer hogere algehele redenerings- en kennisprestaties een grotere deployment-footprint rechtvaardigen.
Beperkingen van gpt-oss-20b
gpt-oss-20b is alleen-tekst en accepteert niet native beeld-, audio- of video-invoer. Het kleinere aantal parameters zorgt ook voor een prestatiedaling op sommige kennisintensieve en agentische evaluaties in vergelijking met gpt-oss-120b. Daarnaast verlegt implementatie met open gewichten meer operationele verantwoordelijkheid naar de ontwikkelaar: hosting, schaling, monitoring, veiligheidscontroles en runtimeconfiguratie worden niet op dezelfde manier afgehandeld als via een volledig beheerde propriëtaire API.
OpenAI merkt ook op dat open-weight modellen een ander veiligheidsprofiel hebben dan gehoste modellen omdat ontwikkelaars de gewichten kunnen aanpassen of fijn-afstemmen. Productie-implementaties moeten daarom passende toepassingsniveau-beveiligingen en toegangscontroles toevoegen.
Gebruiksscenario's voor gpt-oss-20b
- Lokale code-assistenten waarbij ontwikkelaars redenering en codegeneratie willen zonder code naar een propriëtair gehost model te sturen.
- Wiskundige en technische redenering waarbij hoge redeneringsinspanning kan worden ingeschakeld voor moeilijke problemen.
- Private bedrijfsworkloads die implementatie binnen een gecontroleerde omgeving vereisen.
- Tool-gebruikende agenten die het model combineren met functie-aanroepen, Python-uitvoering, webzoekopdrachten of toepassingsspecifieke tools.
- Fijn-afgestemde domeinassistenten waarbij open gewichten waardevoller zijn dan toegang tot een beheerd propriëtair model.
- Resource-beperkte inferentie waarbij het geheugendoel van ongeveer 16 GB, mogelijk gemaakt door MXFP4-kwantisering, belangrijk is.
Toegang tot gpt-oss-20b via CometAPI
CometAPI vermeldt momenteel gpt-oss-20b-free als een OpenAI-model en beschrijft het als een open-source MoE-model met 21B parameters, 3,6B actieve parameters en een context van de klasse 128K. Het is gratis te gebruiken en biedt het model aan via CometAPI's geünificeerde API. De CometAPI-changelog stelt dat het model het OpenAI-chatstandaardformaat volgt.
Voor integratie met CometAPI is de algemene workflow: maak een CometAPI-sleutel aan, gebruik de CometAPI-basis-URL en stuur de modelnaam mee in het verzoek. CometAPI documenteert OpenAI-SDK-compatibele integratie en vermeldt momenteel https://api.cometapi.com/v1 als de quickstart-basis-URL.