Specifiche tecniche di gpt-oss-20b-free
| Specfica | gpt-oss-20b |
|---|---|
| Provider | OpenAI |
| Famiglia di modelli | modelli di ragionamento gpt-oss a pesi aperti |
| Modello | gpt-oss-20b-free |
| ID del modello in CometAPI | gpt-oss-20b-free |
| Architettura | Mixture of Experts (MoE) |
| Parametri totali | 21B |
| Parametri attivi | 3.6B |
| Finestra di contesto | 131.072 token |
| Numero massimo di token in output | 131.072 |
| Input / output | Testo in input, testo in output |
| Sforzo di ragionamento | Basso, medio, alto |
| Licenza | Apache 2.0, soggetta alla policy d'uso di gpt-oss |
| Chiamata di funzioni | Supportata |
| Output strutturati | Supportati |
| Streaming | Supportato |
| Fine-tuning | Supportato tramite strumenti/infrastruttura open |
| Destinazione di distribuzione nativa | Locale, edge, infrastruttura privata o inferenza ospitata |
| Limite di conoscenza | 1 giugno 2024 |
Che cos’è gpt-oss-20b?
gpt-oss-20b è il modello di ragionamento open-weight più piccolo di OpenAI nella famiglia gpt-oss. CometAPI offre anche l’uso gratuito di gpt-oss-20b; l’ID è gpt-oss-20b-free. Ha 21 miliardi di parametri totali ma attiva circa 3,6 miliardi di parametri per passaggio in avanti, utilizzando un’architettura Mixture-of-Experts per ridurre i requisiti di inferenza mantenendo una notevole capacità di ragionamento. OpenAI lo posiziona per carichi di lavoro locali e specializzati a bassa latenza, piuttosto che come sostituto diretto dei suoi modelli proprietari più grandi.
Il modello è solo testo ed è progettato per il ragionamento e i workflow basati su agenti. I pesi aperti possono essere scaricati, personalizzati, sottoposti a fine-tuning e distribuiti su un’infrastruttura controllata dallo sviluppatore. OpenAI e Hugging Face documentano una quantizzazione MXFP4 nativa che consente al modello di funzionare entro circa 16 GB di memoria, rendendolo insolitamente accessibile per un modello in questa classe di parametri.
Caratteristiche principali di gpt-oss-20b
- Architettura MoE efficiente: 21B di parametri totali con soli 3,6B di parametri attivi per passaggio in avanti, per ridurre la latenza e i requisiti di distribuzione.
- Ragionamento configurabile: gli sviluppatori possono selezionare basso, medio o alto sforzo di ragionamento per bilanciare latenza di risposta e calcolo rispetto alla qualità del ragionamento.
- Uso di strumenti agentici: il modello supporta workflow che includono chiamata di funzioni, navigazione web, esecuzione Python e output strutturati quando il runtime di serving espone tali strumenti.
- Personalizzazione a pesi aperti: la licenza Apache 2.0 consente ampie modifiche e distribuzione commerciale, nel rispetto della policy d’uso di gpt-oss.
- Distribuzione locale e privata: il modello è pensato per essere eseguito su infrastrutture controllate dagli sviluppatori, incluse ambienti locali o privati.
- Contesto lungo: la documentazione del modello di produzione elenca una finestra di contesto di 131.072 token e un limite massimo di token in output di 131.072.
Prestazioni nei benchmark di gpt-oss-20b
I risultati di valutazione pubblicati da OpenAI mostrano che gpt-oss-20b è particolarmente forte nel ragionamento matematico e nel coding in rapporto alle sue dimensioni. Con alto sforzo di ragionamento e strumenti, raggiunge 98,7% su AIME 2025, 96,0% su AIME 2024, 60,7% su SWE-Bench Verified e 54,8% su Tau-Bench Retail. Nelle valutazioni di conoscenza e ragionamento, OpenAI riporta 85,3% su MMLU, 71,5% su GPQA Diamond senza strumenti e 17,3% su Humanity's Last Exam con strumenti. I risultati variano in modo sostanziale in funzione dello sforzo di ragionamento e dell’accesso agli strumenti, quindi questi numeri non dovrebbero essere considerati tassi di accuratezza universali in produzione.
| Benchmark | Risultato gpt-oss-20b | Condizione di valutazione |
|---|---|---|
| AIME 2024 | 96,0% | Alto livello di ragionamento, con strumenti |
| AIME 2025 | 98,7% | Alto livello di ragionamento, con strumenti |
| GPQA Diamond | 71,5% | Alto livello di ragionamento, senza strumenti |
| MMLU | 85,3% | Alto livello di ragionamento |
| SWE-Bench Verified | 60,7% | Alto livello di ragionamento |
| Tau-Bench Retail | 54,8% | Alto livello di ragionamento |
| Humanity's Last Exam | 17,3% | Alto livello di ragionamento, con strumenti |
Il confronto interno di OpenAI colloca gpt-oss-20b vicino a o3-mini in diverse categorie di valutazione, mentre il più grande gpt-oss-120b ha generalmente un vantaggio in termini di conoscenza ampia e carichi di lavoro agentici.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Modello | Vantaggio principale | Contesto | Miglior impiego |
|---|---|---|---|
| gpt-oss-20b | Ragionamento efficiente a pesi aperti | 131K | Inferenza locale, codifica/scrittura di codice, matematica, agenti specializzati |
| gpt-oss-120b | Capacità complessive superiori | 131K | Carichi di lavoro di ragionamento più esigenti e produzione |
| o3-mini | Modello proprietario di ragionamento | Variabile per distribuzione | Ragionamento gestito quando non sono richiesti pesi aperti |
La differenza pratica è il controllo sulla distribuzione. gpt-oss-20b è la scelta migliore quando gli sviluppatori necessitano di pesi aperti, esecuzione locale/privata, personalizzazione o requisiti hardware relativamente modesti. gpt-oss-120b è preferibile quando prestazioni complessive superiori in termini di ragionamento e conoscenza giustificano un’impronta di distribuzione maggiore.
Limitazioni di gpt-oss-20b
gpt-oss-20b è solo testo e non accetta nativamente input di immagini, audio o video. Il numero inferiore di parametri crea anche un divario prestazionale in alcune valutazioni a elevato contenuto di conoscenza e agentiche rispetto a gpt-oss-120b. Inoltre, la distribuzione a pesi aperti trasferisce maggiori responsabilità operative allo sviluppatore: hosting, scalabilità, monitoraggio, controlli di sicurezza e configurazione del runtime non vengono gestiti nello stesso modo di un’API proprietaria completamente gestita.
OpenAI osserva inoltre che i modelli a pesi aperti hanno un profilo di sicurezza diverso rispetto ai modelli ospitati perché gli sviluppatori possono modificare o effettuare fine-tuning dei pesi. Le distribuzioni in produzione dovrebbero quindi aggiungere adeguate salvaguardie a livello di applicazione e controlli di accesso.
Casi d’uso per gpt-oss-20b
gpt-oss-20b è particolarmente adatto a:
- Assistenti di coding locali in cui gli sviluppatori desiderano ragionamento e generazione di codice senza inviare il codice a un modello proprietario ospitato.
- Ragionamento matematico e tecnico in cui è possibile abilitare un alto sforzo di ragionamento per problemi difficili.
- Carichi di lavoro aziendali privati che richiedono distribuzione in un ambiente controllato.
- Agenti che usano strumenti che combinano il modello con chiamata di funzioni, esecuzione Python, ricerca web o strumenti specifici dell’applicazione.
- Assistenti di dominio con fine-tuning in cui i pesi aperti sono più preziosi dell’accesso a un modello proprietario gestito.
- Inferenza con risorse limitate in cui l’obiettivo di circa 16 GB di memoria abilitato dalla quantizzazione MXFP4 è importante.
Accesso a gpt-oss-20b tramite CometAPI
CometAPI attualmente elenca gpt-oss-20b-free come modello OpenAI e lo descrive come un modello MoE open source da 21B parametri con 3,6B di parametri attivi e un contesto di classe 128K. È gratuito da utilizzare ed espone il modello tramite l’API unificata di CometAPI. Il changelog di CometAPI afferma che il modello segue il formato standard della chat di OpenAI.
Per l’integrazione con CometAPI, il flusso generale è creare una chiave CometAPI, utilizzare la base URL di CometAPI e inviare il nome del modello nella richiesta. CometAPI documenta un’integrazione compatibile con l’SDK di OpenAI e attualmente indica https://api.cometapi.com/v1 come URL base per l’avvio rapido.