Spécifications techniques de gpt-oss-20b-free
| Spécification | gpt-oss-20b |
|---|---|
| Fournisseur | OpenAI |
| Famille de modèles | Modèles de raisonnement à poids ouverts gpt-oss |
| Modèle | gpt-oss-20b-free |
| ID du modèle dans CometAPI | gpt-oss-20b-free |
| Architecture | Mélange d'experts (MoE) |
| Paramètres totaux | 21B |
| Paramètres actifs | 3.6B |
| Fenêtre de contexte | 131,072 tokens |
| Jetons de sortie maximum | 131,072 |
| Entrée / sortie | Texte en entrée, texte en sortie |
| Effort de raisonnement | Faible, moyen, élevé |
| Licence | Apache 2.0, sous réserve de la politique d'utilisation de gpt-oss |
| Appel de fonctions | Pris en charge |
| Sorties structurées | Pris en charge |
| Diffusion en continu | Pris en charge |
| Ajustement fin | Pris en charge via des outils/une infrastructure ouverts |
| Cible de déploiement native | Local, périphérie, infrastructure privée ou inférence hébergée |
| Date de coupure des connaissances | 1 juin 2024 |
Qu'est-ce que gpt-oss-20b ?
gpt-oss-20b est le plus petit modèle de raisonnement à poids ouverts d'OpenAI dans la famille gpt-oss. CometAPI propose également l'utilisation gratuite de gpt-oss-20b ; l'ID est gpt-oss-20b-free. Il compte 21 milliards de paramètres au total mais n'active qu'environ 3.6 milliards de paramètres par passage avant, en utilisant une architecture Mixture-of-Experts pour réduire les besoins d'inférence tout en conservant une capacité de raisonnement substantielle. OpenAI le positionne pour des charges de travail locales, à faible latence et spécialisées, plutôt que comme un remplacement direct de ses plus grands modèles propriétaires.
Le modèle est uniquement textuel et conçu pour le raisonnement et les flux de travail agentiques. Ses poids ouverts peuvent être téléchargés, personnalisés, affinés et déployés sur une infrastructure contrôlée par le développeur. OpenAI et Hugging Face documentent une quantification native MXFP4 qui permet au modèle de fonctionner avec environ 16 GB de mémoire, le rendant exceptionnellement accessible pour un modèle de cette taille de paramètres.
Principales fonctionnalités de gpt-oss-20b
- Architecture MoE efficace : 21B de paramètres au total, avec seulement 3.6B de paramètres actifs par passage avant, visant une latence plus faible et des exigences de déploiement réduites.
- Raisonnement configurable : les développeurs peuvent sélectionner un effort de raisonnement faible, moyen ou élevé pour mettre en balance la latence de réponse et le calcul avec la qualité du raisonnement.
- Utilisation d'outils par des agents : le modèle prend en charge des flux de travail impliquant des appels de fonctions, la navigation web, l'exécution Python et des sorties structurées lorsque l'environnement d'exécution expose ces outils.
- Personnalisation à poids ouverts : la licence Apache 2.0 permet de larges modifications et un déploiement commercial, sous réserve de la politique d'utilisation de gpt-oss.
- Déploiement local et privé : le modèle est conçu pour fonctionner sur une infrastructure contrôlée par les développeurs, y compris des environnements locaux ou privés.
- Contexte long : la documentation du modèle de production indique une fenêtre de contexte de 131,072 jetons et une limite maximale de 131,072 jetons de sortie.
Performances sur benchmarks de gpt-oss-20b
Les résultats d'évaluation publiés par OpenAI montrent que gpt-oss-20b est particulièrement performant en raisonnement mathématique et en programmation au regard de sa taille. Avec un effort de raisonnement élevé et des outils, il atteint 98.7% sur AIME 2025, 96.0% sur AIME 2024, 60.7% sur SWE-Bench Verified, et 54.8% sur Tau-Bench Retail. Sur les évaluations de connaissances et de raisonnement, OpenAI rapporte 85.3% sur MMLU, 71.5% sur GPQA Diamond sans outils, et 17.3% sur Humanity's Last Exam avec outils. Les résultats varient sensiblement selon l'effort de raisonnement et l'accès aux outils ; ces chiffres ne doivent donc pas être considérés comme des taux d'exactitude universels en production.
| Benchmark | Résultat de gpt-oss-20b | Condition d'évaluation |
|---|---|---|
| AIME 2024 | 96.0% | Raisonnement élevé, avec outils |
| AIME 2025 | 98.7% | Raisonnement élevé, avec outils |
| GPQA Diamond | 71.5% | Raisonnement élevé, sans outils |
| MMLU | 85.3% | Raisonnement élevé |
| SWE-Bench Verified | 60.7% | Raisonnement élevé |
| Tau-Bench Retail | 54.8% | Raisonnement élevé |
| Humanity's Last Exam | 17.3% | Raisonnement élevé, avec outils |
La propre comparaison d'OpenAI place gpt-oss-20b proche de o3-mini sur plusieurs catégories d'évaluation, tandis que le plus grand gpt-oss-120b a généralement un avantage sur les connaissances générales et les charges de travail agentiques.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Modèle | Atout principal | Contexte | Meilleure adéquation |
|---|---|---|---|
| gpt-oss-20b | Raisonnement à poids ouverts efficace | 131K | Inférence locale, codage, mathématiques, agents spécialisés |
| gpt-oss-120b | Capacité globale supérieure | 131K | Raisonnement plus exigeant et charges de travail de production |
| o3-mini | Modèle de raisonnement propriétaire | Variable selon le déploiement | Raisonnement géré lorsque les poids ouverts ne sont pas requis |
La différence pratique réside dans le contrôle du déploiement. gpt-oss-20b est le meilleur choix lorsque les développeurs ont besoin de poids ouverts, d'une exécution locale/privée, de personnalisation, ou d'exigences matérielles relativement modestes. gpt-oss-120b est préférable lorsque des performances supérieures en raisonnement et en connaissances justifient une empreinte de déploiement plus importante.
Limites de gpt-oss-20b
gpt-oss-20b est uniquement textuel et n'accepte pas nativement des entrées image, audio ou vidéo. Son nombre de paramètres plus réduit crée également un écart de performance sur certaines évaluations riches en connaissances et agentiques par rapport à gpt-oss-120b. En outre, le déploiement à poids ouverts transfère davantage de responsabilités opérationnelles au développeur : l'hébergement, la mise à l'échelle, la supervision, les contrôles de sécurité et la configuration à l'exécution ne sont pas gérés de la même manière qu'une API propriétaire entièrement managée.
OpenAI note également que les modèles à poids ouverts ont un profil de sécurité différent des modèles hébergés, car les développeurs peuvent modifier ou affiner les poids. Les déploiements en production devraient donc ajouter des garde-fous appropriés au niveau applicatif et des contrôles d'accès.
Cas d'utilisation de gpt-oss-20b
gpt-oss-20b convient particulièrement à :
- Assistants de codage locaux où les développeurs souhaitent du raisonnement et de la génération de code sans envoyer le code à un modèle propriétaire hébergé.
- Raisonnement mathématique et technique où un effort de raisonnement élevé peut être activé pour des problèmes difficiles.
- Charges de travail d'entreprise privées nécessitant un déploiement dans un environnement contrôlé.
- Agents utilisant des outils combinant le modèle avec des appels de fonctions, l'exécution Python, la recherche web ou des outils applicatifs spécifiques.
- Assistants de domaine affinés où des poids ouverts sont plus précieux que l'accès à un modèle propriétaire managé.
- Inférence sous contraintes de ressources où l'objectif d'environ 16 GB de mémoire rendu possible par la quantification MXFP4 est important.
Accéder à gpt-oss-20b via CometAPI
CometAPI répertorie actuellement gpt-oss-20b-free comme un modèle OpenAI et le décrit comme un modèle MoE open-source de 21B paramètres avec 3.6B de paramètres actifs et un contexte de classe 128K. Il est gratuit à utiliser et expose le modèle via l'API unifiée de CometAPI. Le journal des modifications de CometAPI indique que le modèle suit le format standard de chat d'OpenAI.
Pour l'intégration CometAPI, le flux général consiste à créer une clé CometAPI, utiliser l'URL de base CometAPI et envoyer le nom du modèle dans la requête. CometAPI documente une intégration compatible avec l'OpenAI SDK et répertorie actuellement https://api.cometapi.com/v1 comme URL de base du démarrage rapide.