Especificaciones técnicas de gpt-oss-20b-free
| Especificación | gpt-oss-20b |
|---|---|
| Proveedor | OpenAI |
| Familia de modelos | Modelos de razonamiento de pesos abiertos gpt-oss |
| Modelo | gpt-oss-20b-free |
| ID del modelo en CometAPI | gpt-oss-20b-free |
| Arquitectura | Mezcla de expertos (MoE) |
| Parámetros totales | 21B |
| Parámetros activos | 3.6B |
| Ventana de contexto | 131,072 tokens |
| Máximo de tokens de salida | 131,072 |
| Entrada / salida | Texto de entrada, texto de salida |
| Esfuerzo de razonamiento | Bajo, medio, alto |
| Licencia | Apache 2.0, sujeta a la política de uso de gpt-oss |
| Llamadas a funciones | Compatible |
| Salidas estructuradas | Compatible |
| Streaming | Compatible |
| Ajuste fino | Compatible mediante herramientas/infraestructura abiertas |
| Objetivo de implementación nativa | Local, edge, infraestructura privada o inferencia alojada |
| Corte de conocimiento | 1 de junio de 2024 |
¿Qué es gpt-oss-20b?
gpt-oss-20b es el modelo de razonamiento de pesos abiertos más pequeño de la familia gpt-oss de OpenAI. CometAPI también ofrece el uso gratuito de gpt-oss-20b; el ID es gpt-oss-20b-free. Tiene 21 mil millones de parámetros totales, pero activa alrededor de 3,6 mil millones de parámetros por paso hacia adelante, utilizando una arquitectura de Mezcla de expertos para reducir los requisitos de inferencia manteniendo una capacidad de razonamiento sustancial. OpenAI lo posiciona para cargas de trabajo locales, especializadas y de menor latencia, en lugar de como un reemplazo directo de sus modelos propietarios más grandes.
El modelo es solo de texto y está diseñado para el razonamiento y flujos de trabajo agénticos. Sus pesos abiertos pueden descargarse, personalizarse, ajustarse finamente y desplegarse en infraestructura controlada por el desarrollador. OpenAI y Hugging Face documentan una cuantización MXFP4 nativa que permite ejecutar el modelo con alrededor de 16 GB de memoria, lo que lo hace inusualmente accesible para un modelo de esta clase de parámetros.
Principales características de gpt-oss-20b
- Arquitectura MoE eficiente: 21B de parámetros totales con solo 3.6B de parámetros activos por paso, orientada a menor latencia y menores requisitos de despliegue.
- Razonamiento configurable: los desarrolladores pueden seleccionar esfuerzo de razonamiento bajo, medio o alto para intercambiar latencia de respuesta y cómputo por calidad de razonamiento.
- Uso agentivo de herramientas: el modelo admite flujos de trabajo que incluyen llamadas a funciones, navegación web, ejecución de Python y salidas estructuradas cuando el runtime de servicio expone esas herramientas.
- Personalización de pesos abiertos: la licencia Apache 2.0 permite amplias modificaciones y despliegue comercial, sujeto a la política de uso de gpt-oss.
- Despliegue local y privado: el modelo está destinado a ejecutarse en infraestructura controlada por los desarrolladores, incluidos entornos local o privado.
- Contexto largo: la documentación del modelo en producción indica una ventana de contexto de 131,072 tokens y un límite máximo de salida de 131,072 tokens.
Rendimiento en benchmarks de gpt-oss-20b
Los resultados de evaluación publicados por OpenAI muestran que gpt-oss-20b es particularmente sólido en razonamiento matemático y programación en relación con su tamaño. Con esfuerzo de razonamiento alto y herramientas, alcanza el 98.7% en AIME 2025, el 96.0% en AIME 2024, el 60.7% en SWE-Bench Verified y el 54.8% en Tau-Bench Retail. En evaluaciones de conocimiento y razonamiento, OpenAI informa un 85.3% en MMLU, un 71.5% en GPQA Diamond sin herramientas y un 17.3% en Humanity's Last Exam con herramientas. Los resultados varían sustancialmente con el esfuerzo de razonamiento y el acceso a herramientas, por lo que estos números no deben tratarse como tasas universales de precisión en producción.
| Benchmark | Resultado de gpt-oss-20b | Condición de evaluación |
|---|---|---|
| AIME 2024 | 96.0% | Razonamiento alto, con herramientas |
| AIME 2025 | 98.7% | Razonamiento alto, con herramientas |
| GPQA Diamond | 71.5% | Razonamiento alto, sin herramientas |
| MMLU | 85.3% | Razonamiento alto |
| SWE-Bench Verified | 60.7% | Razonamiento alto |
| Tau-Bench Retail | 54.8% | Razonamiento alto |
| Humanity's Last Exam | 17.3% | Razonamiento alto, con herramientas |
La propia comparación de OpenAI sitúa gpt-oss-20b cerca de o3-mini en varias categorías de evaluación, mientras que el mayor gpt-oss-120b generalmente tiene ventaja en conocimiento amplio y cargas de trabajo agénticas.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Modelo | Ventaja principal | Contexto | Mejor encaje |
|---|---|---|---|
| gpt-oss-20b | Razonamiento eficiente con pesos abiertos | 131K | Inferencia local, programación, matemáticas, agentes especializados |
| gpt-oss-120b | Capacidad general superior | 131K | Razonamiento más exigente y cargas de producción |
| o3-mini | Modelo de razonamiento propietario | Varía según la implementación | Razonamiento gestionado cuando no se requieren pesos abiertos |
La distinción práctica es el control del despliegue. gpt-oss-20b es la mejor opción cuando los desarrolladores necesitan pesos abiertos, ejecución local/privada, personalización o requisitos de hardware relativamente modestos. gpt-oss-120b es preferible cuando una mayor capacidad general de razonamiento y conocimiento justifica una huella de despliegue mayor.
Limitaciones de gpt-oss-20b
gpt-oss-20b es solo de texto y no acepta de forma nativa entradas de imagen, audio o video. Su menor recuento de parámetros también crea una brecha de rendimiento en algunas evaluaciones con alto contenido de conocimiento y cargas agénticas en comparación con gpt-oss-120b. Además, el despliegue con pesos abiertos transfiere más responsabilidad operativa al desarrollador: alojamiento, escalado, monitorización, controles de seguridad y configuración del runtime no se gestionan del mismo modo que en una API propietaria totalmente gestionada.
OpenAI también señala que los modelos de pesos abiertos tienen un perfil de seguridad diferente al de los modelos alojados, porque los desarrolladores pueden modificar o ajustar los pesos. Por lo tanto, los despliegues en producción deben añadir las salvaguardas y controles de acceso adecuados a nivel de aplicación.
Casos de uso de gpt-oss-20b
gpt-oss-20b es especialmente adecuado para:
- Asistentes locales de programación, cuando los desarrolladores quieren razonamiento y generación de código sin enviar el código a un modelo propietario alojado.
- Razonamiento matemático y técnico, donde puede habilitarse un alto esfuerzo de razonamiento para problemas difíciles.
- Cargas de trabajo empresariales privadas que requieren despliegue dentro de un entorno controlado.
- Agentes con uso de herramientas que combinan el modelo con llamadas a funciones, ejecución de Python, búsqueda web o herramientas específicas de la aplicación.
- Asistentes de dominio ajustados finamente, donde los pesos abiertos son más valiosos que el acceso a un modelo propietario gestionado.
- Inferencia con recursos restringidos, donde el objetivo de memoria de aproximadamente 16 GB habilitado por la cuantización MXFP4 es importante.
Acceso a gpt-oss-20b a través de CometAPI
CometAPI actualmente lista gpt-oss-20b-free como un modelo de OpenAI y lo describe como un modelo MoE de código abierto de 21B parámetros con 3.6B de parámetros activos y un contexto de clase 128K. Es de uso gratuito y expone el modelo a través de la API unificada de CometAPI. El registro de cambios de CometAPI indica que el modelo sigue el formato estándar de chat de OpenAI.
Para la integración con CometAPI, el flujo general es crear una clave de CometAPI, usar la URL base de CometAPI y enviar el nombre del modelo en la solicitud. CometAPI documenta una integración compatible con el OpenAI SDK y actualmente lista https://api.cometapi.com/v1 como la URL base de inicio rápido.