Especificações técnicas do gpt-oss-20b-free
| Especificação | gpt-oss-20b |
|---|---|
| Provedor | OpenAI |
| Família de modelos | modelos gpt-oss de raciocínio com pesos abertos |
| Modelo | gpt-oss-20b-free |
| ID do modelo no CometAPI | gpt-oss-20b-free |
| Arquitetura | Mixture of Experts (MoE) |
| Parâmetros totais | 21B |
| Parâmetros ativos | 3.6B |
| Janela de contexto | 131,072 tokens |
| Máximo de tokens de saída | 131,072 |
| Entrada / saída | Texto de entrada, texto de saída |
| Esforço de raciocínio | Baixo, médio, alto |
| Licença | Apache 2.0, sujeito à política de uso do gpt-oss |
| Chamadas de função | Suportadas |
| Saídas estruturadas | Suportadas |
| Streaming | Suportado |
| Ajuste fino | Suportado por meio de ferramentas/infraestrutura abertas |
| Destino de implantação nativo | Local, borda (edge), infraestrutura privada ou inferência hospedada |
| Corte de conhecimento | 1º de junho de 2024 |
O que é o gpt-oss-20b?
gpt-oss-20b é o menor modelo de raciocínio de pesos abertos da OpenAI na família gpt-oss. A CometAPI também oferece uso gratuito do gpt-oss-20b; o ID é gpt-oss-20b-free. Ele tem 21 bilhões de parâmetros totais, mas ativa cerca de 3,6 bilhões de parâmetros por passada direta, usando uma arquitetura Mixture-of-Experts para reduzir os requisitos de inferência enquanto mantém uma capacidade de raciocínio substancial. A OpenAI o posiciona para cargas de trabalho locais e especializadas com menor latência, em vez de como um substituto direto para seus maiores modelos proprietários.
O modelo é somente texto e foi projetado para raciocínio e fluxos de trabalho orientados a agentes. Seus pesos abertos podem ser baixados, personalizados, ajustados finamente e implantados em infraestrutura controlada pelo desenvolvedor. A OpenAI e a Hugging Face documentam a quantização nativa MXFP4 que permite rodar o modelo com cerca de 16 GB de memória, tornando-o incomumente acessível para um modelo nessa classe de parâmetros.
Principais recursos do gpt-oss-20b
- Arquitetura MoE eficiente: 21B de parâmetros totais com apenas 3,6B de parâmetros ativos por passada, visando menor latência e menores requisitos de implantação.
- Raciocínio configurável: desenvolvedores podem selecionar esforço de raciocínio baixo, médio ou alto para equilibrar latência e computação com a qualidade do raciocínio.
- Uso de ferramentas por agentes: o modelo suporta fluxos de trabalho envolvendo chamadas de função, navegação na web, execução de Python e saídas estruturadas quando o runtime de serving expõe essas ferramentas.
- Personalização com pesos abertos: a licença Apache 2.0 permite ampla modificação e implantação comercial, sujeita à política de uso do gpt-oss.
- Implantação local e privada: o modelo foi concebido para rodar em infraestrutura controlada por desenvolvedores, incluindo ambientes locais ou privados.
- Contexto longo: a documentação do modelo de produção lista uma janela de contexto de 131.072 tokens e um limite máximo de 131.072 tokens de saída.
Desempenho em benchmarks do gpt-oss-20b
Os resultados de avaliação publicados pela OpenAI mostram que o gpt-oss-20b é particularmente forte em raciocínio matemático e programação em relação ao seu tamanho. Com esforço de raciocínio alto e uso de ferramentas, ele alcança 98,7% no AIME 2025, 96,0% no AIME 2024, 60,7% no SWE-Bench Verified e 54,8% no Tau-Bench Retail. Em avaliações de conhecimento e raciocínio, a OpenAI reporta 85,3% no MMLU, 71,5% no GPQA Diamond sem ferramentas e 17,3% no Humanity's Last Exam com ferramentas. Os resultados variam substancialmente com o esforço de raciocínio e o acesso a ferramentas, portanto esses números não devem ser tratados como taxas de acurácia universais em produção.
| Benchmark | resultado do gpt-oss-20b | Condição de avaliação |
|---|---|---|
| AIME 2024 | 96,0% | Esforço alto, com ferramentas |
| AIME 2025 | 98,7% | Esforço alto, com ferramentas |
| GPQA Diamond | 71,5% | Esforço alto, sem ferramentas |
| MMLU | 85,3% | Esforço alto |
| SWE-Bench Verified | 60,7% | Esforço alto |
| Tau-Bench Retail | 54,8% | Esforço alto |
| Humanity's Last Exam | 17,3% | Esforço alto, com ferramentas |
A própria comparação da OpenAI posiciona o gpt-oss-20b próximo ao o3-mini em várias categorias de avaliação, enquanto o maior gpt-oss-120b geralmente tem vantagem em conhecimento amplo e cargas de trabalho orientadas a agentes.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Modelo | Vantagem principal | Contexto | Melhor adequação |
|---|---|---|---|
| gpt-oss-20b | Raciocínio eficiente com pesos abertos | 131K | Inferência local, programação, matemática, agentes especializados |
| gpt-oss-120b | Capacidade geral superior | 131K | Raciocínio mais exigente e cargas de trabalho de produção |
| o3-mini | Modelo de raciocínio proprietário | Varia conforme a implantação | Raciocínio gerenciado quando pesos abertos não são necessários |
A distinção prática é o controle de implantação. O gpt-oss-20b é a melhor escolha quando os desenvolvedores precisam de pesos abertos, execução local/privada, personalização ou requisitos de hardware relativamente modestos. O gpt-oss-120b é preferível quando a maior capacidade geral de raciocínio e conhecimento justifica uma pegada de implantação maior.
Limitações do gpt-oss-20b
O gpt-oss-20b é somente texto e não aceita nativamente entradas de imagem, áudio ou vídeo. Sua contagem menor de parâmetros também cria uma lacuna de desempenho em algumas avaliações intensivas em conhecimento e orientadas a agentes quando comparado ao gpt-oss-120b. Além disso, a implantação com pesos abertos transfere mais responsabilidade operacional para o desenvolvedor: hospedagem, escalabilidade, monitoramento, controles de segurança e configuração de runtime não são tratados da mesma forma que em uma API proprietária totalmente gerenciada.
A OpenAI também observa que modelos de pesos abertos têm um perfil de segurança diferente de modelos hospedados porque os desenvolvedores podem modificar ou ajustar finamente os pesos. Implantações em produção devem, portanto, adicionar proteções apropriadas em nível de aplicação e controles de acesso.
Casos de uso do gpt-oss-20b
gpt-oss-20b é uma ótima opção para:
- Assistentes locais de programação, nos quais os desenvolvedores desejam raciocínio e geração de código sem enviar o código para um modelo proprietário hospedado.
- Raciocínio matemático e técnico, em que o esforço de raciocínio alto pode ser habilitado para problemas difíceis.
- Cargas de trabalho corporativas privadas que exigem implantação dentro de um ambiente controlado.
- Agentes que usam ferramentas, combinando o modelo com chamadas de função, execução de Python, busca na web ou ferramentas específicas do aplicativo.
- Assistentes de domínio com ajuste fino, em que pesos abertos são mais valiosos do que o acesso a um modelo proprietário gerenciado.
- Inferência com restrições de recursos, em que a meta de aproximadamente 16 GB de memória viabilizada pela quantização MXFP4 é importante.
Acessando o gpt-oss-20b por meio do CometAPI
Atualmente, o CometAPI lista gpt-oss-20b-free como um modelo da OpenAI e o descreve como um modelo MoE de código aberto com 21B de parâmetros e 3,6B de parâmetros ativos e um contexto de classe 128K. É gratuito para uso e expõe o modelo por meio da API unificada do CometAPI. O registro de alterações do CometAPI afirma que o modelo segue o formato padrão de chat da OpenAI.
Para integração com o CometAPI, o fluxo geral é criar uma chave do CometAPI, usar a URL base do CometAPI e enviar o nome do modelo na solicitação. O CometAPI documenta uma integração compatível com o SDK da OpenAI e atualmente lista https://api.cometapi.com/v1 como a URL base do quickstart.