Технические характеристики gpt-oss-20b-free
| Спецификация | gpt-oss-20b |
|---|---|
| Провайдер | OpenAI |
| Семейство моделей | gpt-oss open-weight reasoning models |
| Модель | gpt-oss-20b-free |
| ID модели в CometAPI | gpt-oss-20b-free |
| Архитектура | Смесь экспертов (MoE) |
| Общее число параметров | 21B |
| Активные параметры | 3.6B |
| Контекстное окно | 131,072 tokens |
| Максимальное число выходных токенов | 131,072 |
| Ввод / вывод | Текст на вход, текст на выход |
| Уровень рассуждений | Низкий, средний, высокий |
| Лицензия | Apache 2.0, в соответствии с политикой использования gpt-oss |
| Вызов функций | Поддерживается |
| Структурированные ответы | Поддерживаются |
| Потоковая передача | Поддерживается |
| Дообучение | Поддерживается через открытые инструменты/инфраструктуру |
| Целевой вариант развертывания | Локально, на периферии, частная инфраструктура или размещённый inference |
| Срез знаний | June 1, 2024 |
Что такое gpt-oss-20b?
gpt-oss-20b — меньшая модель рассуждений с открытыми весами от OpenAI в семействе gpt-oss. CometAPI также предлагает бесплатный доступ к gpt-oss-20b; идентификатор — gpt-oss-20b-free. У неё 21 миллиард общих параметров, но активируется около 3.6 миллиарда параметров на проход благодаря архитектуре Mixture of Experts, что снижает требования к инференсу при сохранении существенной способности к рассуждению. OpenAI позиционирует её для задач с более низкой задержкой, локальных и специализированных рабочих нагрузок, а не как прямую замену своих крупнейших проприетарных моделей.
Модель работает только с текстом и предназначена для рассуждений и агентных сценариев. Её открытые веса можно загрузить, настраивать, дообучать и развёртывать на инфраструктуре под контролем разработчика. OpenAI и Hugging Face документируют нативную квантизацию MXFP4, позволяющую запускать модель примерно в пределах 16 GB памяти, что делает её необычно доступной для класса с таким числом параметров.
Основные возможности gpt-oss-20b
- Эффективная архитектура MoE: 21B общих параметров при 3.6B активных параметров на проход — для снижения задержки и требований к развёртыванию.
- Настраиваемые рассуждения: Разработчики могут выбирать низкий, средний или высокий уровень усилий на рассуждение, балансируя задержку и вычисления с качеством рассуждений.
- Агентное использование инструментов: Модель поддерживает рабочие процессы с вызовом функций, веб-браузингом, выполнением Python и структурированными ответами, если среда сервинга предоставляет эти инструменты.
- Кастомизация с открытыми весами: Лицензия Apache 2.0 допускает широкую модификацию и коммерческое развёртывание при соблюдении политики использования gpt-oss.
- Локальное и приватное развёртывание: Модель предназначена для запуска на инфраструктуре разработчиков, включая локальные и частные окружения.
- Длинный контекст: В документации производственной модели указано контекстное окно в 131,072 токена и лимит на вывод в 131,072 токена.
Результаты бенчмарков gpt-oss-20b
Опубликованные OpenAI результаты оценок показывают, что gpt-oss-20b особенно сильна в математических рассуждениях и программировании относительно своего размера. На высоком уровне рассуждений с инструментами она достигает 98.7% на AIME 2025, 96.0% на AIME 2024, 60.7% на SWE-Bench Verified и 54.8% на Tau-Bench Retail. На оценках знаний и рассуждений OpenAI сообщает 85.3% на MMLU, 71.5% на GPQA Diamond без инструментов и 17.3% на Humanity's Last Exam с инструментами. Результаты существенно зависят от уровня рассуждений и доступа к инструментам, поэтому эти числа не следует считать универсальными показателями точности в продакшене.
| Бенчмарк | Результат gpt-oss-20b | Условия оценки |
|---|---|---|
| AIME 2024 | 96.0% | Высокий уровень, с инструментами |
| AIME 2025 | 98.7% | Высокий уровень, с инструментами |
| GPQA Diamond | 71.5% | Высокий уровень, без инструментов |
| MMLU | 85.3% | Высокий уровень |
| SWE-Bench Verified | 60.7% | Высокий уровень |
| Tau-Bench Retail | 54.8% | Высокий уровень |
| Humanity's Last Exam | 17.3% | Высокий уровень, с инструментами |
Собственное сравнение OpenAI помещает gpt-oss-20b близко к o3-mini в нескольких категориях оценок, тогда как более крупная gpt-oss-120b в целом имеет преимущество в области широких знаний и агентных рабочих нагрузок.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Модель | Основное преимущество | Контекст | Оптимальное применение |
|---|---|---|---|
| gpt-oss-20b | Эффективные рассуждения с открытыми весами | 131K | Локальный инференс, кодинг, математика, специализированные агенты |
| gpt-oss-120b | Более высокая общая способность | 131K | Более требовательные рассуждения и продакшн-нагрузки |
| o3-mini | Проприетарная модель рассуждений | Зависит от развёртывания | Управляемые рассуждения, когда открытые веса не требуются |
Практическое различие — контроль над развёртыванием. gpt-oss-20b — лучший выбор, когда разработчикам нужны открытые веса, локальное/частное выполнение, кастомизация или относительно скромные аппаратные требования. gpt-oss-120b предпочтительнее, когда более высокие способности в рассуждениях и знаниях оправдывают больший след развёртывания.
Ограничения gpt-oss-20b
gpt-oss-20b работает только с текстом и не принимает изображения, аудио или видео. Меньшее число параметров также создаёт разрыв в производительности на некоторых знания-ёмких и агентных оценках по сравнению с gpt-oss-120b. Кроме того, развёртывание с открытыми весами переносит больше операционной ответственности на разработчика: хостинг, масштабирование, мониторинг, средства безопасности и конфигурация рантайма не предоставляются так же, как в полностью управляемом проприетарном API.
OpenAI также отмечает, что модели с открытыми весами имеют иной профиль безопасности по сравнению с хостинговыми моделями, поскольку разработчики могут модифицировать или дообучать веса. Поэтому в продакшн-развёртываниях следует добавлять соответствующие средства защиты на уровне приложения и контроль доступа.
Сценарии использования gpt-oss-20b
gpt-oss-20b хорошо подходит для:
- Локальных ассистентов по программированию, когда разработчики хотят рассуждения и генерацию кода без отправки кода в проприетарную хостинговую модель.
- Математических и технических рассуждений, где для сложных задач можно включать высокий уровень усилий на рассуждение.
- Приватных корпоративных нагрузок, требующих развёртывания внутри контролируемой среды.
- Агентов с инструментами, сочетающих модель с вызовом функций, выполнением Python, веб-поиском или приложенческими инструментами.
- Дообученных доменных ассистентов, когда открытые веса ценнее, чем доступ к управляемой проприетарной модели.
- Инференса с ограниченными ресурсами, где важна целевая потребность в памяти около 16 GB, обеспечиваемая квантизацией MXFP4.
Доступ к gpt-oss-20b через CometAPI
В CometAPI в настоящее время указан gpt-oss-20b-free как модель OpenAI и он описан как 21B-параметрическая открытая MoE-модель с 3.6B активных параметров и контекстом класса 128K. Модель доступна бесплатно и предоставляется через унифицированный API CometAPI. В журнале изменений CometAPI указано, что модель следует стандартному формату чатов OpenAI.
Для интеграции с CometAPI общий порядок таков: создать ключ CometAPI, использовать базовый URL CometAPI и передать имя модели в запросе. CometAPI документирует интеграцию, совместимую с OpenAI SDK, и в настоящее время указывает https://api.cometapi.com/v1 как базовый URL для быстрого старта.