gpt-oss-20b-free의 기술 사양
| 사양 | gpt-oss-20b |
|---|---|
| 제공자 | OpenAI |
| 모델 패밀리 | gpt-oss 공개 가중치 추론 모델 |
| 모델 | gpt-oss-20b-free |
| CometAPI의 모델 ID | gpt-oss-20b-free |
| 아키텍처 | 전문가 혼합(MoE) |
| 총 파라미터 | 21B |
| 활성 파라미터 | 3.6B |
| 컨텍스트 윈도우 | 131,072 토큰 |
| 최대 출력 토큰 | 131,072 |
| 입력 / 출력 | 텍스트 입력, 텍스트 출력 |
| 추론 강도 | 낮음, 중간, 높음 |
| 라이선스 | Apache 2.0, gpt-oss 사용 정책 적용 |
| 함수 호출 | 지원됨 |
| 구조화 출력 | 지원됨 |
| 스트리밍 | 지원됨 |
| 파인튜닝 | 오픈 툴링/인프라를 통해 지원됨 |
| 기본 배포 대상 | 로컬, 엣지, 프라이빗 인프라 또는 호스티드 추론 |
| 지식 컷오프 | 2024년 6월 1일 |
gpt-oss-20b란?
gpt-oss-20b는 gpt-oss 패밀리에서 OpenAI의 소형 공개 가중치 추론 모델입니다. CometAPI는 gpt-oss-20b의 무료 사용도 제공합니다. ID는 gpt-oss-20b-free입니다. 총 210억 파라미터를 가지지만, 한 번의 포워드 패스마다 약 36억 파라미터만 활성화합니다. 이는 전문가 혼합(MoE) 아키텍처를 사용해 추론 요구사항을 낮추면서도 상당한 추론 능력을 유지하기 위한 것입니다. OpenAI는 이를 자사 최대 규모의 독점 모델을 직접 대체하기보다는 낮은 지연, 로컬, 특화된 워크로드용으로 포지셔닝합니다.
이 모델은 텍스트 전용이며 추론 및 에이전트형 워크플로우를 위해 설계되었습니다. 오픈 가중치는 다운로드하여 커스터마이즈하고 파인튜닝한 뒤 개발자가 제어하는 인프라에 배포할 수 있습니다. OpenAI와 Hugging Face는 이 모델이 약 16 GB 메모리 내에서 동작하도록 하는 네이티브 MXFP4 양자화를 문서화하고 있으며, 이는 이 파라미터급 모델로서는 이례적으로 접근성을 높여줍니다.
gpt-oss-20b의 주요 기능
- 효율적인 MoE 아키텍처: 총 21B 파라미터 중 포워드 패스마다 3.6B만 활성화해 낮은 지연과 낮은 배포 요구사항을 목표로 합니다.
- 구성 가능한 추론: 개발자는 응답 지연과 컴퓨팅 대비 추론 품질을 저울질하기 위해 낮음, 중간, 높음의 추론 강도를 선택할 수 있습니다.
- 에이전트형 도구 사용: 서빙 런타임이 도구를 노출할 때 함수 호출, 웹 브라우징, Python 실행, 구조화 출력을 포함하는 워크플로우를 지원합니다.
- 오픈 가중치 커스터마이징: Apache 2.0 라이선스는 gpt-oss 사용 정책을 준수하는 범위에서 광범위한 수정 및 상업적 배포를 허용합니다.
- 로컬 및 프라이빗 배포: 모델은 로컬 또는 프라이빗 환경 등 개발자가 제어하는 인프라에서의 실행을 목표로 합니다.
- 긴 컨텍스트: 프로덕션 모델 문서에는 131,072-토큰 컨텍스트 윈도우와 131,072 최대 출력 토큰 한도가 기재되어 있습니다.
gpt-oss-20b의 벤치마크 성능
OpenAI가 공개한 평가 결과에 따르면, gpt-oss-20b는 크기 대비 수학적 추론 및 코딩에서 특히 강력합니다. 고강도 추론과 도구 사용 조건에서 AIME 2025에서 98.7%, AIME 2024에서 96.0%, SWE-Bench Verified에서 60.7%, Tau-Bench Retail에서 54.8%에 도달합니다. 지식 및 추論 평가에서는 MMLU 85.3%, 도구 없이 GPQA Diamond 71.5%, 도구 사용 시 Humanity's Last Exam 17.3%로 보고되었습니다. 결과는 추론 강도와 도구 접근성에 따라 크게 달라지므로, 이 수치들을 보편적인 프로덕션 정확도율로 간주해서는 안 됩니다.
| 벤치마크 | gpt-oss-20b 결과 | 평가 조건 |
|---|---|---|
| AIME 2024 | 96.0% | 고강도 추론, 도구 사용 |
| AIME 2025 | 98.7% | 고강도 추론, 도구 사용 |
| GPQA Diamond | 71.5% | 고강도 추論, 도구 없음 |
| MMLU | 85.3% | 고강도 추론 |
| SWE-Bench Verified | 60.7% | 고강도 추론 |
| Tau-Bench Retail | 54.8% | 고강도 추론 |
| Humanity's Last Exam | 17.3% | 고강도 추론, 도구 사용 |
OpenAI의 자체 비교에서는 gpt-oss-20b가 여러 평가 범주에서 o3-mini에 근접하며, 보다 큰 gpt-oss-120b는 광범위한 지식 및 에이전트형 워크로드에서 일반적으로 우위를 보입니다.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| 모델 | 주요 장점 | 컨텍스트 | 최적 용도 |
|---|---|---|---|
| gpt-oss-20b | 효율적인 공개 가중치 추론 | 131K | 로컬 추론, 코딩, 수학, 특화 에이전트 |
| gpt-oss-120b | 전반적 능력 향상 | 131K | 더 까다로운 추론 및 프로덕션 워크로드 |
| o3-mini | 독점 추론 모델 | 배포에 따라 다름 | 공개 가중치가 필요하지 않은 관리형 추론 |
실질적인 구분은 배포에 대한 통제입니다. gpt-oss-20b는 오픈 가중치, 로컬/프라이빗 실행, 커스터마이징, 비교적 낮은 하드웨어 요구사항이 필요할 때 더 적합합니다. gpt-oss-120b는 더 큰 배포 발자국을 감수하고서라도 더 높은 전반적 추론 및 지식 성능이 필요한 경우에 적합합니다.
gpt-oss-20b의 한계
gpt-oss-20b는 텍스트 전용이며 이미지, 오디오, 비디오 입력을 기본적으로 수용하지 않습니다. 또한 더 작은 파라미터 수로 인해, 일부 지식 집약적·에이전트형 평가에서는 gpt-oss-120b와 비교해 성능 격차가 존재합니다. 게다가 오픈 가중치 배포는 호스팅, 스케일링, 모니터링, 안전성 제어, 런타임 구성 등을 개발자가 직접 책임져야 하므로, 완전 관리형 독점 API와는 운영 방식이 다릅니다.
OpenAI는 또한, 개발자가 가중치를 수정하거나 파인튜닝할 수 있기 때문에 오픈 가중치 모델은 호스티드 모델과 다른 안전성 프로파일을 가진다고 명시합니다. 따라서 프로덕션 배포에서는 적절한 애플리케이션 수준의 안전장치와 접근 제어를 추가해야 합니다.
gpt-oss-20b의 활용 사례
gpt-oss-20b는 다음에 특히 적합합니다.
- 로컬 코딩 어시스턴트: 코드를 독점 호스티드 모델로 전송하지 않고도 추론 및 코드 생성을 원하는 경우
- 수학적·기술적 추론: 어려운 문제에 대해 높은 추론 강도를 활성화할 수 있는 경우
- 프라이빗 엔터프라이즈 워크로드: 통제된 환경 내부 배포가 필요한 경우
- 도구 사용 에이전트: 함수 호출, Python 실행, 웹 검색 또는 애플리케이션별 도구와 모델을 결합하는 경우
- 도메인 특화 파인튜닝 어시스턴트: 관리형 독점 모델에 대한 접근보다 오픈 가중치가 더 가치 있는 경우
- 자원 제약형 추론: MXFP4 양자화로 약 16 GB 메모리 내 실행이 중요한 경우
CometAPI를 통한 gpt-oss-20b 액세스
CometAPI는 현재 gpt-oss-20b-free를 OpenAI 모델로 나열하며, 21B-파라미터 공개 소스 MoE 모델, 3.6B 활성 파라미터, 128K급 컨텍스트를 갖춘 것으로 설명합니다. 무료로 사용 가능하며, CometAPI의 통합 API를 통해 모델을 노출합니다. CometAPI 변경 로그에 따르면 이 모델은 OpenAI 채팅 표준 형식을 따릅니다.
CometAPI 통합을 위해서는 일반적으로 CometAPI 키를 생성하고, CometAPI 베이스 URL을 사용하며, 요청에 모델 이름을 포함합니다. CometAPI는 OpenAI-SDK 호환 통합을 문서화하고 있으며, 현재 퀵스타트 베이스 URL로 https://api.cometapi.com/v1을 제시합니다.