Spesifikasi teknis gpt-oss-20b-free
| Specification | gpt-oss-20b |
|---|---|
| Provider | OpenAI |
| Model family | model penalaran open-weight gpt-oss |
| Model | gpt-oss-20b-free |
| Model ID in CometAPI | gpt-oss-20b-free |
| Architecture | Mixture of Experts (MoE) |
| Total parameters | 21B |
| Active parameters | 3.6B |
| Context window | 131,072 tokens |
| Maximum output tokens | 131,072 |
| Input / output | Teks masuk, teks keluar |
| Reasoning effort | rendah, sedang, tinggi |
| License | Apache 2.0, tunduk pada kebijakan penggunaan gpt-oss |
| Function calling | Didukung |
| Structured outputs | Didukung |
| Streaming | Didukung |
| Fine-tuning | Didukung melalui tooling/infrastruktur terbuka |
| Native deployment target | Lokal, edge, infrastruktur privat, atau inferensi di-host |
| Knowledge cutoff | 1 Juni 2024 |
Apa itu gpt-oss-20b?
gpt-oss-20b adalah model penalaran open-weight yang lebih kecil dari OpenAI dalam keluarga gpt-oss. CometAPI juga menawarkan penggunaan gpt-oss-20b secara gratis; ID-nya adalah gpt-oss-20b-free. Model ini memiliki total 21 miliar parameter tetapi mengaktifkan sekitar 3,6 miliar parameter per forward pass, menggunakan arsitektur Mixture-of-Experts untuk mengurangi kebutuhan inferensi sambil mempertahankan kapasitas penalaran yang substansial. OpenAI memosisikannya untuk latensi lebih rendah, lingkungan lokal, dan beban kerja terspesialisasi, bukan sebagai pengganti langsung model proprietary terbesar mereka.
Model ini hanya teks dan dirancang untuk penalaran dan alur kerja agen. Bobot terbukanya dapat diunduh, disesuaikan, di-fine-tune, dan diterapkan pada infrastruktur yang dikontrol oleh pengembang. OpenAI dan Hugging Face mendokumentasikan kuantisasi MXFP4 native yang memungkinkan model berjalan dalam sekitar 16 GB memori, menjadikannya sangat mudah diakses untuk model di kelas parameter ini.
Fitur utama gpt-oss-20b
- Arsitektur MoE efisien: 21B total parameter dengan hanya 3,6B parameter aktif per forward pass, menargetkan latensi lebih rendah dan persyaratan penerapan yang lebih ringan.
- Penalaran yang dapat dikonfigurasi: Pengembang dapat memilih upaya penalaran rendah, sedang, atau tinggi untuk menukar latensi respons dan komputasi dengan kualitas penalaran.
- Penggunaan alat agen: Model mendukung alur kerja yang melibatkan pemanggilan fungsi, penelusuran web, eksekusi Python, dan keluaran terstruktur saat runtime layanan menyediakan alat-alat tersebut.
- Kustomisasi open-weight: Lisensi Apache 2.0 memungkinkan modifikasi luas dan penerapan komersial, dengan ketentuan kebijakan penggunaan gpt-oss.
- Penerapan lokal dan privat: Model ini dimaksudkan untuk berjalan pada infrastruktur yang dikontrol pengembang, termasuk lingkungan lokal atau privat.
- Konteks panjang: Dokumentasi model produksi mencantumkan jendela konteks 131.072 token dan batas keluaran maksimum 131.072 token.
Kinerja benchmark gpt-oss-20b
Hasil evaluasi yang dipublikasikan OpenAI menunjukkan bahwa gpt-oss-20b khususnya kuat dalam penalaran matematika dan pengodean relatif terhadap ukurannya. Pada upaya penalaran tinggi dengan alat, model ini mencapai 98,7% pada AIME 2025, 96,0% pada AIME 2024, 60,7% pada SWE-Bench Verified, dan 54,8% pada Tau-Bench Retail. Pada evaluasi pengetahuan dan penalaran, OpenAI melaporkan 85,3% pada MMLU, 71,5% pada GPQA Diamond tanpa alat, dan 17,3% pada Humanity's Last Exam dengan alat. Hasil sangat bervariasi bergantung pada upaya penalaran dan akses alat, sehingga angka-angka ini tidak boleh dianggap sebagai tingkat akurasi produksi yang universal.
| Benchmark | gpt-oss-20b result | Evaluation condition |
|---|---|---|
| AIME 2024 | 96,0% | Upaya penalaran tinggi, dengan alat |
| AIME 2025 | 98,7% | Upaya penalaran tinggi, dengan alat |
| GPQA Diamond | 71,5% | Upaya penalaran tinggi, tanpa alat |
| MMLU | 85,3% | Upaya penalaran tinggi |
| SWE-Bench Verified | 60,7% | Upaya penalaran tinggi |
| Tau-Bench Retail | 54,8% | Upaya penalaran tinggi |
| Humanity's Last Exam | 17,3% | Upaya penalaran tinggi, dengan alat |
Perbandingan milik OpenAI menempatkan gpt-oss-20b dekat dengan o3-mini pada beberapa kategori evaluasi, sementara gpt-oss-120b yang lebih besar umumnya memiliki keunggulan pada pengetahuan luas dan beban kerja agen.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Model | Keunggulan utama | Konteks | Kesesuaian terbaik |
|---|---|---|---|
| gpt-oss-20b | Penalaran open-weight yang efisien | 131K | Inferensi lokal, pengodean, matematika, agen khusus |
| gpt-oss-120b | Kemampuan keseluruhan lebih tinggi | 131K | Beban kerja penalaran dan produksi yang lebih menuntut |
| o3-mini | Model penalaran proprietari | Bervariasi menurut penerapan | Penalaran terkelola saat bobot terbuka tidak diperlukan |
Perbedaan praktisnya adalah kontrol penerapan. gpt-oss-20b adalah pilihan yang lebih baik saat pengembang memerlukan bobot terbuka, eksekusi lokal/privat, kustomisasi, atau persyaratan perangkat keras yang relatif moderat. gpt-oss-120b lebih disukai ketika kinerja penalaran dan pengetahuan yang lebih tinggi membenarkan jejak penerapan yang lebih besar.
Keterbatasan gpt-oss-20b
gpt-oss-20b hanya teks dan tidak secara native menerima masukan gambar, audio, atau video. Jumlah parameter yang lebih kecil juga menciptakan kesenjangan kinerja pada beberapa evaluasi yang sarat pengetahuan dan agen dibandingkan dengan gpt-oss-120b. Selain itu, penerapan open-weight memindahkan lebih banyak tanggung jawab operasional kepada pengembang: hosting, penskalaan, pemantauan, kontrol keamanan, dan konfigurasi runtime tidak ditangani dengan cara yang sama seperti API proprietary yang sepenuhnya terkelola.
OpenAI juga mencatat bahwa model open-weight memiliki profil keamanan yang berbeda dari model yang di-host karena pengembang dapat memodifikasi atau melakukan fine-tune pada bobotnya. Oleh karena itu, penerapan produksi harus menambahkan pengaman dan kontrol akses pada tingkat aplikasi yang sesuai.
Kasus penggunaan gpt-oss-20b
gpt-oss-20b sangat cocok untuk:
- Asisten pengodean lokal ketika pengembang menginginkan penalaran dan generasi kode tanpa mengirimkan kode ke model proprietary yang di-host.
- Penalaran matematika dan teknis di mana upaya penalaran tinggi dapat diaktifkan untuk masalah yang sulit.
- Beban kerja perusahaan privat yang memerlukan penerapan di dalam lingkungan terkontrol.
- Agen pengguna alat yang mengombinasikan model dengan pemanggilan fungsi, eksekusi Python, penelusuran web, atau alat khusus aplikasi.
- Asisten domain yang di-fine-tune ketika bobot terbuka lebih berharga daripada akses ke model proprietary terkelola.
- Inferensi dengan sumber daya terbatas di mana target memori sekitar 16 GB yang dimungkinkan oleh kuantisasi MXFP4 penting.
Mengakses gpt-oss-20b melalui CometAPI
CometAPI saat ini mencantumkan gpt-oss-20b-free sebagai model OpenAI dan menggambarkannya sebagai model MoE open-source 21B parameter dengan 3,6B parameter aktif dan konteks kelas 128K. Model ini gratis digunakan dan disajikan melalui API terpadu CometAPI. Log perubahan CometAPI menyatakan bahwa model mengikuti format standar chat OpenAI.
Untuk integrasi CometAPI, alur umumnya adalah membuat kunci CometAPI, menggunakan base URL CometAPI, dan mengirimkan nama model dalam permintaan. CometAPI mendokumentasikan integrasi yang kompatibel dengan OpenAI SDK dan saat ini mencantumkan https://api.cometapi.com/v1 sebagai base URL quickstart.