Spesifikasi teknikal gpt-oss-20b-free
| Spesifikasi | gpt-oss-20b |
|---|---|
| Penyedia | OpenAI |
| Keluarga model | Model penaakulan open-weight gpt-oss |
| Model | gpt-oss-20b-free |
| ID model dalam CometAPI | gpt-oss-20b-free |
| Seni bina | Campuran Pakar (MoE) |
| Jumlah parameter | 21B |
| Parameter aktif | 3.6B |
| Tetingkap konteks | 131,072 token |
| Token output maksimum | 131,072 |
| Input / output | Teks masuk, teks keluar |
| Usaha penaakulan | Rendah, sederhana, tinggi |
| Lesen | Apache 2.0, tertakluk kepada dasar penggunaan gpt-oss |
| Panggilan fungsi | Disokong |
| Output berstruktur | Disokong |
| Penstriman | Disokong |
| Penalaan halus | Disokong melalui peralatan/infrastruktur terbuka |
| Sasaran penggelaran natif | Setempat, edge, infrastruktur persendirian, atau inferens dihoskan |
| Had pengetahuan | 1 Jun 2024 |
Apakah gpt-oss-20b?
gpt-oss-20b ialah model penaakulan open-weight yang lebih kecil daripada OpenAI dalam keluarga gpt-oss. CometAPI turut menawarkan penggunaan gpt-oss-20b secara percuma; ID ialah gpt-oss-20b-free. Ia mempunyai 21 bilion jumlah parameter tetapi mengaktifkan kira-kira 3.6 bilion parameter bagi setiap laluan ke hadapan, menggunakan seni bina Mixture-of-Experts untuk mengurangkan keperluan inferens sambil mengekalkan kapasiti penaakulan yang besar. OpenAI memposisikannya untuk latensi lebih rendah, penggunaan setempat, dan beban kerja khusus berbanding sebagai pengganti langsung untuk model proprietari terbesar mereka.
Model ini hanya teks dan direka untuk penaakulan serta aliran kerja berasaskan agen. Berat terbukanya boleh dimuat turun, disesuaikan, ditala halus, dan digelar pada infrastruktur yang dikawal oleh pembangun. OpenAI dan Hugging Face mendokumentasikan pengkuantuman MXFP4 asli yang membolehkan model berjalan dalam kira-kira 16 GB memori, menjadikannya luar biasa mudah diakses untuk model dalam kelas parameter ini.
Ciri utama gpt-oss-20b
- Seni bina MoE yang cekap: 21B jumlah parameter dengan hanya 3.6B parameter aktif bagi setiap laluan ke hadapan, menyasarkan latensi lebih rendah dan keperluan penggelaran lebih rendah.
- Penaakulan boleh dikonfigurasi: Pembangun boleh memilih usaha penaakulan rendah, sederhana, atau tinggi untuk menukar antara latensi respons dan penggunaan pengiraan bagi kualiti penaakulan.
- Penggunaan alat berasaskan agen: Model menyokong aliran kerja yang melibatkan panggilan fungsi, pelayaran web, pelaksanaan Python, dan output berstruktur apabila runtime perkhidmatan mendedahkan alat tersebut.
- Penyesuaian open-weight: Lesen Apache 2.0 membenarkan pengubahsuaian luas dan penggelaran komersial, tertakluk kepada dasar penggunaan gpt-oss.
- Penggelaran setempat dan peribadi: Model ini bertujuan untuk berjalan pada infrastruktur yang dikawal oleh pembangun, termasuk persekitaran setempat atau persendirian.
- Konteks panjang: Dokumentasi model produksi menyenaraikan tetingkap konteks 131,072 token dan had token output maksimum 131,072.
Prestasi penanda aras gpt-oss-20b
Keputusan penilaian yang diterbitkan oleh OpenAI menunjukkan bahawa gpt-oss-20b amat kuat dalam penaakulan matematik dan pengekodan relatif kepada saiznya. Pada usaha penaakulan tinggi dengan alat, ia mencapai 98.7% pada AIME 2025, 96.0% pada AIME 2024, 60.7% pada SWE-Bench Verified, dan 54.8% pada Tau-Bench Retail. Pada penilaian pengetahuan dan penaakulan, OpenAI melaporkan 85.3% pada MMLU, 71.5% pada GPQA Diamond tanpa alat, dan 17.3% pada Humanity's Last Exam dengan alat. Keputusan berbeza dengan ketara mengikut usaha penaakulan dan akses alat, jadi angka ini tidak seharusnya dianggap sebagai kadar ketepatan produksi sejagat.
| Penanda aras | Keputusan gpt-oss-20b | Keadaan penilaian |
|---|---|---|
| AIME 2024 | 96.0% | Penaakulan tinggi, dengan alat |
| AIME 2025 | 98.7% | Penaakulan tinggi, dengan alat |
| GPQA Diamond | 71.5% | Penaakulan tinggi, tanpa alat |
| MMLU | 85.3% | Penaakulan tinggi |
| SWE-Bench Verified | 60.7% | Penaakulan tinggi |
| Tau-Bench Retail | 54.8% | Penaakulan tinggi |
| Humanity's Last Exam | 17.3% | Penaakulan tinggi, dengan alat |
Perbandingan OpenAI sendiri meletakkan gpt-oss-20b hampir dengan o3-mini pada beberapa kategori penilaian, manakala gpt-oss-120b yang lebih besar secara umum mempunyai kelebihan pada pengetahuan luas dan beban kerja berasaskan agen.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Model | Kelebihan utama | Konteks | Kesesuaian terbaik |
|---|---|---|---|
| gpt-oss-20b | Penaakulan open-weight yang cekap | 131K | Inferens setempat, pengaturcaraan, matematik, agen khusus |
| gpt-oss-120b | Keupayaan keseluruhan lebih tinggi | 131K | Penaakulan lebih mencabar dan beban kerja produksi |
| o3-mini | Model penaakulan proprietari | Berubah mengikut penggelaran | Penaakulan terurus apabila open weights tidak diperlukan |
Perbezaan praktikalnya ialah kawalan penggelaran. gpt-oss-20b lebih sesuai apabila pembangun memerlukan berat terbuka, pelaksanaan setempat/persendirian, penyesuaian, atau keperluan perkakasan yang agak sederhana. gpt-oss-120b lebih disukai apabila prestasi pengetahuan dan penaakulan keseluruhan yang lebih tinggi membenarkan jejak penggelaran yang lebih besar.
Batasan gpt-oss-20b
gpt-oss-20b adalah hanya teks dan tidak secara natif menerima input imej, audio, atau video. Kiraan parameter yang lebih kecil juga mewujudkan jurang prestasi pada beberapa penilaian berasaskan pengetahuan dan agen berbanding gpt-oss-120b. Selain itu, penggelaran open-weight memindahkan lebih banyak tanggungjawab operasi kepada pembangun: pengehosan, penskalaan, pemantauan, kawalan keselamatan, dan konfigurasi runtime tidak ditangani dengan cara yang sama seperti API proprietari yang diurus sepenuhnya.
OpenAI juga menyatakan bahawa model open-weight mempunyai profil keselamatan yang berbeza daripada model dihoskan kerana pembangun boleh mengubah suai atau menala halus beratnya. Penggelaran produksi oleh itu harus menambah perlindungan aplikasi yang sesuai dan kawalan akses.
Kes penggunaan gpt-oss-20b
gpt-oss-20b sangat sesuai untuk:
- Pembantu pengaturcaraan setempat di mana pembangun mahukan penaakulan dan penjanaan kod tanpa menghantar kod ke model proprietari yang dihoskan.
- Penaakulan matematik dan teknikal di mana usaha penaakulan tinggi boleh didayakan untuk masalah sukar.
- Beban kerja perusahaan persendirian yang memerlukan penggelaran di dalam persekitaran terkawal.
- Agen yang menggunakan alat yang menggabungkan model dengan panggilan fungsi, pelaksanaan Python, carian web, atau alat khusus aplikasi.
- Pembantu domain yang ditala halus di mana berat terbuka lebih bernilai daripada akses kepada model proprietari terurus.
- Inferens terhad sumber di mana sasaran memori kira-kira 16 GB yang didayakan oleh pengkuantuman MXFP4 adalah penting.
Mengakses gpt-oss-20b melalui CometAPI
CometAPI pada masa ini menyenaraikan gpt-oss-20b-free sebagai model OpenAI dan menerangkannya sebagai model MoE sumber terbuka 21B parameter dengan 3.6B parameter aktif dan konteks kelas 128K. Ia percuma untuk digunakan dan mendedahkan model melalui API bersatu CometAPI. Log perubahan CometAPI menyatakan bahawa model ini mengikut format piawai sembang OpenAI.
Untuk integrasi CometAPI, aliran kerja umum adalah mencipta kunci CometAPI, menggunakan URL asas CometAPI, dan menghantar nama model dalam permintaan. CometAPI mendokumenkan integrasi yang serasi dengan OpenAI-SDK dan pada masa ini menyenaraikan https://api.cometapi.com/v1 sebagai URL asas permulaan pantas.