Specyfikacja techniczna gpt-oss-20b-free
| Specyfikacja | gpt-oss-20b |
|---|---|
| Dostawca | OpenAI |
| Rodzina modeli | gpt-oss, modele rozumowania o otwartych wagach |
| Model | gpt-oss-20b-free |
| ID modelu w CometAPI | gpt-oss-20b-free |
| Architektura | Mixture of Experts (MoE) |
| Łączna liczba parametrów | 21B |
| Aktywne parametry | 3.6B |
| Okno kontekstu | 131,072 tokenów |
| Maksymalna liczba tokenów wyjściowych | 131,072 |
| Wejście/wyjście | Tekst na wejściu, tekst na wyjściu |
| Poziom rozumowania | niski, średni, wysoki |
| Licencja | Apache 2.0, zgodnie z polityką użycia gpt-oss |
| Wywoływanie funkcji | Obsługiwane |
| Strukturyzowane wyniki | Obsługiwane |
| Strumieniowanie | Obsługiwane |
| Dostrajanie | Obsługiwane poprzez otwarte narzędzia/infrastrukturę |
| Natywny cel wdrożeniowy | Lokalne, edge, prywatna infrastruktura lub hostowana inferencja |
| Granica wiedzy | 1 czerwca 2024 |
Czym jest gpt-oss-20b?
gpt-oss-20b to mniejszy model rozumowania o otwartych wagach od OpenAI w rodzinie gpt-oss. CometAPI oferuje też bezpłatny dostęp do gpt-oss-20b; identyfikator to gpt-oss-20b-free. Model ma łącznie 21 miliardów parametrów, ale podczas jednego przejścia w przód aktywuje około 3,6 miliarda parametrów, wykorzystując architekturę Mixture-of-Experts, aby zmniejszyć wymagania wnioskowania przy zachowaniu znacznej zdolności rozumowania. OpenAI pozycjonuje go do obciążeń o niższych opóźnieniach, lokalnych i wyspecjalizowanych, a nie jako bezpośredni zamiennik swoich największych modeli własnościowych.
Model jest wyłącznie tekstowy i zaprojektowany do zadań wymagających rozumowania oraz agentowych przepływów pracy. Otwarte wagi można pobrać, dostosować, dostroić i wdrożyć na infrastrukturze kontrolowanej przez dewelopera. OpenAI i Hugging Face dokumentują natywną kwantyzację MXFP4, która pozwala uruchamiać model w około 16 GB pamięci, co czyni go wyjątkowo dostępnym jak na klasę modeli o tej liczbie parametrów.
Główne cechy gpt-oss-20b
- Wydajna architektura MoE: 21B łącznych parametrów, z jedynie 3.6B aktywnymi w każdym przejściu w przód, co przekłada się na niższe opóźnienia i mniejsze wymagania wdrożeniowe.
- Konfigurowalne rozumowanie: Deweloperzy mogą wybrać niski, średni lub wysoki poziom rozumowania, balansując opóźnienie i koszty obliczeń względem jakości rozumowania.
- Agentowe użycie narzędzi: Model obsługuje przepływy pracy obejmujące wywoływanie funkcji, przeglądanie internetu, wykonywanie Pythona i strukturyzowane wyniki, gdy środowisko serwujące udostępnia te narzędzia.
- Dostosowywanie z otwartymi wagami: Licencja Apache 2.0 pozwala na szerokie modyfikacje i komercyjne wdrożenia, z zastrzeżeniem polityki użycia gpt-oss.
- Lokalne i prywatne wdrożenia: Model przeznaczony do uruchamiania na infrastrukturze kontrolowanej przez deweloperów, w tym w środowiskach lokalnych lub prywatnych.
- Długi kontekst: Dokumentacja produkcyjna wymienia okno kontekstu 131,072 tokenów i limit maksymalnych tokenów wyjściowych 131,072.
Wyniki benchmarków gpt-oss-20b
Opublikowane przez OpenAI wyniki ewaluacji pokazują, że gpt-oss-20b jest szczególnie silny w rozumowaniu matematycznym i kodowaniu jak na swój rozmiar. Przy wysokim poziomie rozumowania i z narzędziami osiąga 98.7% na AIME 2025, 96.0% na AIME 2024, 60.7% na SWE-Bench Verified oraz 54.8% na Tau-Bench Retail. W ocenach wiedzy i rozumowania OpenAI raportuje 85.3% na MMLU, 71.5% na GPQA Diamond bez narzędzi oraz 17.3% na Humanity's Last Exam z narzędziami. Wyniki znacząco zależą od poziomu rozumowania i dostępu do narzędzi, dlatego tych wartości nie należy traktować jako uniwersalnych wskaźników dokładności w środowisku produkcyjnym.
| Benchmark | wynik gpt-oss-20b | Warunki oceny |
|---|---|---|
| AIME 2024 | 96.0% | Wysoki poziom rozumowania, z narzędziami |
| AIME 2025 | 98.7% | Wysoki poziom rozumowania, z narzędziami |
| GPQA Diamond | 71.5% | Wysoki poziom rozumowania, bez narzędzi |
| MMLU | 85.3% | Wysoki poziom rozumowania |
| SWE-Bench Verified | 60.7% | Wysoki poziom rozumowania |
| Tau-Bench Retail | 54.8% | Wysoki poziom rozumowania |
| Humanity's Last Exam | 17.3% | Wysoki poziom rozumowania, z narzędziami |
Porównanie przygotowane przez OpenAI lokuje gpt-oss-20b blisko o3-mini w kilku kategoriach oceny, podczas gdy większy gpt-oss-120b ma zazwyczaj przewagę w zakresie szerokiej wiedzy i zadań agentowych.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Model | Główna zaleta | Kontekst | Najlepsze zastosowanie |
|---|---|---|---|
| gpt-oss-20b | Wydajne rozumowanie z otwartymi wagami | 131K | Lokalna inferencja, programowanie, matematyka, wyspecjalizowani agenci |
| gpt-oss-120b | Wyższa ogólna zdolność | 131K | Bardziej wymagające rozumowanie i zadania produkcyjne |
| o3-mini | Własnościowy model rozumowania | Zależny od wdrożenia | Zarządzane rozumowanie, gdy nie są wymagane otwarte wagi |
Praktyczna różnica dotyczy kontroli nad wdrożeniem. gpt-oss-20b jest lepszym wyborem, gdy deweloperzy potrzebują otwartych wag, lokalnego/prywatnego uruchomienia, dostosowania lub relatywnie skromnych wymagań sprzętowych. gpt-oss-120b jest preferowany, gdy wyższa ogólna jakość rozumowania i wiedzy uzasadnia większy ślad wdrożeniowy.
Ograniczenia gpt-oss-20b
gpt-oss-20b jest wyłącznie tekstowy i natywnie nie przyjmuje wejść obrazowych, audio ani wideo. Jego mniejsza liczba parametrów powoduje również lukę wydajności w niektórych ocenach opartych na wiedzy i zadaniach agentowych w porównaniu z gpt-oss-120b. Ponadto wdrożenie z otwartymi wagami przenosi więcej odpowiedzialności operacyjnej na dewelopera: hosting, skalowanie, monitorowanie, mechanizmy bezpieczeństwa i konfiguracja środowiska uruchomieniowego nie są obsługiwane w taki sam sposób jak w pełni zarządzanym, własnościowym API.
OpenAI zauważa też, że modele o otwartych wagach mają inny profil bezpieczeństwa niż modele hostowane, ponieważ deweloperzy mogą modyfikować lub dostrajać wagi. Wdrożenia produkcyjne powinny zatem dodawać odpowiednie zabezpieczenia na poziomie aplikacji i kontrolę dostępu.
Zastosowania gpt-oss-20b
gpt-oss-20b sprawdza się szczególnie w:
- Lokalnych asystentach programowania, gdzie deweloperzy chcą rozumowania i generowania kodu bez wysyłania kodu do własnościowego modelu hostowanego.
- Rozumowaniu matematycznym i technicznym, gdzie dla trudniejszych problemów można włączyć wysoki poziom rozumowania.
- Prywatnych obciążeniach przedsiębiorstw, które wymagają wdrożenia w kontrolowanym środowisku.
- Agentach korzystających z narzędzi, łączących model z wywoływaniem funkcji, wykonywaniem Pythona, wyszukiwaniem w sieci lub narzędziami specyficznymi dla aplikacji.
- Dostrojonych asystentach domenowych, gdzie otwarte wagi są cenniejsze niż dostęp do zarządzanego, własnościowego modelu.
- Inferencji przy ograniczonych zasobach, gdzie około 16 GB pamięci dzięki kwantyzacji MXFP4 ma duże znaczenie.
Dostęp do gpt-oss-20b przez CometAPI
CometAPI obecnie wymienia gpt-oss-20b-free jako model OpenAI i opisuje go jako 21-miliardowy, otwartoźródłowy model MoE z 3.6B aktywnych parametrów i kontekstem klasy 128K. Jest bezpłatny w użyciu i udostępniany przez jednolite API CometAPI. Dziennik zmian CometAPI stwierdza, że model stosuje standardowy format czatu OpenAI.
W integracji z CometAPI ogólny przepływ obejmuje utworzenie klucza CometAPI, użycie bazowego adresu URL CometAPI oraz wysłanie nazwy modelu w żądaniu. CometAPI dokumentuje integrację kompatybilną z OpenAI SDK i obecnie podaje https://api.cometapi.com/v1 jako bazowy adres URL w szybkim starcie.