Thông số kỹ thuật của gpt-oss-20b-free
| Thông số | gpt-oss-20b |
|---|---|
| Nhà cung cấp | OpenAI |
| Họ mô hình | các mô hình lập luận trọng số mở gpt-oss |
| Mô hình | gpt-oss-20b-free |
| ID mô hình trong CometAPI | gpt-oss-20b-free |
| Kiến trúc | Hỗn hợp chuyên gia (MoE) |
| Tổng số tham số | 21B |
| Tham số hoạt động | 3.6B |
| Cửa sổ ngữ cảnh | 131,072 token |
| Số token đầu ra tối đa | 131,072 |
| Đầu vào / đầu ra | Văn bản vào, văn bản ra |
| Mức nỗ lực lập luận | Thấp, trung bình, cao |
| Giấy phép | Apache 2.0, tuân theo chính sách sử dụng gpt-oss |
| Gọi hàm | Được hỗ trợ |
| Đầu ra có cấu trúc | Được hỗ trợ |
| Truyền phát | Được hỗ trợ |
| Tinh chỉnh | Được hỗ trợ thông qua công cụ/cơ sở hạ tầng mở |
| Mục tiêu triển khai gốc | Cục bộ, biên, hạ tầng riêng tư hoặc suy luận được lưu trữ |
| Mốc kiến thức | 1 tháng 6, 2024 |
gpt-oss-20b là gì?
gpt-oss-20b là mô hình lập luận trọng số mở nhỏ hơn của OpenAI trong họ gpt-oss. CometAPI cũng cung cấp quyền sử dụng miễn phí gpt-oss-20b; ID là gpt-oss-20b-free. Mô hình có tổng 21 tỷ tham số nhưng chỉ kích hoạt khoảng 3.6 tỷ tham số mỗi lượt suy diễn, sử dụng kiến trúc Hỗn hợp chuyên gia (MoE) để giảm yêu cầu suy luận trong khi vẫn giữ năng lực lập luận đáng kể. OpenAI định vị mô hình này cho độ trễ thấp hơn, chạy cục bộ và các khối lượng công việc chuyên biệt, thay vì thay thế trực tiếp các mô hình độc quyền lớn nhất.
Mô hình chỉ xử lý văn bản và được thiết kế cho lập luận và các luồng công việc mang tính tác nhân. Trọng số mở có thể được tải xuống, tùy biến, tinh chỉnh và triển khai trên hạ tầng do nhà phát triển kiểm soát. OpenAI và Hugging Face tài liệu hóa lượng tử hóa MXFP4 bản địa cho phép mô hình chạy trong khoảng 16 GB bộ nhớ, giúp khả năng tiếp cận trở nên đáng chú ý đối với một mô hình trong phân khúc tham số này.
Tính năng chính của gpt-oss-20b
- Kiến trúc MoE hiệu quả: 21B tham số tổng với chỉ 3.6B tham số hoạt động mỗi lượt suy diễn, hướng tới độ trễ thấp hơn và yêu cầu triển khai nhẹ hơn.
- Lập luận có thể cấu hình: Nhà phát triển có thể chọn mức nỗ lực lập luận thấp, trung bình hoặc cao để đánh đổi độ trễ phản hồi và tài nguyên tính toán với chất lượng lập luận.
- Tác nhân sử dụng công cụ: Mô hình hỗ trợ các luồng công việc gồm gọi hàm, duyệt web, thực thi Python và đầu ra có cấu trúc khi runtime phục vụ cung cấp các công cụ đó.
- Tùy biến trọng số mở: Giấy phép Apache 2.0 cho phép chỉnh sửa rộng và triển khai thương mại, tuân theo chính sách sử dụng gpt-oss.
- Triển khai cục bộ và riêng tư: Mô hình được thiết kế để chạy trên hạ tầng do nhà phát triển kiểm soát, bao gồm môi trường cục bộ hoặc riêng tư.
- Ngữ cảnh dài: Tài liệu mô hình sản xuất liệt kê cửa sổ ngữ cảnh 131,072 token và giới hạn đầu ra tối đa 131,072 token.
Hiệu năng trên benchmark của gpt-oss-20b
Kết quả đánh giá do OpenAI công bố cho thấy gpt-oss-20b đặc biệt mạnh về lập luận toán học và lập trình so với kích thước của nó. Ở mức nỗ lực lập luận cao cùng công cụ, mô hình đạt 98.7% trên AIME 2025, 96.0% trên AIME 2024, 60.7% trên SWE-Bench Verified và 54.8% trên Tau-Bench Retail. Trên các đánh giá kiến thức và lập luận, OpenAI báo cáo 85.3% trên MMLU, 71.5% trên GPQA Diamond không dùng công cụ và 17.3% trên Humanity's Last Exam có công cụ. Kết quả thay đổi đáng kể theo mức nỗ lực lập luận và quyền truy cập công cụ, vì vậy không nên coi các con số này là tỷ lệ chính xác trong sản xuất áp dụng chung.
| Benchmark | Kết quả gpt-oss-20b | Điều kiện đánh giá |
|---|---|---|
| AIME 2024 | 96.0% | Lập luận cao, có công cụ |
| AIME 2025 | 98.7% | Lập luận cao, có công cụ |
| GPQA Diamond | 71.5% | Lập luận cao, không công cụ |
| MMLU | 85.3% | Lập luận cao |
| SWE-Bench Verified | 60.7% | Lập luận cao |
| Tau-Bench Retail | 54.8% | Lập luận cao |
| Humanity's Last Exam | 17.3% | Lập luận cao, có công cụ |
So sánh của chính OpenAI đặt gpt-oss-20b ở mức gần với o3-mini trên một số hạng mục đánh giá, trong khi gpt-oss-120b lớn hơn thường có lợi thế về kiến thức rộng và các khối lượng công việc mang tính tác nhân.
gpt-oss-20b vs gpt-oss-120b vs o3-mini
| Mô hình | Ưu thế chính | Ngữ cảnh | Phù hợp nhất |
|---|---|---|---|
| gpt-oss-20b | Lập luận trọng số mở hiệu quả | 131K | Suy luận cục bộ, lập trình, toán học, tác nhân chuyên biệt |
| gpt-oss-120b | Năng lực tổng thể cao hơn | 131K | Các khối lượng công việc lập luận và sản xuất đòi hỏi cao hơn |
| o3-mini | Mô hình lập luận độc quyền | Thay đổi theo triển khai | Lập luận được quản lý khi không cần trọng số mở |
Khác biệt thực tế là quyền kiểm soát triển khai. gpt-oss-20b là lựa chọn tốt hơn khi nhà phát triển cần trọng số mở, thực thi cục bộ/riêng tư, tùy biến hoặc yêu cầu phần cứng tương đối khiêm tốn. gpt-oss-120b phù hợp hơn khi hiệu năng lập luận và kiến thức tổng thể cao hơn xứng đáng với dấu chân triển khai lớn hơn.
Hạn chế của gpt-oss-20b
gpt-oss-20b chỉ xử lý văn bản và không chấp nhận đầu vào hình ảnh, âm thanh hoặc video một cách tự nhiên. Số lượng tham số nhỏ hơn cũng tạo ra khoảng cách hiệu năng trên một số đánh giá nặng về kiến thức và mang tính tác nhân so với gpt-oss-120b. Ngoài ra, triển khai trọng số mở chuyển giao nhiều trách nhiệm vận hành hơn cho nhà phát triển: lưu trữ, mở rộng, giám sát, kiểm soát an toàn và cấu hình runtime không được xử lý theo cách giống như một API độc quyền được quản lý hoàn toàn.
OpenAI cũng lưu ý rằng các mô hình trọng số mở có hồ sơ an toàn khác với mô hình được lưu trữ vì nhà phát triển có thể chỉnh sửa hoặc tinh chỉnh trọng số. Do đó, triển khai sản xuất nên bổ sung các biện pháp bảo vệ ở cấp ứng dụng và kiểm soát truy cập phù hợp.
Trường hợp sử dụng cho gpt-oss-20b
gpt-oss-20b phù hợp mạnh mẽ cho:
- Trợ lý lập trình cục bộ nơi nhà phát triển muốn lập luận và sinh mã mà không gửi mã tới mô hình độc quyền được lưu trữ.
- Lập luận toán học và kỹ thuật, nơi có thể bật mức nỗ lực lập luận cao cho các bài toán khó.
- Khối lượng công việc doanh nghiệp riêng tư yêu cầu triển khai trong môi trường được kiểm soát.
- Tác nhân sử dụng công cụ kết hợp mô hình với gọi hàm, thực thi Python, tìm kiếm web hoặc công cụ theo ứng dụng.
- Trợ lý theo miền được tinh chỉnh khi trọng số mở có giá trị hơn so với quyền truy cập một mô hình độc quyền được quản lý.
- Suy luận bị ràng buộc tài nguyên, nơi mục tiêu bộ nhớ khoảng 16 GB nhờ lượng tử hóa MXFP4 là quan trọng.
Truy cập gpt-oss-20b qua CometAPI
Hiện tại CometAPI liệt kê gpt-oss-20b-free là một mô hình OpenAI và mô tả đây là mô hình MoE mã nguồn mở 21B tham số với 3.6B tham số hoạt động và ngữ cảnh lớp 128K. Mô hình được sử dụng miễn phí và được cung cấp thông qua API hợp nhất của CometAPI. Nhật ký thay đổi của CometAPI nêu rằng mô hình tuân theo định dạng chuẩn chat của OpenAI.
Đối với tích hợp CometAPI, quy trình chung là tạo khóa CometAPI, sử dụng base URL của CometAPI và gửi tên mô hình trong yêu cầu. CometAPI tài liệu hóa tích hợp tương thích OpenAI SDK và hiện liệt kê https://api.cometapi.com/v1 là base URL cho quickstart.