Thông số kỹ thuật của Qwen3.8-Flash-Next
| Thông số | Qwen3.8-Flash-Next |
|---|---|
| Nhà phát triển | Qwen Team, Alibaba Group |
| Loại mô hình | Mô hình ngôn ngữ nhân quả đa phương thức với bộ mã hóa thị giác; MoE siêu thưa |
| Tham số mô hình chính | 125B |
| Tham số được kích hoạt | 6B mỗi token |
| Tham số embedding n-gram | 51B bổ sung |
| Tham số MTP | 4B |
| Số lớp | 48 |
| Mẫu attention lai | 12 x [3 lớp Gated DeltaNet + 1 lớp Qwen Sparse Attention] |
| Số chuyên gia MoE | 512 tổng cộng; 10 được định tuyến + 1 dùng chung trên mỗi token |
| Gated Residual | 4 nhánh; hạng bottleneck 320 |
| Cửa sổ ngữ cảnh gốc | 262,144 tokens |
| Ngữ cảnh mở rộng | Tối đa 1,000,000 tokens với YaRN |
| Các phương thức | Đầu vào văn bản, hình ảnh, video; đầu ra văn bản |
| Điều khiển tư duy | Chế độ thinking/non-thinking cùng kiểm soát nỗ lực suy luận trong các API được hỗ trợ |
| Triển khai | Transformers, vLLM, SGLang, TokenSpeed và các framework được hỗ trợ khác |
| Trọng số mở | Có |
| CometAPI model ID | qwen3.8-flash-next |
Qwen3.8-Flash-Next là gì?
Qwen3.8-Flash-Next là một mô hình MoE đa phương thức với trọng số mở sắp ra mắt từ nhóm Qwen của Alibaba. Quan trọng hơn, nó được định vị như một bản xem trước sớm của kiến trúc dự định sẽ cung cấp sức mạnh cho dòng mô hình Qwen4 trong tương lai, thay vì chỉ là một checkpoint Qwen3.8 gia tăng khác.
Qwen đang sử dụng bản phát hành này để giới thiệu hướng kiến trúc thế hệ tiếp theo của họ tới hệ sinh thái nguồn mở trước khi dòng Qwen4 rộng hơn xuất hiện. Điều này mang lại cho các nhà phát triển công cụ suy luận, dự án lượng hóa, framework phục vụ mô hình và nhà phát triển ứng dụng cơ hội chuẩn bị trước cho các thay đổi về kiến trúc.
Kiến trúc hiện đang được công bố giới thiệu hai thành phần quan trọng: một kiến trúc lai dựa trên GDN và Qwen Sparse Attention (QSA). GDN đề cập đến một cách tiếp cận attention tuyến tính kiểu DeltaNet có cơ chế cổng, tiếp nối hướng attention lai trước đây được khám phá trong Qwen3-Next. QSA được giới thiệu như một cơ chế attention thưa mới, dù đặc tả kỹ thuật đầy đủ của nó vẫn chưa được công bố công khai.
Tính năng chính của Qwen3.8-Flash-Next
- Xem trước kiến trúc Qwen4: Qwen3.8-Flash-Next được định vị rõ ràng là một triển khai sớm của hướng kiến trúc sẽ cung cấp sức mạnh cho dòng Qwen4 sắp tới.
- Thiết kế MoE đa phương thức: Mô hình được mô tả là một mô hình MoE đa phương thức, mở rộng chiến lược mô hình thưa hiệu quả của Qwen hướng tới một thế hệ kiến trúc mới.
- Kiến trúc lai GDN: Mô hình tiếp tục hướng nghiên cứu attention lai được giới thiệu với Qwen3-Next, kết hợp các cơ chế attention tuyến tính hiệu quả với attention thông thường ở những nơi cần truy xuất chính xác. Qwen3-Next đã cho thấy rằng cách tiếp cận này có thể cải thiện đáng kể hiệu quả suy luận ngữ cảnh dài.
- Qwen Sparse Attention: QSA là một trong hai thay đổi kiến trúc được công khai nhấn mạnh cho Flash-Next. Việc triển khai chi tiết và lợi ích định lượng của nó vẫn cần được Qwen tài liệu hóa.
- Định hướng hệ sinh thái trọng số mở: Bản phát hành nhằm cung cấp cho cộng đồng nguồn mở quyền truy cập sớm vào các thay đổi kiến trúc để các runtime suy luận và công cụ hạ lưu có thể thích ứng trước khi Qwen4 ra mắt.
- Hiệu năng Coding và Agent của Qwen3.8-Flash-Next
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next so với Qwen3.8-Max và Qwen3.8-27B
| Mô hình | Định vị | Kiến trúc / Quy mô | Đa phương thức | Trạng thái hiện tại |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Xem trước kiến trúc Qwen4 / mô hình mở định hướng hiệu quả | MoE đa phương thức; đặc tả đầy đủ đang chờ công bố | Có | Sắp ra mắt |
| Qwen3.8-Max | Mô hình Qwen3.8 chủ lực được lưu trữ | MoE quy mô lớn | Có | Đã khả dụng |
| Qwen3.8-27B | Mô hình Qwen3.8 trọng số mở | Mô hình dense 27B | Khả năng cụ thể theo mô hình | Đã khả dụng |
Qwen3.8-Max đã có sẵn qua hệ sinh thái đám mây của Alibaba và được định vị cho các tác vụ suy luận nâng cao, hiểu thị giác, lập trình và tác tử. Tài liệu hiện tại của Qwen liệt kê Qwen3.8-Max với cửa sổ ngữ cảnh 1M-token, trong khi CometAPI đã cung cấp qwen3.8-max.
Do đó, Flash-Next nên được nhìn nhận khác biệt: ý nghĩa chính của nó ở giai đoạn này là về kiến trúc hơn là dựa trên benchmark. Nó giới thiệu trước hướng kỹ thuật của Qwen4 và mang đến cho hệ sinh thái nguồn mở một mục tiêu sớm hơn để tối ưu hóa runtime và triển khai.