Trả lời trước: Qwen4 không còn chỉ là một cái tên mang tính suy đoán. Qwen hiện mô tả Qwen3.8-Flash-Next là một mô hình MoE đa phương thức và bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4. Điều này xác nhận một hướng kiến trúc ưu tiên hiệu năng, nhưng không cấu thành việc ra mắt sản phẩm Qwen4. Dòng sản phẩm cuối cùng, quy mô tham số, bảng điểm benchmark, định danh API, giấy phép, giá và lịch phát hành vẫn chưa được tiết lộ.
Qwen4 là gì?
Qwen4 là thế hệ kiến trúc Qwen tiếp theo hiện đã được đội ngũ Qwen thừa nhận, mặc dù chưa có bất kỳ mô hình hay dòng sản phẩm Qwen4 độc lập nào được ra mắt. Tài liệu chính thức của Qwen3.8-Flash-Next gọi nó là bản xem trước kiến trúc thử nghiệm cho Qwen4. Họ không công bố số lượng tham số cuối cùng, dòng sản phẩm, bảng điểm benchmark, giá, định danh API, giấy phép hay ngày phát hành. Các giá trị cụ thể không truy xuất được từ Qwen hoặc Alibaba Cloud vẫn nên được coi là chưa xác thực.
Cách hữu ích nhất để thảo luận về Qwen4 vẫn là tách thành ba lớp bằng chứng. Thông tin đã xác nhận hiện bao gồm các mô hình Qwen hiện tại, tài liệu đã công bố và bản xem trước kiến trúc Qwen3.8-Flash-Next. Hướng kỳ vọng là các suy luận dựa trên những tín hiệu đó. Điều chưa biết là chi tiết sản phẩm cuối cùng mà không thể điền bằng ước đoán một cách có trách nhiệm. Sự phân biệt này quan trọng vì bản xem trước xác nhận ý đồ kiến trúc nhưng không định nghĩa gia đình Qwen4 ở môi trường sản xuất.
| Mức bằng chứng | Cách nên sử dụng | Ví dụ trong bài viết này |
|---|---|---|
| Đã xác nhận | Nêu như sự thật kèm liên kết chính thức trực tiếp | Bản xem trước kiến trúc Qwen3.8-Flash-Next; quy mô và benchmark nền của Qwen3.8-Max |
| Kỳ vọng | Dùng ngôn từ thận trọng và giải thích suy luận | Cách kiến trúc xem trước có thể mở rộng thành các mô hình Qwen4 cuối cùng |
| Chưa biết | Không bịa đặt giá trị hay cam kết phát hành | Dòng sản phẩm cuối cùng, tham số, bảng điểm, giá, giấy phép và ID API |
Vì sao Qwen4 là bước tiếp theo hợp lý
Thế hệ Qwen3 đặt nền tảng cho một cách tiếp cận lai về suy luận. Giới thiệu chính thức mô tả các chế độ suy nghĩ và không suy nghĩ cho phép nhà phát triển đánh đổi tốc độ phản hồi với quá trình cân nhắc sâu hơn. Cùng thế hệ đó cũng mở rộng hỗ trợ đa ngôn ngữ và tăng cường sử dụng công cụ, bao gồm các quy trình tác tử theo hướng MCP.
Lộ trình của Qwen sau đó hướng tới mở rộng dữ liệu, kéo dài ngữ cảnh, mở rộng phương thức và RL với phản hồi môi trường. Lộ trình này quan trọng hơn các dự đoán phát hành dựa trên tin đồn: nó định khung thế hệ tiếp theo như một bước chuyển từ huấn luyện mô hình sang huấn luyện tác tử có thể tương tác với môi trường và hoàn thành công việc dài hạn.
Dòng Qwen3.8 hiện cung cấp hai đường cơ sở khác nhau. Qwen3.8-Max vẫn là đường cơ sở năng lực hàng đầu hiện tại, với một hệ thống MoE 2,4 nghìn tỷ tham số được lưu trữ cho lập trình, công việc văn phòng, hiểu thị giác, tài liệu dài, video dài và lập kế hoạch tự động. Qwen3.8-Flash-Next đóng vai trò khác: Qwen đặt nó rõ ràng là bản xem trước kiến trúc cho Qwen4. Một Qwen4 trong tương lai phải kết hợp bề rộng của flagship với thiết kế định hướng hiệu năng của bản xem trước.
Qwen3.8-Flash-Next tiết lộ gì về Qwen4
Qwen3.8-Flash-Next là bằng chứng công khai cụ thể đầu tiên về nền tảng của Qwen4. Qwen gọi nó là bản phát hành trọng số mở đầu tiên dưới kiến trúc mới và cho biết thiết kế này sẽ làm nền tảng cho Qwen4. Do đó, bản xem trước mạnh hơn suy luận từ lộ trình, trong khi vẫn để ngỏ quy mô và cấu hình của mô hình sản xuất.
Mô hình là mô hình ngôn ngữ nhân quả đa phương thức với bộ mã hóa thị giác. Mô hình ngôn ngữ của nó có 125B tham số với 6B được kích hoạt, cùng 51B tham số embedding n-gram và 4B tham số MTP. Nó có 48 lớp, 512 chuyên gia với 10 chuyên gia được định tuyến và một chuyên gia chia sẻ hoạt động trên mỗi token, ngữ cảnh gốc 262,144 token và hỗ trợ mở rộng lên tới 1,000,000 token.
| Tín hiệu kiến trúc | Được xác nhận trong Qwen3.8-Flash-Next | Hàm ý đối với Qwen4 |
|---|---|---|
| MoE siêu thưa | Mô hình chính 125B; 6B hoạt hóa mỗi token; 512 chuyên gia | Năng lực trên mỗi đơn vị tính toán đang hoạt hóa có thể là mục tiêu trung tâm |
| Chú ý lai | Ba lớp Gated DeltaNet cho mỗi lớp Qwen Sparse Attention | Độ trễ ngữ cảnh dài và hiệu quả KV-cache có thể quan trọng hơn kích thước cửa sổ thô |
| Phần dư có cổng | Bốn nhánh residual mở rộng với cổng phụ thuộc dữ liệu | Qwen đang thử nghiệm mở rộng chiều sâu biểu đạt hơn với chi phí kiểm soát được |
| Embedding n-gram | 51B tham số embedding bigram và trigram | Dung lượng có thể chuyển tải ra bộ nhớ có thể bổ sung cho mở rộng MoE nặng tính toán |
| Đa phương thức gốc | Mô hình ngôn ngữ nhân quả với bộ mã hóa thị giác | Văn bản và thị giác có khả năng là nền tảng kiến trúc, không phải biến thể gắn thêm |
| Ngữ cảnh dài | 262K gốc; có thể mở rộng đến 1M | Qwen4 có khả năng nhấn mạnh các tác tử dài hạn hiệu quả |
Kết quả benchmark do nhà cung cấp báo cáo từ bản xem trước cũng cho thấy lý do kiến trúc này quan trọng. Dù chỉ kích hoạt 6B tham số mỗi token, nó cải thiện so với đường cơ sở dense Qwen3.8-27B qua các đánh giá đã chọn về lập trình, công việc văn phòng, sử dụng công cụ và tác tử đa phương thức dưới đây. Đây không phải là điểm Qwen4; chúng là bằng chứng rằng kiến trúc mới được thiết kế để nâng cao năng lực trên mỗi tham số đang hoạt hóa.
| Benchmark | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 |
| SWE-bench Pro | 62.5 | 61.7 |
| CoWorkBench | 73.9 | 70.7 |
| Toolathlon Verified | 73.5 | 67.1 |
| ClawEval-MM (Pass@3) | 64.4 | 57.4 |
| AndroidWorld | 84.5 | 81.9 |
Giải thích: Flash-Next biến ba kỳ vọng về Qwen4 thành các tín hiệu mạnh hơn: kích hoạt siêu thưa, chú ý lai cho ngữ cảnh dài và đa phương thức gốc. Nó không tiết lộ số tham số cuối cùng của Qwen4, cấu hình ngữ cảnh chính xác, các hạng sản phẩm hoặc thời điểm phát hành.
Thông số kỳ vọng của Qwen4
Vì chưa có thông số cuối cùng của Qwen4, bảng dưới dùng Qwen3.8-Max làm đường cơ sở sản xuất đã xác nhận và Qwen3.8-Flash-Next làm tín hiệu kiến trúc đã xác nhận. Bản xem trước tăng độ tin cậy cho vài hướng, nhưng mọi trường thông số cuối cùng của Qwen4 vẫn là kỳ vọng hoặc chưa biết cho tới khi Qwen công bố mô hình.
| Thông số | Đường cơ sở đã xác nhận của Qwen3.8-Max | Kỳ vọng cho Qwen4 | Độ tin cậy |
|---|---|---|---|
| Trạng thái | Đã phát hành | Bản xem trước kiến trúc đã xác nhận; mô hình chưa ra mắt | Đã xác nhận |
| Kiến trúc | MoE thưa với nền tảng chú ý lai | Kỳ vọng xây trên GDN + QSA của Flash-Next, phần dư có cổng và embedding n-gram | Cao |
| Tổng tham số | 2.4T | Chưa biết; có thể không cần vượt 2.4T | Thấp |
| Tham số hoạt hóa | Khoảng 95B mỗi bước trong mô hình trọng số mở | Có khả năng định tuyến siêu thưa; lượng tính toán hoạt hóa chính xác chưa biết | Trung bình-cao |
| Cửa sổ ngữ cảnh | 1,000,000 token | Tối ưu ngữ cảnh dài; giới hạn gốc và mặc định cuối cùng chưa biết | Cao |
| Đầu ra tối đa | 131,072 token | Nhiều khả năng được giữ nguyên hoặc mở rộng | Trung bình |
| Đầu vào được hỗ trợ | Văn bản, hình ảnh và video | Hướng đa phương thức đã xác nhận; hỗ trợ âm thanh chính xác vẫn chưa biết | Cao |
| Phương thức đầu ra | Văn bản | Văn bản là khả năng cao; đầu ra phương tiện gốc chưa được xác nhận | Trung bình |
| Suy luận | Quy trình suy nghĩ và suy luận nhanh | Điều khiển suy nghĩ có khả năng được giữ; hành vi API cuối cùng chưa biết | Trung bình-cao |
| Hỗ trợ công cụ | Gọi hàm và đầu ra có cấu trúc | Kỳ vọng lựa chọn công cụ mạnh hơn, trạng thái được bảo toàn và khả năng phục hồi | Cao |
| Trọng số và giấy phép | Tồn tại checkpoint flagship trọng số mở | Bản xem trước là trọng số mở; giấy phép và checkpoint Qwen4 cuối cùng chưa biết | Trung bình |
| ID mô hình API | qwen3.8-max | Chưa có | Đã xác nhận |
Giải thích: Flash-Next nâng độ tin cậy cho định tuyến MoE siêu thưa, chú ý lai cho ngữ cảnh dài, phần dư có cổng, embedding n-gram và đa phương thức gốc. Nó không chứng minh rằng mô hình Qwen4 cuối cùng sẽ dùng 125B tham số, kích hoạt 6B mỗi token hay xuất xưởng với cùng giới hạn ngữ cảnh.
Qwen4 dự kiến xây trên kiến trúc nào?
MoE siêu thưa hiện là tín hiệu mạnh nhất
Câu hỏi về kiến trúc giờ ít mang tính suy đoán hơn. Thẻ mô hình của Qwen3.8-Flash-Next ghi nhận 125B tham số chính với chỉ 6B được kích hoạt mỗi token, cùng 51B embedding n-gram. Thiết kế siêu thưa này gợi ý rằng Qwen4 có thể ưu tiên tổng năng lực nhiệm vụ trên mỗi đơn vị tính toán đang hoạt hóa thay vì tăng số tham số hoạt hóa tương ứng với dung lượng lưu trữ.
Câu hỏi quan trọng không phải Qwen4 có nhiều chuyên gia hơn hay không, mà là việc định tuyến, truy cập bộ nhớ và chuyên môn hóa chuyên gia có ổn định xuyên suốt các nhiệm vụ dài hay không. Embedding n-gram của Flash-Next cũng cho thấy Qwen đang khám phá dung lượng rẻ hơn về tính toán và dễ chuyển tải ra bộ nhớ hơn so với mở rộng MoE thông thường.
Chú ý lai nhắm tới hiệu quả ngữ cảnh dài
Flash-Next thay thế cặp Gated DeltaNet và chú ý đầy đủ trước đây bằng Gated DeltaNet và Qwen Sparse Attention hoạt động ở cấp micro-block. 48 lớp của nó lặp lại ba khối Gated DeltaNet theo sau một khối chú ý thưa. Đây là tín hiệu rõ ràng nhất rằng Qwen4 có thể được thiết kế để giảm độ trễ ngữ cảnh dài và áp lực lên KV-cache thay vì dựa vào cửa sổ chú ý dày đặc lớn hơn.
Ngữ cảnh dài nên trở thành bộ nhớ của tác tử, không chỉ là prompt lớn hơn
Cửa sổ một triệu token chỉ hữu ích khi mô hình có thể truy xuất bằng chứng đúng, giữ gìn mục tiêu và tránh tích lũy trạng thái mâu thuẫn. Do đó, Qwen4 nên được đánh giá dựa trên cách nó sử dụng ngữ cảnh dài xuyên suốt các lần gọi công cụ, thay đổi tệp, kết quả trung gian và phục hồi lỗi. Độ dài ngữ cảnh thô ít thông tin hơn độ chính xác truy xuất và mức hoàn thành nhiệm vụ trên một quỹ đạo dài.
Điều khiển suy luận có thể trở nên chi tiết hơn
Thiết kế suy nghĩ lai của Qwen3 đã cho phép hành vi nhanh và cân nhắc. Flash-Next củng cố tín hiệu bằng việc hỗ trợ các điều khiển enable_thinking, preserve_thinking và reasoning_effort. Một nâng cấp Qwen4 có ý nghĩa có thể phân bổ suy luận một cách động và chỉ bảo toàn trạng thái giúp cải thiện tính nhất quán đa bước, giảm tổng chi phí quy trình thay vì chỉ tạo ra suy luận hiển thị dài hơn.
Đa phương thức có thể tiến gần hơn tới khả năng dùng máy tính
Đa phương thức hiện là kỳ vọng mạnh hơn vì cả dịch vụ Qwen3.8-Max được lưu trữ và bản xem trước trọng số mở Flash-Next đều hỗ trợ đầu vào thị giác. Qwen4 có thể kết hợp nhận thức đó với hành động đáng tin cậy hơn: hiểu ảnh chụp màn hình, chọn điều khiển giao diện, kiểm tra kết quả và sửa kế hoạch. Âm thanh gốc, tạo ảnh, đầu ra giọng nói và tạo video vẫn chưa được xác nhận.
Tính năng kỳ vọng của Qwen4
- Tác tử dài hạn đáng tin cậy hơn. Tỷ lệ lỗi gọi công cụ thấp hơn, giữ mục tiêu mạnh hơn, phục hồi tốt hơn và đầu ra nhất quán hơn sau hàng trăm hành động.
- Kỹ nghệ phần mềm ở quy mô kho mã. Lập kế hoạch tốt hơn xuyên suốt các codebase lớn, bài kiểm thử, terminal, hệ thống theo dõi issue và môi trường triển khai.
- Công việc tri thức đầu-cuối. Lộ trình mạnh hơn từ nghiên cứu và phân tích tài liệu tới bảng tính, thuyết trình, báo cáo và kết quả sẵn sàng cho quyết định.
- Sử dụng công cụ đa phương thức. Hiểu thị giác hỗ trợ tương tác UI, thao tác tài liệu và suy luận dựa vào môi trường.
- Ngân sách suy luận thích ứng. Tự động leo thang từ phản hồi nhanh sang suy luận sâu hơn khi bất định hoặc độ phức tạp nhiệm vụ tăng.
- Năng lực cao hơn trên mỗi tham số hoạt hóa. Định tuyến chuyên gia tốt hơn, dung lượng n-gram, chú ý thưa, bộ nhớ đệm và hậu huấn luyện thay vì mở rộng chỉ vì quy mô.
- Gia đình mô hình rộng hơn. Có thể có các biến thể Max, Plus, Coder, MoE nhỏ, VL hoặc Omni, dù chưa tên nào được xác nhận.
Triển vọng benchmark Qwen4: Đường cơ sở Qwen3.8-Max cho thấy gì
Không có điểm benchmark cho Qwen4. Flash-Next và Max trả lời những câu hỏi khác nhau: bảng điểm Flash-Next kiểm tra năng lực định hướng hiệu năng của kiến trúc mới, trong khi bảng điểm chính thức Qwen3.8-Max vẫn là đường cơ sở năng lực sản xuất mạnh hơn cho tác tử lập trình, tái hiện nghiên cứu, cộng tác chuyên nghiệp, suy luận thị giác, sử dụng di động và sử dụng máy tính. Qwen4 sẽ cần kết hợp cả hai hướng dưới các đánh giá phù hợp.
| Benchmark | Điểm báo cáo của Qwen3.8-Max | Qwen4 cần chứng minh điều gì |
|---|---|---|
| SWE-Pro | 67.7 | Thu hẹp khoảng cách trong giải quyết issue ở quy mô kho chuyên nghiệp |
| TerminalBench 2.1 | 86.6 | Cải thiện độ tin cậy tác tử terminal dưới cùng bộ đánh giá |
| PaperBench | 93.0 | Duy trì sức mạnh nghiên cứu với tái lập độc lập |
| FrontierSWE | 73.5 | Chuyển hóa suy luận dài hạn thành nhiều công việc hoàn tất hơn |
| CoWorkBench | 74.8 | Tạo ra sản phẩm chuyên nghiệp đáng tin cậy hơn |
| OSWorld-Verified | 86.1 | Giảm lỗi hành động thị giác trong quy trình sử dụng máy tính |
Hai đường cơ sở chỉ ra một yêu cầu kép. Flash-Next cho thấy mức tính toán hoạt hóa thấp vẫn có thể mang lại kết quả tác tử và đa phương thức mạnh mẽ; Max cho thấy trần năng lực cao hơn mà một flagship mới phải vượt. Do đó, Qwen4 nên được đánh giá dựa trên cả mức độ thành công nhiệm vụ phù hợp và tổng chi phí quy trình, với điểm do nhà cung cấp báo cáo được tách biệt khỏi tái lập độc lập.
Official Qwen3.8-Max benchmark results. Source: Qwen3.8-Max official release**.
Qwen4 so với các mô hình tuyến đầu hiện tại: Đường cơ sở đã xác nhận và điều chưa biết
So sánh hữu ích nhất không chỉ là Qwen4 với Qwen3.8-Max. Đó là Qwen4 với các lựa chọn thiết kế đã thấy ở Kimi K3, DeepSeek V4 Pro và GLM-5.3. Bảng sau so sánh các thuộc tính mô hình hiện tại đã xác nhận với cột Qwen4 còn chưa biết.
| Khía cạnh | Qwen4 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Pro | GLM-5.3 |
|---|---|---|---|---|---|
| Trạng thái | Bản xem trước kiến trúc đã xác nhận; mô hình chưa phát hành | Đã phát hành | Đã phát hành | Đã phát hành | Đã phát hành |
| Quy mô | Chưa biết | 2.4T / khoảng 95B hoạt hóa | 2.8T / 16 trong 896 chuyên gia | 1.6T / 49B hoạt hóa | Chưa tiết lộ cho bản phát hành này |
| Ngữ cảnh | Kỳ vọng 1M+ | 1M | 1M | 1M | 1M |
| Đầu vào | Hướng đa phương thức đã xác nhận; giao diện cuối cùng chưa biết | Văn bản, hình ảnh, video | Văn bản và thị giác gốc | Hướng văn bản | Chỉ văn bản |
| Suy luận | Chưa biết | Quy trình suy nghĩ và nhanh | Nỗ lực thấp / cao / tối đa | Suy nghĩ / không suy nghĩ | Luôn bật; thấp / cao / tối đa |
| Hệ sinh thái mở | Trọng số và giấy phép cuối cùng chưa xác nhận | Tồn tại trọng số mở cho flagship | Định vị mã nguồn mở | Trọng số mở | Định vị mã nguồn mở |
| Trọng tâm | Kỳ vọng tác tử đa phương thức hiệu quả | Lập trình, cộng tác, tác tử thị giác | Lập trình và công việc tri thức | Suy luận và lập trình hiệu quả | Lập trình và an ninh mạng |
Quy mô mô hình và hiệu quả suy luận
Tài liệu của Kimi mô tả 2,8T tham số và 16 chuyên gia hoạt hóa trên 896. DeepSeek V4 Pro đi theo lộ trình khác với 1,6T tổng và 49B tham số hoạt hóa. Qwen4 không cần là mô hình lớn nhất để thắng so sánh này; nó cần chuyển đổi tính toán hoạt hóa thành nhiều công việc hoàn tất đáng tin cậy hơn.
Ngữ cảnh và đa phương thức
Một triệu token đã trở thành đường cơ sở phổ biến cho flagship, vì vậy độ dài ngữ cảnh một mình sẽ không tạo khác biệt cho Qwen4. Cơ hội mạnh mẽ hơn của Qwen là sử dụng ngữ cảnh đa phương thức: tìm bằng chứng đúng giữa tài liệu, mã, ảnh chụp màn hình và video, rồi thực hiện hành động đúng. Kimi K3 cũng có hiểu thị giác gốc, trong khi giao diện hiện tại của GLM-5.3 chỉ văn bản với ngữ cảnh 1M và đầu ra tối đa 128K.
Lập trình, tác tử và thế mạnh chuyên biệt
Qwen3.8-Max mang hồ sơ rộng về lập trình, nghiên cứu, cộng tác và tác tử thị giác. Qwen3.8-Flash-Next bổ sung một kiến trúc đa phương thức định hướng hiệu năng với năng lực mạnh hơn trên mỗi tham số hoạt hóa. Kimi K3 nhấn mạnh lập trình dài hạn và công việc tri thức, DeepSeek V4 Pro nhấn mạnh suy luận hiệu quả và lập trình mang tính tác tử, còn GLM-5.3 bổ sung trọng tâm an ninh mạng đặc thù. Một màn ra mắt Qwen4 đáng tin cần kết hợp độ tin cậy tác tử rộng với hiệu năng cấp chuyên gia trong kỹ nghệ phần mềm và sử dụng máy tính bằng thị giác.
Trọng số mở không phải toàn bộ câu chuyện triển khai
Trọng số mở có thể cải thiện mức kiểm soát, tùy biến và lựa chọn nhà cung cấp, nhưng so sánh thực tế còn bao gồm điều khoản giấy phép, yêu cầu phần cứng, chất lượng lượng tử hóa, hỗ trợ tinh chỉnh và sẵn có của các ngăn phục vụ được tối ưu. Từ “mở” không nên dùng thay cho việc kiểm tra chính xác giấy phép và điều kiện triển khai của từng bản phát hành.
Kết quả so sánh: Vị thế tiềm năng mạnh nhất của Qwen4 là một tác tử đa phương thức rộng kết hợp thế mạnh thị giác và cộng tác của Qwen3.8-Max với kiến trúc tính toán hoạt hóa thấp của Flash-Next và độ tin cậy kỹ nghệ phần mềm tốt hơn. Không thể tuyên bố thắng cuộc cho tới khi có các đánh giá phù hợp và hành vi sản xuất sẵn sàng.
Trường hợp sử dụng tiềm năng cho Qwen4
Kỹ nghệ phần mềm tự động
Một tác tử Qwen mạnh hơn có thể kiểm tra một kho mã, tái hiện một lỗi, chỉnh sửa nhiều tệp, chạy kiểm thử, xem lại thất bại và chuẩn bị thay đổi sẵn sàng cho pull request. Chỉ số quan trọng sẽ là tỷ lệ nhiệm vụ hoàn thành không cần cứu trợ của con người, không phải lượng mã sinh ra.
Công việc tri thức doanh nghiệp
Ngữ cảnh dài và hiểu đa phương thức có thể hỗ trợ quy trình bắt đầu từ hợp đồng, PDF, bảng tính, sơ đồ và biên bản họp và kết thúc bằng một bản ghi nhớ quyết định, phân tích hoặc kế hoạch hành động có cấu trúc. Doanh nghiệp vẫn cần kiểm soát truy xuất, nhật ký kiểm toán và xác minh nguồn xung quanh mô hình.
Tác tử sử dụng máy tính đa phương thức
Qwen4 có thể hữu ích khi tác tử phải diễn giải ảnh chụp màn hình, điều hướng ứng dụng, xác minh trạng thái UI và phục hồi khi một cú nhấp hoặc gửi biểu mẫu tạo ra kết quả không mong đợi. Đây là mở rộng tự nhiên của đường cơ sở thị giác và kiểu OSWorld mạnh mẽ của Qwen3.8-Max, nhưng hỗ trợ điều khiển máy tính gốc chưa được công bố.
Nghiên cứu khoa học và kỹ thuật
Quy trình nghiên cứu kết hợp đọc tài liệu, mã, mô phỏng, phân tích dữ liệu và viết báo cáo. Một mô hình Qwen tương lai có thể điều phối các bước này và duy trì lịch sử thực nghiệm dài hơn. Hiệu năng PaperBench khiến đây là hướng đáng tin, nhưng khả năng tái lập và xác minh độc lập vẫn là điều cốt yếu.
Điều chúng ta chưa biết
Dù Qwen đã thừa nhận kiến trúc qua Flash-Next, các chi tiết sản xuất sau vẫn chưa có và nên giữ ở trạng thái chưa xác quyết cho tới khi có thông báo Qwen4 chính thức:
- Tên sản phẩm chính xác và việc Qwen4 ra mắt như một mô hình hay một gia đình.
- Ngày phát hành hoặc lịch trình xem trước.
- Liệu các mô hình cuối giữ nguyên tỷ lệ GDN/QSA, thiết kế phần dư có cổng, quy mô embedding n-gram và định tuyến chuyên gia của Flash-Next hay không.
- Tổng tham số, tham số hoạt hóa, số lượng chuyên gia và quy mô dữ liệu huấn luyện cho từng mô hình Qwen4.
- Độ dài ngữ cảnh gốc, mặc định, đầu ra tối đa và phương thức được hỗ trợ cho từng tuyến.
- Khả năng âm thanh gốc, tạo ảnh, giọng nói hay tạo video.
- Kết quả benchmark chính thức và bộ khung đánh giá dùng cho từng điểm số.
- Tính sẵn có trọng số mở, điều khoản giấy phép và điều kiện sử dụng thương mại.
- Giá API, vùng khả dụng, giới hạn tốc độ và ID mô hình cuối cùng.
Quy tắc xác minh: Xem mọi thông số cụ thể, biểu đồ benchmark, bảng giá hay định danh API của Qwen4 là chưa xác thực trừ khi có thể truy xuất trực tiếp từ Qwen, Alibaba Cloud hoặc kho mô hình chính thức.
Khi nào Qwen4 sẽ phát hành?
Không có ngày phát hành công khai có thể bảo vệ. Qwen3.8-Flash-Next xác nhận rằng Qwen đang thử nghiệm kiến trúc sẽ làm nền cho Qwen4, nhưng tài liệu công khai không cung cấp lịch cho một mô hình Qwen4 sản xuất. Hoàn tất huấn luyện, hiệu quả phục vụ, đánh giá an toàn, cấp phép trọng số và tích hợp sản phẩm đều có thể ảnh hưởng thời điểm và hình dạng phát hành.
Cách xuất bản an toàn nhất là tránh dự đoán theo tháng hoặc quý. Độc giả nên theo dõi trang chính thức của Qwen, tài liệu Alibaba Cloud Model Studio, các kho mô hình đã xác minh và danh mục mô hình CometAPI. Trang mô hình Qwen4 chỉ nên được thêm sau khi mô hình thực sự được liệt kê.
Nhà phát triển có thể chuẩn bị cho Qwen4 như thế nào
- Thiết lập hai đường cơ sở. Dùng Qwen3.8-Flash-Next để đo hiệu quả kiến trúc và Qwen3.8-Max để đo năng lực flagship hiện tại.
- Tách ID mô hình khỏi logic nghiệp vụ. Giữ định tuyến và cấu hình bên ngoài mã ứng dụng để có thể hoán đổi mô hình an toàn.
- Xây dựng đánh giá cấp nhiệm vụ. Đo lường các sửa lỗi phần mềm hoàn tất, đầu ra nghiên cứu chính xác, chuỗi công cụ thành công và sản phẩm bàn giao dùng được.
- Ghi nhật ký tổng chi phí quy trình. Theo dõi độ trễ, token đầu vào/đầu ra, sử dụng bộ nhớ đệm, thử lại, hành động thất bại và công sức làm lại của con người.
- Bảo toàn tuyến dự phòng. Dùng định tuyến mô hình và nhà cung cấp dự phòng thay vì biến một mô hình chưa phát hành thành điểm lỗi đơn.
- Không bịa ID mô hình. Chờ định danh chính thức trước khi thêm qwen4 hoặc qwen4-max vào cấu hình sản xuất.
Dùng thử Qwen3.8-Flash-Next và Qwen3.8-Max qua CometAPI
Nhà phát triển hiện có thể thử Qwen3.8-Flash-Next qua CometAPI và giữ Qwen3.8-Max làm đối chứng flagship. Tạo một API key, lưu trong biến môi trường và gọi mô hình hiện có qua client tương thích OpenAI. Ví dụ cố ý dùng qwen3.8-flash-next; không giả định định danh Qwen4 trong tương lai.
Kết luận
Qwen4 giờ không còn là tin đồn: Qwen đã chỉ rõ Qwen3.8-Flash-Next là bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho nó. Bản xem trước xác nhận hướng MoE siêu thưa, đa phương thức, dựa trên Gated DeltaNet, Qwen Sparse Attention, phần dư có cổng và embedding n-gram. Qwen3.8-Max vẫn là đường cơ sở năng lực hiện tại mạnh hơn.
Bài kiểm tra thực sự cho Qwen4 sẽ không phải là số tham số lớn hơn. Sẽ là việc mô hình cuối cùng có thể kết hợp hiệu năng của Flash-Next với năng lực cấp Max, hoàn thành công việc dài hơn với ít lỗi hơn và sử dụng bằng chứng đa phương thức đáng tin cậy hơn hay không. Hướng kiến trúc đã công khai, nhưng thông số cuối, benchmark, giấy phép, giá, ID API và ngày phát hành vẫn chưa biết.
