GPT-6 Astra is now live on CometAPI →
new/Nghiên cứu CometAPI

Qwen4 sắp ra mắt: Những gì Qwen3.8-Flash-Next tiết lộ

Khám phá những gì Qwen3.8-Flash-Next tiết lộ về kiến trúc của Qwen4, các tính năng dự kiến, định hướng benchmark, triển vọng phát hành

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 6, 2026 23 phút đọc
Qwen4 sắp ra mắt: Những gì Qwen3.8-Flash-Next tiết lộ
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Trả lời trước: Qwen4 không còn chỉ là một cái tên mang tính suy đoán. Qwen hiện mô tả Qwen3.8-Flash-Next là một mô hình MoE đa phương thức và bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho Qwen4. Điều này xác nhận một hướng kiến trúc ưu tiên hiệu năng, nhưng không cấu thành việc ra mắt sản phẩm Qwen4. Dòng sản phẩm cuối cùng, quy mô tham số, bảng điểm benchmark, định danh API, giấy phép, giá và lịch phát hành vẫn chưa được tiết lộ.

Qwen4 là gì?

Qwen4 là thế hệ kiến trúc Qwen tiếp theo hiện đã được đội ngũ Qwen thừa nhận, mặc dù chưa có bất kỳ mô hình hay dòng sản phẩm Qwen4 độc lập nào được ra mắt. Tài liệu chính thức của Qwen3.8-Flash-Next gọi nó là bản xem trước kiến trúc thử nghiệm cho Qwen4. Họ không công bố số lượng tham số cuối cùng, dòng sản phẩm, bảng điểm benchmark, giá, định danh API, giấy phép hay ngày phát hành. Các giá trị cụ thể không truy xuất được từ Qwen hoặc Alibaba Cloud vẫn nên được coi là chưa xác thực.

Cách hữu ích nhất để thảo luận về Qwen4 vẫn là tách thành ba lớp bằng chứng. Thông tin đã xác nhận hiện bao gồm các mô hình Qwen hiện tại, tài liệu đã công bố và bản xem trước kiến trúc Qwen3.8-Flash-Next. Hướng kỳ vọng là các suy luận dựa trên những tín hiệu đó. Điều chưa biết là chi tiết sản phẩm cuối cùng mà không thể điền bằng ước đoán một cách có trách nhiệm. Sự phân biệt này quan trọng vì bản xem trước xác nhận ý đồ kiến trúc nhưng không định nghĩa gia đình Qwen4 ở môi trường sản xuất.

Mức bằng chứngCách nên sử dụngVí dụ trong bài viết này
Đã xác nhậnNêu như sự thật kèm liên kết chính thức trực tiếpBản xem trước kiến trúc Qwen3.8-Flash-Next; quy mô và benchmark nền của Qwen3.8-Max
Kỳ vọngDùng ngôn từ thận trọng và giải thích suy luậnCách kiến trúc xem trước có thể mở rộng thành các mô hình Qwen4 cuối cùng
Chưa biếtKhông bịa đặt giá trị hay cam kết phát hànhDòng sản phẩm cuối cùng, tham số, bảng điểm, giá, giấy phép và ID API

Vì sao Qwen4 là bước tiếp theo hợp lý

Thế hệ Qwen3 đặt nền tảng cho một cách tiếp cận lai về suy luận. Giới thiệu chính thức mô tả các chế độ suy nghĩ và không suy nghĩ cho phép nhà phát triển đánh đổi tốc độ phản hồi với quá trình cân nhắc sâu hơn. Cùng thế hệ đó cũng mở rộng hỗ trợ đa ngôn ngữ và tăng cường sử dụng công cụ, bao gồm các quy trình tác tử theo hướng MCP.

Lộ trình của Qwen sau đó hướng tới mở rộng dữ liệu, kéo dài ngữ cảnh, mở rộng phương thức và RL với phản hồi môi trường. Lộ trình này quan trọng hơn các dự đoán phát hành dựa trên tin đồn: nó định khung thế hệ tiếp theo như một bước chuyển từ huấn luyện mô hình sang huấn luyện tác tử có thể tương tác với môi trường và hoàn thành công việc dài hạn.

Dòng Qwen3.8 hiện cung cấp hai đường cơ sở khác nhau. Qwen3.8-Max vẫn là đường cơ sở năng lực hàng đầu hiện tại, với một hệ thống MoE 2,4 nghìn tỷ tham số được lưu trữ cho lập trình, công việc văn phòng, hiểu thị giác, tài liệu dài, video dài và lập kế hoạch tự động. Qwen3.8-Flash-Next đóng vai trò khác: Qwen đặt nó rõ ràng là bản xem trước kiến trúc cho Qwen4. Một Qwen4 trong tương lai phải kết hợp bề rộng của flagship với thiết kế định hướng hiệu năng của bản xem trước.

hình

Qwen3.8-Flash-Next tiết lộ gì về Qwen4

Qwen3.8-Flash-Next là bằng chứng công khai cụ thể đầu tiên về nền tảng của Qwen4. Qwen gọi nó là bản phát hành trọng số mở đầu tiên dưới kiến trúc mới và cho biết thiết kế này sẽ làm nền tảng cho Qwen4. Do đó, bản xem trước mạnh hơn suy luận từ lộ trình, trong khi vẫn để ngỏ quy mô và cấu hình của mô hình sản xuất.

Mô hình là mô hình ngôn ngữ nhân quả đa phương thức với bộ mã hóa thị giác. Mô hình ngôn ngữ của nó có 125B tham số với 6B được kích hoạt, cùng 51B tham số embedding n-gram và 4B tham số MTP. Nó có 48 lớp, 512 chuyên gia với 10 chuyên gia được định tuyến và một chuyên gia chia sẻ hoạt động trên mỗi token, ngữ cảnh gốc 262,144 token và hỗ trợ mở rộng lên tới 1,000,000 token.

Tín hiệu kiến trúcĐược xác nhận trong Qwen3.8-Flash-NextHàm ý đối với Qwen4
MoE siêu thưaMô hình chính 125B; 6B hoạt hóa mỗi token; 512 chuyên giaNăng lực trên mỗi đơn vị tính toán đang hoạt hóa có thể là mục tiêu trung tâm
Chú ý laiBa lớp Gated DeltaNet cho mỗi lớp Qwen Sparse AttentionĐộ trễ ngữ cảnh dài và hiệu quả KV-cache có thể quan trọng hơn kích thước cửa sổ thô
Phần dư có cổngBốn nhánh residual mở rộng với cổng phụ thuộc dữ liệuQwen đang thử nghiệm mở rộng chiều sâu biểu đạt hơn với chi phí kiểm soát được
Embedding n-gram51B tham số embedding bigram và trigramDung lượng có thể chuyển tải ra bộ nhớ có thể bổ sung cho mở rộng MoE nặng tính toán
Đa phương thức gốcMô hình ngôn ngữ nhân quả với bộ mã hóa thị giácVăn bản và thị giác có khả năng là nền tảng kiến trúc, không phải biến thể gắn thêm
Ngữ cảnh dài262K gốc; có thể mở rộng đến 1MQwen4 có khả năng nhấn mạnh các tác tử dài hạn hiệu quả

Kết quả benchmark do nhà cung cấp báo cáo từ bản xem trước cũng cho thấy lý do kiến trúc này quan trọng. Dù chỉ kích hoạt 6B tham số mỗi token, nó cải thiện so với đường cơ sở dense Qwen3.8-27B qua các đánh giá đã chọn về lập trình, công việc văn phòng, sử dụng công cụ và tác tử đa phương thức dưới đây. Đây không phải là điểm Qwen4; chúng là bằng chứng rằng kiến trúc mới được thiết kế để nâng cao năng lực trên mỗi tham số đang hoạt hóa.

BenchmarkQwen3.8-Flash-NextQwen3.8-27B
DeepSWE 1.158.742.2
SWE-bench Pro62.561.7
CoWorkBench73.970.7
Toolathlon Verified73.567.1
ClawEval-MM (Pass@3)64.457.4
AndroidWorld84.581.9

Giải thích: Flash-Next biến ba kỳ vọng về Qwen4 thành các tín hiệu mạnh hơn: kích hoạt siêu thưa, chú ý lai cho ngữ cảnh dài và đa phương thức gốc. Nó không tiết lộ số tham số cuối cùng của Qwen4, cấu hình ngữ cảnh chính xác, các hạng sản phẩm hoặc thời điểm phát hành.

Thông số kỳ vọng của Qwen4

Vì chưa có thông số cuối cùng của Qwen4, bảng dưới dùng Qwen3.8-Max làm đường cơ sở sản xuất đã xác nhận và Qwen3.8-Flash-Next làm tín hiệu kiến trúc đã xác nhận. Bản xem trước tăng độ tin cậy cho vài hướng, nhưng mọi trường thông số cuối cùng của Qwen4 vẫn là kỳ vọng hoặc chưa biết cho tới khi Qwen công bố mô hình.

Thông sốĐường cơ sở đã xác nhận của Qwen3.8-MaxKỳ vọng cho Qwen4Độ tin cậy
Trạng tháiĐã phát hànhBản xem trước kiến trúc đã xác nhận; mô hình chưa ra mắtĐã xác nhận
Kiến trúcMoE thưa với nền tảng chú ý laiKỳ vọng xây trên GDN + QSA của Flash-Next, phần dư có cổng và embedding n-gramCao
Tổng tham số2.4TChưa biết; có thể không cần vượt 2.4TThấp
Tham số hoạt hóaKhoảng 95B mỗi bước trong mô hình trọng số mởCó khả năng định tuyến siêu thưa; lượng tính toán hoạt hóa chính xác chưa biếtTrung bình-cao
Cửa sổ ngữ cảnh1,000,000 tokenTối ưu ngữ cảnh dài; giới hạn gốc và mặc định cuối cùng chưa biếtCao
Đầu ra tối đa131,072 tokenNhiều khả năng được giữ nguyên hoặc mở rộngTrung bình
Đầu vào được hỗ trợVăn bản, hình ảnh và videoHướng đa phương thức đã xác nhận; hỗ trợ âm thanh chính xác vẫn chưa biếtCao
Phương thức đầu raVăn bảnVăn bản là khả năng cao; đầu ra phương tiện gốc chưa được xác nhậnTrung bình
Suy luậnQuy trình suy nghĩ và suy luận nhanhĐiều khiển suy nghĩ có khả năng được giữ; hành vi API cuối cùng chưa biếtTrung bình-cao
Hỗ trợ công cụGọi hàm và đầu ra có cấu trúcKỳ vọng lựa chọn công cụ mạnh hơn, trạng thái được bảo toàn và khả năng phục hồiCao
Trọng số và giấy phépTồn tại checkpoint flagship trọng số mởBản xem trước là trọng số mở; giấy phép và checkpoint Qwen4 cuối cùng chưa biếtTrung bình
ID mô hình APIqwen3.8-maxChưa cóĐã xác nhận

Giải thích: Flash-Next nâng độ tin cậy cho định tuyến MoE siêu thưa, chú ý lai cho ngữ cảnh dài, phần dư có cổng, embedding n-gram và đa phương thức gốc. Nó không chứng minh rằng mô hình Qwen4 cuối cùng sẽ dùng 125B tham số, kích hoạt 6B mỗi token hay xuất xưởng với cùng giới hạn ngữ cảnh.

Qwen4 dự kiến xây trên kiến trúc nào?

MoE siêu thưa hiện là tín hiệu mạnh nhất

Câu hỏi về kiến trúc giờ ít mang tính suy đoán hơn. Thẻ mô hình của Qwen3.8-Flash-Next ghi nhận 125B tham số chính với chỉ 6B được kích hoạt mỗi token, cùng 51B embedding n-gram. Thiết kế siêu thưa này gợi ý rằng Qwen4 có thể ưu tiên tổng năng lực nhiệm vụ trên mỗi đơn vị tính toán đang hoạt hóa thay vì tăng số tham số hoạt hóa tương ứng với dung lượng lưu trữ.

Câu hỏi quan trọng không phải Qwen4 có nhiều chuyên gia hơn hay không, mà là việc định tuyến, truy cập bộ nhớ và chuyên môn hóa chuyên gia có ổn định xuyên suốt các nhiệm vụ dài hay không. Embedding n-gram của Flash-Next cũng cho thấy Qwen đang khám phá dung lượng rẻ hơn về tính toán và dễ chuyển tải ra bộ nhớ hơn so với mở rộng MoE thông thường.

Chú ý lai nhắm tới hiệu quả ngữ cảnh dài

Flash-Next thay thế cặp Gated DeltaNet và chú ý đầy đủ trước đây bằng Gated DeltaNet và Qwen Sparse Attention hoạt động ở cấp micro-block. 48 lớp của nó lặp lại ba khối Gated DeltaNet theo sau một khối chú ý thưa. Đây là tín hiệu rõ ràng nhất rằng Qwen4 có thể được thiết kế để giảm độ trễ ngữ cảnh dài và áp lực lên KV-cache thay vì dựa vào cửa sổ chú ý dày đặc lớn hơn.

Ngữ cảnh dài nên trở thành bộ nhớ của tác tử, không chỉ là prompt lớn hơn

Cửa sổ một triệu token chỉ hữu ích khi mô hình có thể truy xuất bằng chứng đúng, giữ gìn mục tiêu và tránh tích lũy trạng thái mâu thuẫn. Do đó, Qwen4 nên được đánh giá dựa trên cách nó sử dụng ngữ cảnh dài xuyên suốt các lần gọi công cụ, thay đổi tệp, kết quả trung gian và phục hồi lỗi. Độ dài ngữ cảnh thô ít thông tin hơn độ chính xác truy xuất và mức hoàn thành nhiệm vụ trên một quỹ đạo dài.

Điều khiển suy luận có thể trở nên chi tiết hơn

Thiết kế suy nghĩ lai của Qwen3 đã cho phép hành vi nhanh và cân nhắc. Flash-Next củng cố tín hiệu bằng việc hỗ trợ các điều khiển enable_thinking, preserve_thinking và reasoning_effort. Một nâng cấp Qwen4 có ý nghĩa có thể phân bổ suy luận một cách động và chỉ bảo toàn trạng thái giúp cải thiện tính nhất quán đa bước, giảm tổng chi phí quy trình thay vì chỉ tạo ra suy luận hiển thị dài hơn.

Đa phương thức có thể tiến gần hơn tới khả năng dùng máy tính

Đa phương thức hiện là kỳ vọng mạnh hơn vì cả dịch vụ Qwen3.8-Max được lưu trữ và bản xem trước trọng số mở Flash-Next đều hỗ trợ đầu vào thị giác. Qwen4 có thể kết hợp nhận thức đó với hành động đáng tin cậy hơn: hiểu ảnh chụp màn hình, chọn điều khiển giao diện, kiểm tra kết quả và sửa kế hoạch. Âm thanh gốc, tạo ảnh, đầu ra giọng nói và tạo video vẫn chưa được xác nhận.

Tính năng kỳ vọng của Qwen4

  • Tác tử dài hạn đáng tin cậy hơn. Tỷ lệ lỗi gọi công cụ thấp hơn, giữ mục tiêu mạnh hơn, phục hồi tốt hơn và đầu ra nhất quán hơn sau hàng trăm hành động.
  • Kỹ nghệ phần mềm ở quy mô kho mã. Lập kế hoạch tốt hơn xuyên suốt các codebase lớn, bài kiểm thử, terminal, hệ thống theo dõi issue và môi trường triển khai.
  • Công việc tri thức đầu-cuối. Lộ trình mạnh hơn từ nghiên cứu và phân tích tài liệu tới bảng tính, thuyết trình, báo cáo và kết quả sẵn sàng cho quyết định.
  • Sử dụng công cụ đa phương thức. Hiểu thị giác hỗ trợ tương tác UI, thao tác tài liệu và suy luận dựa vào môi trường.
  • Ngân sách suy luận thích ứng. Tự động leo thang từ phản hồi nhanh sang suy luận sâu hơn khi bất định hoặc độ phức tạp nhiệm vụ tăng.
  • Năng lực cao hơn trên mỗi tham số hoạt hóa. Định tuyến chuyên gia tốt hơn, dung lượng n-gram, chú ý thưa, bộ nhớ đệm và hậu huấn luyện thay vì mở rộng chỉ vì quy mô.
  • Gia đình mô hình rộng hơn. Có thể có các biến thể Max, Plus, Coder, MoE nhỏ, VL hoặc Omni, dù chưa tên nào được xác nhận.

Triển vọng benchmark Qwen4: Đường cơ sở Qwen3.8-Max cho thấy gì

Không có điểm benchmark cho Qwen4. Flash-Next và Max trả lời những câu hỏi khác nhau: bảng điểm Flash-Next kiểm tra năng lực định hướng hiệu năng của kiến trúc mới, trong khi bảng điểm chính thức Qwen3.8-Max vẫn là đường cơ sở năng lực sản xuất mạnh hơn cho tác tử lập trình, tái hiện nghiên cứu, cộng tác chuyên nghiệp, suy luận thị giác, sử dụng di động và sử dụng máy tính. Qwen4 sẽ cần kết hợp cả hai hướng dưới các đánh giá phù hợp.

BenchmarkĐiểm báo cáo của Qwen3.8-MaxQwen4 cần chứng minh điều gì
SWE-Pro67.7Thu hẹp khoảng cách trong giải quyết issue ở quy mô kho chuyên nghiệp
TerminalBench 2.186.6Cải thiện độ tin cậy tác tử terminal dưới cùng bộ đánh giá
PaperBench93.0Duy trì sức mạnh nghiên cứu với tái lập độc lập
FrontierSWE73.5Chuyển hóa suy luận dài hạn thành nhiều công việc hoàn tất hơn
CoWorkBench74.8Tạo ra sản phẩm chuyên nghiệp đáng tin cậy hơn
OSWorld-Verified86.1Giảm lỗi hành động thị giác trong quy trình sử dụng máy tính

Hai đường cơ sở chỉ ra một yêu cầu kép. Flash-Next cho thấy mức tính toán hoạt hóa thấp vẫn có thể mang lại kết quả tác tử và đa phương thức mạnh mẽ; Max cho thấy trần năng lực cao hơn mà một flagship mới phải vượt. Do đó, Qwen4 nên được đánh giá dựa trên cả mức độ thành công nhiệm vụ phù hợp và tổng chi phí quy trình, với điểm do nhà cung cấp báo cáo được tách biệt khỏi tái lập độc lập.

hình

Official Qwen3.8-Max benchmark results. Source: Qwen3.8-Max official release**.

Qwen4 so với các mô hình tuyến đầu hiện tại: Đường cơ sở đã xác nhận và điều chưa biết

So sánh hữu ích nhất không chỉ là Qwen4 với Qwen3.8-Max. Đó là Qwen4 với các lựa chọn thiết kế đã thấy ở Kimi K3, DeepSeek V4 Pro và GLM-5.3. Bảng sau so sánh các thuộc tính mô hình hiện tại đã xác nhận với cột Qwen4 còn chưa biết.

Khía cạnhQwen4Qwen3.8-MaxKimi K3DeepSeek V4 ProGLM-5.3
Trạng tháiBản xem trước kiến trúc đã xác nhận; mô hình chưa phát hànhĐã phát hànhĐã phát hànhĐã phát hànhĐã phát hành
Quy môChưa biết2.4T / khoảng 95B hoạt hóa2.8T / 16 trong 896 chuyên gia1.6T / 49B hoạt hóaChưa tiết lộ cho bản phát hành này
Ngữ cảnhKỳ vọng 1M+1M1M1M1M
Đầu vàoHướng đa phương thức đã xác nhận; giao diện cuối cùng chưa biếtVăn bản, hình ảnh, videoVăn bản và thị giác gốcHướng văn bảnChỉ văn bản
Suy luậnChưa biếtQuy trình suy nghĩ và nhanhNỗ lực thấp / cao / tối đaSuy nghĩ / không suy nghĩLuôn bật; thấp / cao / tối đa
Hệ sinh thái mởTrọng số và giấy phép cuối cùng chưa xác nhậnTồn tại trọng số mở cho flagshipĐịnh vị mã nguồn mởTrọng số mởĐịnh vị mã nguồn mở
Trọng tâmKỳ vọng tác tử đa phương thức hiệu quảLập trình, cộng tác, tác tử thị giácLập trình và công việc tri thứcSuy luận và lập trình hiệu quảLập trình và an ninh mạng

Quy mô mô hình và hiệu quả suy luận

Tài liệu của Kimi mô tả 2,8T tham số và 16 chuyên gia hoạt hóa trên 896. DeepSeek V4 Pro đi theo lộ trình khác với 1,6T tổng và 49B tham số hoạt hóa. Qwen4 không cần là mô hình lớn nhất để thắng so sánh này; nó cần chuyển đổi tính toán hoạt hóa thành nhiều công việc hoàn tất đáng tin cậy hơn.

Ngữ cảnh và đa phương thức

Một triệu token đã trở thành đường cơ sở phổ biến cho flagship, vì vậy độ dài ngữ cảnh một mình sẽ không tạo khác biệt cho Qwen4. Cơ hội mạnh mẽ hơn của Qwen là sử dụng ngữ cảnh đa phương thức: tìm bằng chứng đúng giữa tài liệu, mã, ảnh chụp màn hình và video, rồi thực hiện hành động đúng. Kimi K3 cũng có hiểu thị giác gốc, trong khi giao diện hiện tại của GLM-5.3 chỉ văn bản với ngữ cảnh 1M và đầu ra tối đa 128K.

Lập trình, tác tử và thế mạnh chuyên biệt

Qwen3.8-Max mang hồ sơ rộng về lập trình, nghiên cứu, cộng tác và tác tử thị giác. Qwen3.8-Flash-Next bổ sung một kiến trúc đa phương thức định hướng hiệu năng với năng lực mạnh hơn trên mỗi tham số hoạt hóa. Kimi K3 nhấn mạnh lập trình dài hạn và công việc tri thức, DeepSeek V4 Pro nhấn mạnh suy luận hiệu quả và lập trình mang tính tác tử, còn GLM-5.3 bổ sung trọng tâm an ninh mạng đặc thù. Một màn ra mắt Qwen4 đáng tin cần kết hợp độ tin cậy tác tử rộng với hiệu năng cấp chuyên gia trong kỹ nghệ phần mềm và sử dụng máy tính bằng thị giác.

Trọng số mở không phải toàn bộ câu chuyện triển khai

Trọng số mở có thể cải thiện mức kiểm soát, tùy biến và lựa chọn nhà cung cấp, nhưng so sánh thực tế còn bao gồm điều khoản giấy phép, yêu cầu phần cứng, chất lượng lượng tử hóa, hỗ trợ tinh chỉnh và sẵn có của các ngăn phục vụ được tối ưu. Từ “mở” không nên dùng thay cho việc kiểm tra chính xác giấy phép và điều kiện triển khai của từng bản phát hành.

Kết quả so sánh: Vị thế tiềm năng mạnh nhất của Qwen4 là một tác tử đa phương thức rộng kết hợp thế mạnh thị giác và cộng tác của Qwen3.8-Max với kiến trúc tính toán hoạt hóa thấp của Flash-Next và độ tin cậy kỹ nghệ phần mềm tốt hơn. Không thể tuyên bố thắng cuộc cho tới khi có các đánh giá phù hợp và hành vi sản xuất sẵn sàng.

Trường hợp sử dụng tiềm năng cho Qwen4

Kỹ nghệ phần mềm tự động

Một tác tử Qwen mạnh hơn có thể kiểm tra một kho mã, tái hiện một lỗi, chỉnh sửa nhiều tệp, chạy kiểm thử, xem lại thất bại và chuẩn bị thay đổi sẵn sàng cho pull request. Chỉ số quan trọng sẽ là tỷ lệ nhiệm vụ hoàn thành không cần cứu trợ của con người, không phải lượng mã sinh ra.

Công việc tri thức doanh nghiệp

Ngữ cảnh dài và hiểu đa phương thức có thể hỗ trợ quy trình bắt đầu từ hợp đồng, PDF, bảng tính, sơ đồ và biên bản họp và kết thúc bằng một bản ghi nhớ quyết định, phân tích hoặc kế hoạch hành động có cấu trúc. Doanh nghiệp vẫn cần kiểm soát truy xuất, nhật ký kiểm toán và xác minh nguồn xung quanh mô hình.

Tác tử sử dụng máy tính đa phương thức

Qwen4 có thể hữu ích khi tác tử phải diễn giải ảnh chụp màn hình, điều hướng ứng dụng, xác minh trạng thái UI và phục hồi khi một cú nhấp hoặc gửi biểu mẫu tạo ra kết quả không mong đợi. Đây là mở rộng tự nhiên của đường cơ sở thị giác và kiểu OSWorld mạnh mẽ của Qwen3.8-Max, nhưng hỗ trợ điều khiển máy tính gốc chưa được công bố.

Nghiên cứu khoa học và kỹ thuật

Quy trình nghiên cứu kết hợp đọc tài liệu, mã, mô phỏng, phân tích dữ liệu và viết báo cáo. Một mô hình Qwen tương lai có thể điều phối các bước này và duy trì lịch sử thực nghiệm dài hơn. Hiệu năng PaperBench khiến đây là hướng đáng tin, nhưng khả năng tái lập và xác minh độc lập vẫn là điều cốt yếu.

Điều chúng ta chưa biết

Dù Qwen đã thừa nhận kiến trúc qua Flash-Next, các chi tiết sản xuất sau vẫn chưa có và nên giữ ở trạng thái chưa xác quyết cho tới khi có thông báo Qwen4 chính thức:

  • Tên sản phẩm chính xác và việc Qwen4 ra mắt như một mô hình hay một gia đình.
  • Ngày phát hành hoặc lịch trình xem trước.
  • Liệu các mô hình cuối giữ nguyên tỷ lệ GDN/QSA, thiết kế phần dư có cổng, quy mô embedding n-gram và định tuyến chuyên gia của Flash-Next hay không.
  • Tổng tham số, tham số hoạt hóa, số lượng chuyên gia và quy mô dữ liệu huấn luyện cho từng mô hình Qwen4.
  • Độ dài ngữ cảnh gốc, mặc định, đầu ra tối đa và phương thức được hỗ trợ cho từng tuyến.
  • Khả năng âm thanh gốc, tạo ảnh, giọng nói hay tạo video.
  • Kết quả benchmark chính thức và bộ khung đánh giá dùng cho từng điểm số.
  • Tính sẵn có trọng số mở, điều khoản giấy phép và điều kiện sử dụng thương mại.
  • Giá API, vùng khả dụng, giới hạn tốc độ và ID mô hình cuối cùng.

Quy tắc xác minh: Xem mọi thông số cụ thể, biểu đồ benchmark, bảng giá hay định danh API của Qwen4 là chưa xác thực trừ khi có thể truy xuất trực tiếp từ Qwen, Alibaba Cloud hoặc kho mô hình chính thức.

Khi nào Qwen4 sẽ phát hành?

Không có ngày phát hành công khai có thể bảo vệ. Qwen3.8-Flash-Next xác nhận rằng Qwen đang thử nghiệm kiến trúc sẽ làm nền cho Qwen4, nhưng tài liệu công khai không cung cấp lịch cho một mô hình Qwen4 sản xuất. Hoàn tất huấn luyện, hiệu quả phục vụ, đánh giá an toàn, cấp phép trọng số và tích hợp sản phẩm đều có thể ảnh hưởng thời điểm và hình dạng phát hành.

Cách xuất bản an toàn nhất là tránh dự đoán theo tháng hoặc quý. Độc giả nên theo dõi trang chính thức của Qwen, tài liệu Alibaba Cloud Model Studio, các kho mô hình đã xác minh và danh mục mô hình CometAPI. Trang mô hình Qwen4 chỉ nên được thêm sau khi mô hình thực sự được liệt kê.

Nhà phát triển có thể chuẩn bị cho Qwen4 như thế nào

  • Thiết lập hai đường cơ sở. Dùng Qwen3.8-Flash-Next để đo hiệu quả kiến trúc và Qwen3.8-Max để đo năng lực flagship hiện tại.
  • Tách ID mô hình khỏi logic nghiệp vụ. Giữ định tuyến và cấu hình bên ngoài mã ứng dụng để có thể hoán đổi mô hình an toàn.
  • Xây dựng đánh giá cấp nhiệm vụ. Đo lường các sửa lỗi phần mềm hoàn tất, đầu ra nghiên cứu chính xác, chuỗi công cụ thành công và sản phẩm bàn giao dùng được.
  • Ghi nhật ký tổng chi phí quy trình. Theo dõi độ trễ, token đầu vào/đầu ra, sử dụng bộ nhớ đệm, thử lại, hành động thất bại và công sức làm lại của con người.
  • Bảo toàn tuyến dự phòng. Dùng định tuyến mô hình và nhà cung cấp dự phòng thay vì biến một mô hình chưa phát hành thành điểm lỗi đơn.
  • Không bịa ID mô hình. Chờ định danh chính thức trước khi thêm qwen4 hoặc qwen4-max vào cấu hình sản xuất.

Dùng thử Qwen3.8-Flash-Next và Qwen3.8-Max qua CometAPI

Nhà phát triển hiện có thể thử Qwen3.8-Flash-Next qua CometAPI và giữ Qwen3.8-Max làm đối chứng flagship. Tạo một API key, lưu trong biến môi trường và gọi mô hình hiện có qua client tương thích OpenAI. Ví dụ cố ý dùng qwen3.8-flash-next; không giả định định danh Qwen4 trong tương lai.

Kết luận

Qwen4 giờ không còn là tin đồn: Qwen đã chỉ rõ Qwen3.8-Flash-Next là bản xem trước thử nghiệm của kiến trúc sẽ làm nền tảng cho nó. Bản xem trước xác nhận hướng MoE siêu thưa, đa phương thức, dựa trên Gated DeltaNet, Qwen Sparse Attention, phần dư có cổng và embedding n-gram. Qwen3.8-Max vẫn là đường cơ sở năng lực hiện tại mạnh hơn.

Bài kiểm tra thực sự cho Qwen4 sẽ không phải là số tham số lớn hơn. Sẽ là việc mô hình cuối cùng có thể kết hợp hiệu năng của Flash-Next với năng lực cấp Max, hoàn thành công việc dài hơn với ít lỗi hơn và sử dụng bằng chứng đa phương thức đáng tin cậy hơn hay không. Hướng kiến trúc đã công khai, nhưng thông số cuối, benchmark, giấy phép, giá, ID API và ngày phát hành vẫn chưa biết.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 6, 2026
Cập nhật lần cuối Sep 6, 2026
4 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm