TL;DR
Qwen3.8-Omni-Flash là mô hình đa phương thức bản địa của Alibaba Qwen dành cho hiểu văn bản, hình ảnh, âm thanh và video, với văn bản là chế độ đầu ra. Được công bố vào ngày 18 tháng 9 năm 2026, mô hình kết hợp cửa sổ ngữ cảnh 1M token, suy luận âm thanh–hình ảnh bản địa, tư duy có thể điều chỉnh, gọi hàm, tìm kiếm web, hiểu âm thanh không gian và sử dụng công cụ.
Thay đổi quan trọng nhất không chỉ là hiểu video tốt hơn. Qwen mô tả đây là mô hình đa phương thức đầu tiên được xây dựng xoay quanh khả năng tác tử (agentic): nó có thể hiểu những gì nó thấy và nghe, lập kế hoạch bước tiếp theo, gọi công cụ và xử lý các tác vụ dài như biên tập vlog, dịch video, sản xuất tóm tắt phim, phân tích cuộc họp và nghiên cứu đa phương tiện.
Khi ra mắt, Qwen báo cáo mức cải thiện trung bình hơn 25% trên 29 phép đánh giá so với Qwen3.5-Omni-Plus. Đây là kết quả do nhà cung cấp công bố khi ra mắt, chưa phải đánh giá độc lập.
Key Takeaways
- Đầu vào đa phương thức bản địa: Qwen3.8-Omni-Flash nhận văn bản, hình ảnh, âm thanh và video, trong khi hiện trả về văn bản.
- Quy trình tác tử cho nội dung media: Kết hợp hiểu nội dung media với lập kế hoạch, gọi hàm và tìm kiếm web.
- Ngữ cảnh dài và chiều sâu âm thanh: Mô hình được lưu trữ cung cấp cửa sổ ngữ cảnh 1M token và hỗ trợ âm thanh đa ngôn ngữ, stereo và ambisonics bậc nhất (FOA).
- Tăng điểm chuẩn do nhà cung cấp báo cáo: Cải thiện lớn nhất xuất hiện ở tác tử đa phương thức, hiểu âm thanh dài, phân đoạn người nói và gán định vị âm thanh.
- Khả dụng dạng dịch vụ: Mô hình có sẵn qua API được lưu trữ; Qwen-MM-Plugins được mở nguồn riêng cho các quy trình tác tử đa phương thức.
Nhà phát triển có thể truy cập Qwen3.8-Omni-Flash API trên CometAPI qua một quy trình API hợp nhất.
What Is Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash là mô hình đa phương thức bản địa thế hệ tiếp theo của Qwen. Thay vì coi âm thanh hoặc video chỉ là hiện vật tiền xử lý, mô hình suy luận trên văn bản, khung hình thị giác, giọng nói, âm thanh môi trường và quan hệ thời gian trong một quy trình duy nhất. Các đầu vào được hỗ trợ gồm văn bản, hình ảnh, âm thanh và video; đầu ra hiện là văn bản.
Sự khác biệt về đầu ra này là quan trọng. Tài liệu chính thức của Alibaba Cloud định vị Qwen3.8-Omni-Flash cho hiểu đa phương thức và thực thi tác tử, trong khi các trường hợp sử dụng đầu ra giọng nói vẫn phù hợp hơn với các biến thể Qwen Omni hỗ trợ sinh âm thanh.
Cách đóng khung khi ra mắt chuyển từ “nhận biết phương tiện” sang “hiểu, lập kế hoạch, thực thi và bàn giao”. Điều đó khiến mô hình phù hợp với biên tập video, nghiên cứu đa phương tiện, phân tích cuộc họp, xử lý video hướng dẫn và các quy trình khác nơi mô hình phải làm điều gì đó với media chứ không chỉ tóm tắt.
Qwen3.8-Omni-Flash specifications
Bảng thông số dưới đây dựa trên trang mô hình chính thức của Alibaba Cloud và QwenCloud; giới hạn và giá có thể khác nhau theo khu vực và cần được kiểm tra lại trước khi công bố hoặc triển khai.
| Thông số | Qwen3.8-Omni-Flash — trang mô hình chính thức |
|---|---|
| Nhà phát triển | Alibaba Qwen |
| Ngày phát hành | 18 tháng 9, 2026 |
| Loại mô hình | Mô hình đa phương thức bản địa |
| Đầu vào / đầu ra | Văn bản, hình ảnh, âm thanh, video / văn bản |
| Cửa sổ ngữ cảnh | 1,000,000 token |
| Đầu vào tối đa | 991,808 token thông thường; 983,616 token ở chế độ tư duy |
| Đầu ra tối đa | 131,072 token |
| Hạn mức suy luận tối đa | Tối đa 262K token trên QwenCloud |
| Tư duy | Bật theo mặc định; có thể cấu hình mức độ suy luận |
| Công cụ và bộ nhớ đệm | Gọi hàm, tìm kiếm web, bộ nhớ đệm ngầm và bộ nhớ đệm phiên |
| Âm thanh | 113 ngôn ngữ và phương ngữ; stereo và FOA 4 kênh |
| Kiểu API | Chat Completions và Responses |
| Giá QwenCloud | $0.15 đầu vào, $0.47 đầu ra, và $0.016 đầu vào bộ nhớ đệm ngầm mỗi 1M token |
| Trọng số mở | Không công bố cho mô hình này khi ra mắt |
How Does Qwen3.8-Omni-Flash Work?
QwenCloud cho biết Qwen3.8-Omni-Flash được xây dựng trên kiến trúc Qwen3.8-Flash-Next. Điều đó cung cấp ngữ cảnh kiến trúc, nhưng số lượng tham số được công bố cho Flash-Next không nên tự động được trình bày như thông số tham số chính xác của mô hình Omni trừ khi Qwen xác nhận sự ánh xạ đó.
Gated DeltaNet + Qwen Sparse Attention
Nền tảng Flash-Next kết hợp Gated DeltaNet với Qwen Sparse Attention. Nói một cách đơn giản, thành phần hồi quy nén thông tin lịch sử thành một trạng thái gọn, trong khi sparse attention truy xuất bối cảnh tầm xa được chọn thay vì áp dụng full attention dày đặc cho mọi cặp token. Điều này đặc biệt quan trọng với các luồng âm thanh và video dài, nơi độ dài chuỗi có thể chi phối chi phí tính toán.
Agentic perception instead of static perception
Thay đổi lớn hơn nằm ở cấp hệ thống. Qwen cho biết mô hình có thể chủ động khám phá các video dài và tập trung vào những khoảnh khắc liên quan, thay vì phân bổ tài nguyên tính toán đồng đều cho mọi đoạn. Về mặt khái niệm, tác tử xác định nơi có khả năng xuất hiện bằng chứng, quan sát sâu hơn các khoảnh khắc đó, suy luận về chúng, rồi quyết định công cụ hoặc thao tác tiếp theo.
What Are the Main Qwen3.8-Omni-Flash Features?
Native audio-video reasoning
Qwen3.8-Omni-Flash suy luận đồng thời trên các luồng hình ảnh và âm thanh của một video. Điều này quan trọng khi câu trả lời phụ thuộc vào cả hai mô thức: xác định ai đã nói, quyết định liệu một âm thanh xảy ra trước hay sau một hành động, diễn giải nhạc nền hoặc âm thanh môi trường, hoặc kết nối hướng dẫn được nói với những gì xuất hiện trên màn hình.
Multi-speaker and spatial audio understanding
API hỗ trợ âm thanh đa kênh, gồm stereo hai kênh và ambisonics bậc nhất bốn kênh. Việc bảo toàn thông tin hướng có thể hữu ích cho phân tích cuộc họp, tác tử hiện thân, sự kiện được ghi âm, môi trường nhiều người nói và gán định vị âm thanh.
Adjustable reasoning effort
Tư duy được bật theo mặc định. Nhà phát triển có thể cấu hình mức độ tư duy để đánh đổi độ trễ và mức tiêu thụ token với khả năng suy luận sâu hơn cho các tác vụ đa phương tiện phức tạp.
Function calling and web search
Gọi hàm và tìm kiếm web là trung tâm của định vị tác tử. Sau khi hiểu một video, hình ảnh hoặc tệp âm thanh, mô hình có thể truyền tham số có cấu trúc cho công cụ bên ngoài, truy xuất thông tin bổ sung hoặc tiếp tục một quy trình bên ngoài mô hình.
Qwen-MM-Plugins
Qwen cũng phát hành Qwen-MM-Plugins, một bộ công cụ Apache-2.0 cho bộ khung tác tử đa phương thức bản địa. Các quy trình làm việc của nó bao gồm sản xuất video, chuyển video thành ghi chú, học kỹ năng có thể tái sử dụng từ video minh họa và bộ nhớ nghe nhìn.
How Good Is Qwen3.8-Omni-Flash on Benchmarks?
Is Qwen3.8-Omni-Flash Still Good at Text and Coding?
Kết quả ra mắt của Qwen cho thấy mô hình Omni giữ gần với mô hình văn bản Flash liên quan trên một số đánh giá lập trình và suy luận. Qwen báo cáo 92.6 trên LiveCodeBench v6, 63.3 trên SWE-bench Pro và 91.0 trên GPQA Diamond. Đây là các kết quả do nhà cung cấp báo cáo theo thiết lập ra mắt của Qwen và cần được xác thực so với các tác vụ mã hóa và khung tác tử dùng trong sản xuất.
Qwen báo cáo mức cải thiện trung bình hơn 25% trên 29 phép đánh giá so với Qwen3.5-Omni-Plus. Các bảng sau tóm tắt kết quả điểm chuẩn khi ra mắt chính thức. Chúng là kết quả nhất phương và tại thời điểm công bố chưa được tái lập độc lập.
Điều kiện đánh giá: Các hàng tĩnh đo một lần chạy mô hình dưới thiết lập ra mắt của Qwen. Các hàng gắn nhãn “+ agent” bao gồm khung tác tử bao quanh, truy hồi hoặc kiểm tra media lặp. Tài liệu ra mắt chính thức cần được tham khảo cho mẫu lời nhắc, thiết lập lấy mẫu, tiền xử lý media và phiên bản khung; khi các chi tiết đó không được công bố, kết quả nên được coi là do nhà cung cấp báo cáo chứ không phải có thể tái lập độc lập.
Ý nghĩa lớn hơn là chuyển dịch từ hiểu đa phương thức sang thực thi đa phương thức. Các pipeline trước đây thường phiên âm âm thanh, lấy mẫu khung hình video, gửi các hiện vật đó đến một LLM, tạo câu trả lời rồi dựa vào logic ứng dụng riêng cho tác vụ thực tế. Qwen3.8-Omni-Flash được thiết kế để nén nhiều vòng lặp đó vào một hệ tác tử.
Một tác tử sản xuất media có thể quan sát cảnh quay và âm thanh trước khi lập kế hoạch chỉnh sửa. Một tác tử cuộc họp có thể kết hợp danh tính người nói với nội dung nói và hình ảnh bản trình bày. Một tác tử nghiên cứu có thể định vị các khoảnh khắc liên quan trong hàng giờ tư liệu nghe nhìn rồi tìm kiếm ngữ cảnh bên ngoài. Theo cách đóng khung này, âm thanh và video trở thành ngữ cảnh làm việc cho một tác tử thay vì tệp đính kèm thụ động.
Audio-video agents
| Benchmark — nguồn ra mắt chính thức | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
Bước nhảy thế hệ lớn nhất là WildClawBench-MM, nơi Qwen báo cáo tăng từ 34.5 lên 71.0. AgenticVBench cũng cải thiện mạnh, trong khi Gemini 3.8 Flash vẫn dẫn trước ở điểm chuẩn đó. Do đó, mô hình không “thắng tất cả” một cách phổ quát.
Audio-video understanding and reasoning
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code agent | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + agent | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + agent | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
Các hàng tĩnh cho kết quả hỗn hợp. Gemini dẫn đầu ở một số bài kiểm tra suy luận video truyền thống, nhưng kết quả của Qwen thường tăng khi nằm trong vòng lặp tác tử. Sự khác biệt đó chỉ có ý nghĩa khi ứng dụng sản xuất sử dụng truy hồi, công cụ hoặc kiểm tra lặp tương tự.
Audio and multi-speaker understanding
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
Các hàng về cuộc họp là điểm nổi bật, trong khi FLEURS-ASR và VoiceBench không cải thiện so với thế hệ trước. Kết quả ra mắt do đó cho thấy hiểu âm thanh nhiều người nói, không gian và ngữ cảnh dài phong phú hơn, chứ không phải thắng lợi đồng đều về nhận dạng giọng nói.
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
Bảng kết hợp thông tin sản phẩm chính thức của Qwen với thông số chính thức của Gemini 3.8 Flash từ Google. So sánh điểm chuẩn là do Qwen chạy và không nên coi là xếp hạng trung lập từ bên thứ ba.
| Khía cạnh | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Kiến trúc | Nền tảng Qwen3.8-Flash-Next; ánh xạ tham số Omni chính xác chưa công bố | Thế hệ Qwen Omni trước đó | Kiến trúc Gemini độc quyền của Google |
| Cửa sổ ngữ cảnh | 1M token | Giới hạn triển khai nhỏ hơn | 1,048,576 token đầu vào |
| Tư duy | Mức độ tư duy có thể điều chỉnh; tư duy bật theo mặc định | Không có chế độ tư duy mặc định tương đương trong triển khai dẫn chiếu | Các mức tư duy thấp, trung bình và cao |
| Đầu vào đa phương thức | Văn bản, hình ảnh, âm thanh, video | Văn bản, hình ảnh, âm thanh, video | Văn bản, hình ảnh, video, âm thanh và PDF |
| Đầu ra | Văn bản | Văn bản và quy trình đầu ra giọng nói được hỗ trợ | Văn bản |
| Lập trình | Điểm lập trình mạnh do nhà cung cấp báo cáo; không phải khác biệt chính | Không phải định vị chính | Thiết kế cho kỹ nghệ phần mềm dài hạn và tác tử |
| Khả dụng API | Chat Completions và Responses; API được lưu trữ | API Qwen được lưu trữ | Gemini API; khả dụng rộng rãi |
| Công cụ | Gọi hàm và tìm kiếm web | Gọi hàm và tìm kiếm web | Gọi hàm, grounding với tìm kiếm, thực thi mã và các công cụ tích hợp khác |
| Giá API công bố | QwenCloud: $0.15 đầu vào / $0.47 đầu ra mỗi 1M token | Phụ thuộc khu vực và đầu cuối | Giá giới thiệu của Google: $0.75 đầu vào / $3.75 đầu ra mỗi 1M token đến hết 31/12/2026 |
| Phù hợp nhất | Tác tử và phân tích media | Trò chuyện Omni và đầu ra giọng nói | Quy trình đa phương thức rộng, lập trình và tác tử tự động |
Qwen3.5-Omni-Plus vẫn phù hợp khi cần sinh giọng nói. Qwen3.8-Omni-Flash rõ ràng tối ưu hơn cho hiểu âm thanh–hình ảnh hiệu quả cùng thực thi định hướng công cụ.
So với Gemini 3.8 Flash, đánh giá của Qwen là hỗn hợp: Qwen3.8-Omni-Flash cạnh tranh ở âm thanh, xử lý nhiều người nói, gán định vị và một số quy trình tác tử, trong khi Gemini dẫn ở một số bài suy luận video tĩnh. So sánh hợp lý nên theo từng khối công việc cụ thể.
Nhà phát triển đang đánh giá truy cập hợp nhất có thể so sánh Gemini 3.8 Flash API trên CometAPI, Qwen3.8-Flash API trên CometAPI, và Qwen3.8-Flash-Next API trên CometAPI ngoài bảng để liên kết nguồn kỹ thuật và liên kết truy cập sản phẩm vẫn tách biệt.
Limitations of Qwen3.8-Omni-Flash
- Chỉ đầu ra văn bản: Mô hình hiểu âm thanh và video nhưng không sinh giọng nói làm phương thức phản hồi.
- Triển khai dạng dịch vụ: Không công bố trọng số mở cho Qwen3.8-Omni-Flash khi ra mắt.
- Điểm chuẩn mới: So sánh tiêu đề chủ yếu là kết quả nhất phương và cần tái lập độc lập.
- Ảnh hưởng của khung tác tử: Một số điểm số bao gồm truy hồi, môi trường công cụ hoặc kiểm tra lặp và không nên nhầm với kết quả mô hình thô.
- Chi phí phụ thuộc quy trình: Video dài vẫn có thể tốn kém nếu ứng dụng liên tục xử lý lại các đoạn lớn thay vì dùng truy hồi, bộ nhớ đệm hoặc kiểm tra có mục tiêu.
Who Should Use Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash đáng chú ý nhất khi âm thanh hoặc video là một phần của chính tác vụ chứ không chỉ là tệp đính kèm cần tóm tắt. Trường hợp phù hợp bao gồm trí tuệ cuộc họp, tìm kiếm media dạng dài, pipeline dịch video, quy trình chuyển video hướng dẫn thành ghi chú, tác tử sản xuất media và lưu trữ nghe nhìn.
Với trò chuyện văn bản truyền thống, một mô hình Flash văn bản chuyên dụng có thể đơn giản hơn. Với ứng dụng đầu ra giọng nói, một mô hình Omni hỗ trợ sinh âm thanh rõ ràng có thể phù hợp hơn. Với quy trình kết hợp nhìn, nghe, suy luận và hành động, Qwen3.8-Omni-Flash là lựa chọn khác biệt hơn trong danh mục Qwen.
Conclusion
Qwen3.8-Omni-Flash nên được hiểu là một mô hình âm thanh–hình ảnh mang tính tác tử, không chỉ là một bản phát hành Flash đa phương thức khác. Cửa sổ ngữ cảnh 1M, suy luận âm thanh–hình ảnh bản địa, khả năng đa người nói và âm thanh không gian, tư duy có thể điều chỉnh, gọi hàm, tìm kiếm và hệ sinh thái Qwen-MM-Plugins đều hướng tới cùng một chuyển dịch: để hệ thống AI chuyển từ hiểu đa phương tiện sang làm việc với đa phương tiện.
Dữ liệu ra mắt cho thấy cải thiện đáng kể so với Qwen3.5-Omni-Plus, đặc biệt ở quy trình tác tử và kịch bản âm thanh phức tạp. So với Gemini 3.8 Flash, con số của Qwen cân bằng hơn. Câu hỏi quan trọng vì thế không phải mô hình nào thắng một bảng, mà là kết hợp mô hình–khung nào hoàn thành quy trình mục tiêu chính xác và kinh tế.
