GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/Nghiên cứu CometAPI

Qwen3.8-Omni-Flash là gì và làm thế nào để truy cập?

Tìm hiểu Qwen3.8-Omni-Flash là gì, bao gồm các tác nhân âm thanh–video, kiến trúc, điểm chuẩn, giá, các hạn chế và truy cập API của nó.

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 21, 2026 15 phút đọc
Qwen3.8-Omni-Flash là gì và làm thế nào để truy cập?
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Qwen3.8-Omni-Flash là mô hình đa phương thức bản địa của Alibaba Qwen dành cho hiểu văn bản, hình ảnh, âm thanh và video, với văn bản là chế độ đầu ra. Được công bố vào ngày 18 tháng 9 năm 2026, mô hình kết hợp cửa sổ ngữ cảnh 1M token, suy luận âm thanh–hình ảnh bản địa, tư duy có thể điều chỉnh, gọi hàm, tìm kiếm web, hiểu âm thanh không gian và sử dụng công cụ.

Thay đổi quan trọng nhất không chỉ là hiểu video tốt hơn. Qwen mô tả đây là mô hình đa phương thức đầu tiên được xây dựng xoay quanh khả năng tác tử (agentic): nó có thể hiểu những gì nó thấy và nghe, lập kế hoạch bước tiếp theo, gọi công cụ và xử lý các tác vụ dài như biên tập vlog, dịch video, sản xuất tóm tắt phim, phân tích cuộc họp và nghiên cứu đa phương tiện.

Khi ra mắt, Qwen báo cáo mức cải thiện trung bình hơn 25% trên 29 phép đánh giá so với Qwen3.5-Omni-Plus. Đây là kết quả do nhà cung cấp công bố khi ra mắt, chưa phải đánh giá độc lập.

Key Takeaways

  • Đầu vào đa phương thức bản địa: Qwen3.8-Omni-Flash nhận văn bản, hình ảnh, âm thanh và video, trong khi hiện trả về văn bản.
  • Quy trình tác tử cho nội dung media: Kết hợp hiểu nội dung media với lập kế hoạch, gọi hàm và tìm kiếm web.
  • Ngữ cảnh dài và chiều sâu âm thanh: Mô hình được lưu trữ cung cấp cửa sổ ngữ cảnh 1M token và hỗ trợ âm thanh đa ngôn ngữ, stereo và ambisonics bậc nhất (FOA).
  • Tăng điểm chuẩn do nhà cung cấp báo cáo: Cải thiện lớn nhất xuất hiện ở tác tử đa phương thức, hiểu âm thanh dài, phân đoạn người nói và gán định vị âm thanh.
  • Khả dụng dạng dịch vụ: Mô hình có sẵn qua API được lưu trữ; Qwen-MM-Plugins được mở nguồn riêng cho các quy trình tác tử đa phương thức.

Nhà phát triển có thể truy cập Qwen3.8-Omni-Flash API trên CometAPI qua một quy trình API hợp nhất.

What Is Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash là mô hình đa phương thức bản địa thế hệ tiếp theo của Qwen. Thay vì coi âm thanh hoặc video chỉ là hiện vật tiền xử lý, mô hình suy luận trên văn bản, khung hình thị giác, giọng nói, âm thanh môi trường và quan hệ thời gian trong một quy trình duy nhất. Các đầu vào được hỗ trợ gồm văn bản, hình ảnh, âm thanh và video; đầu ra hiện là văn bản.

Sự khác biệt về đầu ra này là quan trọng. Tài liệu chính thức của Alibaba Cloud định vị Qwen3.8-Omni-Flash cho hiểu đa phương thức và thực thi tác tử, trong khi các trường hợp sử dụng đầu ra giọng nói vẫn phù hợp hơn với các biến thể Qwen Omni hỗ trợ sinh âm thanh.

Cách đóng khung khi ra mắt chuyển từ “nhận biết phương tiện” sang “hiểu, lập kế hoạch, thực thi và bàn giao”. Điều đó khiến mô hình phù hợp với biên tập video, nghiên cứu đa phương tiện, phân tích cuộc họp, xử lý video hướng dẫn và các quy trình khác nơi mô hình phải làm điều gì đó với media chứ không chỉ tóm tắt.

Qwen3.8-Omni-Flash specifications

Bảng thông số dưới đây dựa trên trang mô hình chính thức của Alibaba Cloud và QwenCloud; giới hạn và giá có thể khác nhau theo khu vực và cần được kiểm tra lại trước khi công bố hoặc triển khai.

Thông sốQwen3.8-Omni-Flash — trang mô hình chính thức
Nhà phát triểnAlibaba Qwen
Ngày phát hành18 tháng 9, 2026
Loại mô hìnhMô hình đa phương thức bản địa
Đầu vào / đầu raVăn bản, hình ảnh, âm thanh, video / văn bản
Cửa sổ ngữ cảnh1,000,000 token
Đầu vào tối đa991,808 token thông thường; 983,616 token ở chế độ tư duy
Đầu ra tối đa131,072 token
Hạn mức suy luận tối đaTối đa 262K token trên QwenCloud
Tư duyBật theo mặc định; có thể cấu hình mức độ suy luận
Công cụ và bộ nhớ đệmGọi hàm, tìm kiếm web, bộ nhớ đệm ngầm và bộ nhớ đệm phiên
Âm thanh113 ngôn ngữ và phương ngữ; stereo và FOA 4 kênh
Kiểu APIChat Completions và Responses
Giá QwenCloud$0.15 đầu vào, $0.47 đầu ra, và $0.016 đầu vào bộ nhớ đệm ngầm mỗi 1M token
Trọng số mởKhông công bố cho mô hình này khi ra mắt

How Does Qwen3.8-Omni-Flash Work?

QwenCloud cho biết Qwen3.8-Omni-Flash được xây dựng trên kiến trúc Qwen3.8-Flash-Next. Điều đó cung cấp ngữ cảnh kiến trúc, nhưng số lượng tham số được công bố cho Flash-Next không nên tự động được trình bày như thông số tham số chính xác của mô hình Omni trừ khi Qwen xác nhận sự ánh xạ đó.

Gated DeltaNet + Qwen Sparse Attention

Nền tảng Flash-Next kết hợp Gated DeltaNet với Qwen Sparse Attention. Nói một cách đơn giản, thành phần hồi quy nén thông tin lịch sử thành một trạng thái gọn, trong khi sparse attention truy xuất bối cảnh tầm xa được chọn thay vì áp dụng full attention dày đặc cho mọi cặp token. Điều này đặc biệt quan trọng với các luồng âm thanh và video dài, nơi độ dài chuỗi có thể chi phối chi phí tính toán.

Agentic perception instead of static perception

Thay đổi lớn hơn nằm ở cấp hệ thống. Qwen cho biết mô hình có thể chủ động khám phá các video dài và tập trung vào những khoảnh khắc liên quan, thay vì phân bổ tài nguyên tính toán đồng đều cho mọi đoạn. Về mặt khái niệm, tác tử xác định nơi có khả năng xuất hiện bằng chứng, quan sát sâu hơn các khoảnh khắc đó, suy luận về chúng, rồi quyết định công cụ hoặc thao tác tiếp theo.

What Are the Main Qwen3.8-Omni-Flash Features?

Native audio-video reasoning

Qwen3.8-Omni-Flash suy luận đồng thời trên các luồng hình ảnh và âm thanh của một video. Điều này quan trọng khi câu trả lời phụ thuộc vào cả hai mô thức: xác định ai đã nói, quyết định liệu một âm thanh xảy ra trước hay sau một hành động, diễn giải nhạc nền hoặc âm thanh môi trường, hoặc kết nối hướng dẫn được nói với những gì xuất hiện trên màn hình.

Multi-speaker and spatial audio understanding

API hỗ trợ âm thanh đa kênh, gồm stereo hai kênh và ambisonics bậc nhất bốn kênh. Việc bảo toàn thông tin hướng có thể hữu ích cho phân tích cuộc họp, tác tử hiện thân, sự kiện được ghi âm, môi trường nhiều người nói và gán định vị âm thanh.

Adjustable reasoning effort

Tư duy được bật theo mặc định. Nhà phát triển có thể cấu hình mức độ tư duy để đánh đổi độ trễ và mức tiêu thụ token với khả năng suy luận sâu hơn cho các tác vụ đa phương tiện phức tạp.

Gọi hàm và tìm kiếm web là trung tâm của định vị tác tử. Sau khi hiểu một video, hình ảnh hoặc tệp âm thanh, mô hình có thể truyền tham số có cấu trúc cho công cụ bên ngoài, truy xuất thông tin bổ sung hoặc tiếp tục một quy trình bên ngoài mô hình.

Qwen-MM-Plugins

Qwen cũng phát hành Qwen-MM-Plugins, một bộ công cụ Apache-2.0 cho bộ khung tác tử đa phương thức bản địa. Các quy trình làm việc của nó bao gồm sản xuất video, chuyển video thành ghi chú, học kỹ năng có thể tái sử dụng từ video minh họa và bộ nhớ nghe nhìn.

How Good Is Qwen3.8-Omni-Flash on Benchmarks?

Is Qwen3.8-Omni-Flash Still Good at Text and Coding?

Kết quả ra mắt của Qwen cho thấy mô hình Omni giữ gần với mô hình văn bản Flash liên quan trên một số đánh giá lập trình và suy luận. Qwen báo cáo 92.6 trên LiveCodeBench v6, 63.3 trên SWE-bench Pro và 91.0 trên GPQA Diamond. Đây là các kết quả do nhà cung cấp báo cáo theo thiết lập ra mắt của Qwen và cần được xác thực so với các tác vụ mã hóa và khung tác tử dùng trong sản xuất.

Qwen báo cáo mức cải thiện trung bình hơn 25% trên 29 phép đánh giá so với Qwen3.5-Omni-Plus. Các bảng sau tóm tắt kết quả điểm chuẩn khi ra mắt chính thức. Chúng là kết quả nhất phương và tại thời điểm công bố chưa được tái lập độc lập.

Điều kiện đánh giá: Các hàng tĩnh đo một lần chạy mô hình dưới thiết lập ra mắt của Qwen. Các hàng gắn nhãn “+ agent” bao gồm khung tác tử bao quanh, truy hồi hoặc kiểm tra media lặp. Tài liệu ra mắt chính thức cần được tham khảo cho mẫu lời nhắc, thiết lập lấy mẫu, tiền xử lý media và phiên bản khung; khi các chi tiết đó không được công bố, kết quả nên được coi là do nhà cung cấp báo cáo chứ không phải có thể tái lập độc lập.

Ý nghĩa lớn hơn là chuyển dịch từ hiểu đa phương thức sang thực thi đa phương thức. Các pipeline trước đây thường phiên âm âm thanh, lấy mẫu khung hình video, gửi các hiện vật đó đến một LLM, tạo câu trả lời rồi dựa vào logic ứng dụng riêng cho tác vụ thực tế. Qwen3.8-Omni-Flash được thiết kế để nén nhiều vòng lặp đó vào một hệ tác tử.

Một tác tử sản xuất media có thể quan sát cảnh quay và âm thanh trước khi lập kế hoạch chỉnh sửa. Một tác tử cuộc họp có thể kết hợp danh tính người nói với nội dung nói và hình ảnh bản trình bày. Một tác tử nghiên cứu có thể định vị các khoảnh khắc liên quan trong hàng giờ tư liệu nghe nhìn rồi tìm kiếm ngữ cảnh bên ngoài. Theo cách đóng khung này, âm thanh và video trở thành ngữ cảnh làm việc cho một tác tử thay vì tệp đính kèm thụ động.

Audio-video agents

Benchmark — nguồn ra mắt chính thứcQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71.034.558.9
UniClawBench69.667.169.0
AgenticVBench36.814.545.0
OmniGAIA74.078.6
StreamingBench80.857.179.9

Bước nhảy thế hệ lớn nhất là WildClawBench-MM, nơi Qwen báo cáo tăng từ 34.5 lên 71.0. AgenticVBench cũng cải thiện mạnh, trong khi Gemini 3.8 Flash vẫn dẫn trước ở điểm chuẩn đó. Do đó, mô hình không “thắng tất cả” một cách phổ quát.

Audio-video understanding and reasoning

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63.453.865.2
OmniVideoBench + Qwen Code agent67.865.2
Video-MME-v265.071.0
Video-MME-v2 + agent71.371.0
LVOmniBench63.370.7
LVOmniBench + agent73.670.7
JointAVBench75.970.4

Các hàng tĩnh cho kết quả hỗn hợp. Gemini dẫn đầu ở một số bài kiểm tra suy luận video truyền thống, nhưng kết quả của Qwen thường tăng khi nằm trong vòng lặp tác tử. Sự khác biệt đó chỉ có ý nghĩa khi ứng dụng sản xuất sử dụng truy hồi, công cụ hoặc kiểm tra lặp tương tự.

Audio and multi-speaker understanding

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82.774.479.3
AliMeeting DER ↓3.488.172.6
AliMeeting cpWER ↓17.289.653.1
FLEURS-ASR WER ↓9.37.27.9
VoiceBench91.692.992.3

Các hàng về cuộc họp là điểm nổi bật, trong khi FLEURS-ASR và VoiceBench không cải thiện so với thế hệ trước. Kết quả ra mắt do đó cho thấy hiểu âm thanh nhiều người nói, không gian và ngữ cảnh dài phong phú hơn, chứ không phải thắng lợi đồng đều về nhận dạng giọng nói.

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

Bảng kết hợp thông tin sản phẩm chính thức của Qwen với thông số chính thức của Gemini 3.8 Flash từ Google. So sánh điểm chuẩn là do Qwen chạy và không nên coi là xếp hạng trung lập từ bên thứ ba.

Khía cạnhQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
Kiến trúcNền tảng Qwen3.8-Flash-Next; ánh xạ tham số Omni chính xác chưa công bốThế hệ Qwen Omni trước đóKiến trúc Gemini độc quyền của Google
Cửa sổ ngữ cảnh1M tokenGiới hạn triển khai nhỏ hơn1,048,576 token đầu vào
Tư duyMức độ tư duy có thể điều chỉnh; tư duy bật theo mặc địnhKhông có chế độ tư duy mặc định tương đương trong triển khai dẫn chiếuCác mức tư duy thấp, trung bình và cao
Đầu vào đa phương thứcVăn bản, hình ảnh, âm thanh, videoVăn bản, hình ảnh, âm thanh, videoVăn bản, hình ảnh, video, âm thanh và PDF
Đầu raVăn bảnVăn bản và quy trình đầu ra giọng nói được hỗ trợVăn bản
Lập trìnhĐiểm lập trình mạnh do nhà cung cấp báo cáo; không phải khác biệt chínhKhông phải định vị chínhThiết kế cho kỹ nghệ phần mềm dài hạn và tác tử
Khả dụng APIChat Completions và Responses; API được lưu trữAPI Qwen được lưu trữGemini API; khả dụng rộng rãi
Công cụGọi hàm và tìm kiếm webGọi hàm và tìm kiếm webGọi hàm, grounding với tìm kiếm, thực thi mã và các công cụ tích hợp khác
Giá API công bốQwenCloud: $0.15 đầu vào / $0.47 đầu ra mỗi 1M tokenPhụ thuộc khu vực và đầu cuốiGiá giới thiệu của Google: $0.75 đầu vào / $3.75 đầu ra mỗi 1M token đến hết 31/12/2026
Phù hợp nhấtTác tử và phân tích mediaTrò chuyện Omni và đầu ra giọng nóiQuy trình đa phương thức rộng, lập trình và tác tử tự động

Qwen3.5-Omni-Plus vẫn phù hợp khi cần sinh giọng nói. Qwen3.8-Omni-Flash rõ ràng tối ưu hơn cho hiểu âm thanh–hình ảnh hiệu quả cùng thực thi định hướng công cụ.

So với Gemini 3.8 Flash, đánh giá của Qwen là hỗn hợp: Qwen3.8-Omni-Flash cạnh tranh ở âm thanh, xử lý nhiều người nói, gán định vị và một số quy trình tác tử, trong khi Gemini dẫn ở một số bài suy luận video tĩnh. So sánh hợp lý nên theo từng khối công việc cụ thể.

Nhà phát triển đang đánh giá truy cập hợp nhất có thể so sánh Gemini 3.8 Flash API trên CometAPI, Qwen3.8-Flash API trên CometAPI, và Qwen3.8-Flash-Next API trên CometAPI ngoài bảng để liên kết nguồn kỹ thuật và liên kết truy cập sản phẩm vẫn tách biệt.

Limitations of Qwen3.8-Omni-Flash

  • Chỉ đầu ra văn bản: Mô hình hiểu âm thanh và video nhưng không sinh giọng nói làm phương thức phản hồi.
  • Triển khai dạng dịch vụ: Không công bố trọng số mở cho Qwen3.8-Omni-Flash khi ra mắt.
  • Điểm chuẩn mới: So sánh tiêu đề chủ yếu là kết quả nhất phương và cần tái lập độc lập.
  • Ảnh hưởng của khung tác tử: Một số điểm số bao gồm truy hồi, môi trường công cụ hoặc kiểm tra lặp và không nên nhầm với kết quả mô hình thô.
  • Chi phí phụ thuộc quy trình: Video dài vẫn có thể tốn kém nếu ứng dụng liên tục xử lý lại các đoạn lớn thay vì dùng truy hồi, bộ nhớ đệm hoặc kiểm tra có mục tiêu.

Who Should Use Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash đáng chú ý nhất khi âm thanh hoặc video là một phần của chính tác vụ chứ không chỉ là tệp đính kèm cần tóm tắt. Trường hợp phù hợp bao gồm trí tuệ cuộc họp, tìm kiếm media dạng dài, pipeline dịch video, quy trình chuyển video hướng dẫn thành ghi chú, tác tử sản xuất media và lưu trữ nghe nhìn.

Với trò chuyện văn bản truyền thống, một mô hình Flash văn bản chuyên dụng có thể đơn giản hơn. Với ứng dụng đầu ra giọng nói, một mô hình Omni hỗ trợ sinh âm thanh rõ ràng có thể phù hợp hơn. Với quy trình kết hợp nhìn, nghe, suy luận và hành động, Qwen3.8-Omni-Flash là lựa chọn khác biệt hơn trong danh mục Qwen.

Conclusion

Qwen3.8-Omni-Flash nên được hiểu là một mô hình âm thanh–hình ảnh mang tính tác tử, không chỉ là một bản phát hành Flash đa phương thức khác. Cửa sổ ngữ cảnh 1M, suy luận âm thanh–hình ảnh bản địa, khả năng đa người nói và âm thanh không gian, tư duy có thể điều chỉnh, gọi hàm, tìm kiếm và hệ sinh thái Qwen-MM-Plugins đều hướng tới cùng một chuyển dịch: để hệ thống AI chuyển từ hiểu đa phương tiện sang làm việc với đa phương tiện.

Dữ liệu ra mắt cho thấy cải thiện đáng kể so với Qwen3.5-Omni-Plus, đặc biệt ở quy trình tác tử và kịch bản âm thanh phức tạp. So với Gemini 3.8 Flash, con số của Qwen cân bằng hơn. Câu hỏi quan trọng vì thế không phải mô hình nào thắng một bảng, mà là kết hợp mô hình–khung nào hoàn thành quy trình mục tiêu chính xác và kinh tế.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Sep 21, 2026
Cập nhật lần cuối Sep 21, 2026
2 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm