Kimi K3 is now live on CometAPI →

Kiến trúc Qwen 3.7 Max

CometAPI
AnnaJul 21, 2026
Kiến trúc Qwen 3.7 Max

TLDR: Qwen3.8-Max của Alibaba (preview, 2,4 nghìn tỷ tham số, đa phương thức với đầu vào hình ảnh/video/tài liệu) đối đầu trực diện với Kimi K3 của Moonshot AI (2,8T tham số, sắp mở trọng số, ngữ cảnh 1M). Qwen3.8-Max vượt trội ở tác vụ đa phương thức và năng suất với giá preview ~10% so với mức chuẩn, trong khi Kimi K3 dẫn đầu ở một số benchmark mở và mức độ “mở”.

Cả hai đều là mô hình tiên phong có thể truy cập qua API ngay hôm nay. Để tích hợp tin cậy, hiệu quả chi phí, CometAPI cung cấp truy cập Qwen liền mạch với endpoint tương thích OpenAI, giá cạnh tranh và khả năng mở rộng dễ dàng cho nhà phát triển và doanh nghiệp.

Key Takeaways:

  • Quy mô & Năng lực: Theo bài đăng trên X, Qwen3.8-Max mang đến đa phương thức gốc (hình ảnh, video, tài liệu) cho mô hình 2,4T tham số; Qwen3.7-Max tỏa sáng ở lập trình tác tử và tác vụ dài hạn.
  • Giá & Truy cập: Qwen3.8-Max có mức giá API cạnh tranh (~$2,50/$7,50 cho mỗi 1M input/output, thường có chiết khấu); preview Qwen 3.8 với mức giá giảm qua Token Plan/Qoder.
  • So với Kimi K3: Kimi K3 (2,8T, mở trọng số ngày 27/07/2026) thường nhỉnh hơn trên benchmark, nhưng Qwen mạnh hơn ở đa phương thức và tích hợp hệ sinh thái; Qwen rẻ hơn trong nhiều kịch bản API.
  • Truy cập ngay hôm nay: Preview trên Alibaba Cloud/Token Plan/Qoder với giá ưu đãi; tương thích API OpenAI/Anthropic.
  • Lợi thế thực tế: Vượt trội cho dev full-stack, tự động hóa văn phòng, phân tích video và quy trình tác tử.

What Is Qwen 3.8 Max?

Qwen 3.8 Max, chính thức preview dưới tên Qwen3.8-Max-Preview, là mô hình ngôn ngữ lớn (LLM) hàng đầu mới nhất của đội Qwen thuộc Alibaba. Công bố tại Hội nghị Thế giới AI ở Thượng Hải khoảng ngày 19/07/2026, nó đại diện cho bước nhảy vọt về quy mô so với dòng Qwen 3.7.

Core Specifications

  • Tham số: Tổng 2,4 nghìn tỷ — khiến nó trở thành một trong những mô hình được công bố lớn nhất, chỉ sau Kimi K3 của Moonshot AI (~2,8T).
  • Kiến trúc: Sparse Mixture-of-Experts (MoE). Chỉ một phần tham số được kích hoạt mỗi token, cân bằng sức mạnh với hiệu quả (số tham số kích hoạt chưa được tiết lộ — chi tiết then chốt cho chi phí suy luận).
  • Năng lực đa phương thức: Xử lý gốc văn bản, hình ảnh, video và tài liệu. Đây là mô hình đầu tiên của Qwen vượt 1 nghìn tỷ tham số với hỗ trợ đa phương thức mạnh.
  • Cửa sổ ngữ cảnh: Tối đa 1 triệu token, kế thừa và tinh chỉnh từ Qwen 3.7 Max.
  • Biến thể: Bản Max 2,4T cùng biến thể ~27B nhỏ hơn cho nhu cầu nhẹ.

How Qwen 3.8 Max Works: Innovations and Technical Edge

Qwen3.8-Max tận dụng nhiều thập kỷ kinh nghiệm mở rộng của Alibaba:

  1. Quy mô khổng lồ với hiệu quả: 2,4T tham số qua MoE – chỉ một phần được kích hoạt mỗi token, cân bằng sức mạnh và chi phí suy luận (tương tự MoE trước đây của Qwen như 235B-A22B).
  2. Lập luận lai: Kế thừa các chế độ “Thinking/Non-Thinking” để kiểm soát linh hoạt độ sâu, tốc độ và chi phí. Phù hợp cho tác vụ agentic cần lập kế hoạch nhiều bước.
  3. Tích hợp đa phương thức: Xử lý thống nhất văn bản + thị giác + video. Cho phép ứng dụng phong phú như phân tích tài liệu có hình ảnh hoặc suy luận dựa trên video.
  4. Tối ưu ngữ cảnh dài và tác tử: Tối ưu cho tác vụ dài hạn (ví dụ: nhân bản ứng dụng trọn gói, quy trình phức tạp). Hỗ trợ tool use nâng cao, RAG và function calling.
  5. Tiến bộ huấn luyện: Xây dựng trên dữ liệu đa ngôn ngữ lớn (119+ ngôn ngữ), embedding vị trí cải tiến, và kỹ thuật giảm ảo giác trong khi tăng cường STEM/lập trình.

Cách hoạt động trong thực tế:

  • Input → bộ tách token + vector nhúng → bộ định tuyến MoE chọn chuyên gia → các tầng Transformer xử lý → sinh đầu ra.
  • Hỗ trợ lập trình tác tử (ví dụ: dự án full-stack), pipeline phân tích dữ liệu và tự động hóa văn phòng.

Kiểm thử cộng đồng trên Reddit cho thấy sức mạnh thô đầy hứa hẹn ở lập trình và truy vấn phức tạp, dù một số người ghi nhận vòng lặp “thinking” đôi khi xuất hiện ở bản preview đầu.

Dành cho nhà phát triển: Kết hợp với các công cụ như CometAPI để có truy cập thống nhất tin cậy giữa các nhà cung cấp, giảm độ trễ và chi phí đồng thời thử nghiệm Qwen song song Claude, GPT, v.v.

Pricing and Access: What You Can Actually Use Today

Tình trạng preview (tính đến tháng 7/2026):

  • Alibaba Token Plan: Gói dựa trên credit.
    • Lite: $6 cho 2.500 credit/tuần.
    • Pro: $68 cho 40.000 credit/tuần (hỗ trợ 6–8 tác tử đồng thời).
  • Giảm giá: 10% so với mức giá chuẩn trong giai đoạn preview.
  • Nền tảng: Qwen Chat, Alibaba Cloud, Qoder (coding), QoderWork (productivity).
  • API: Tương thích OpenAI/Anthropic. Chưa công bố mức tính theo token riêng cho 3.8-Max (tiền nhiệm: ~$1,25/M input, $3,75/M output).

Open-Weights: Hứa hẹn “sớm” — rất quan trọng cho tự lưu trữ/tinh chỉnh, dù yêu cầu phần cứng cực lớn (~1,2TB ở 4-bit).

Khuyến nghị CometAPI: Cho môi trường production, bỏ qua việc quản lý nhiều nhà cung cấp. CometAPI cung cấp một API key cho 500+ mô hình, bao gồm dòng Qwen. Hóa đơn, endpoint và độ tin cậy thống nhất — lý tưởng để A/B test Qwen 3.8 Max so với mô hình khác mà không cần viết lại code. Hoàn hảo cho người dùng Cometapi.com xây dựng ứng dụng AI. Đăng ký tại cometapi.com để tích hợp liền mạch.

Điều này giúp truy cập Qwen mà không cần cam kết với Alibaba Cloud, tuyệt vời cho startup và dev toàn cầu.

Does Qwen3.8 Max Beat Kimi K3?

Về số lượng tham số: không

Nếu câu hỏi là “Qwen3.8 Max có nhiều tham số hơn Kimi K3 không?”, thì câu trả lời đơn giản: không. Qwen3.8-Max-Preview được Qoder báo cáo là mô hình 2,4T tham số. Kimi K3 được Moonshot ghi nhận là 2,8T tham số. Tính tổng tham số, Kimi K3 lớn hơn 400 tỷ.

Điều đó không tự động khiến Kimi K3 tốt hơn ở mọi tác vụ. Số tham số không phải là bảng điểm duy nhất. Dữ liệu huấn luyện, kiến trúc, định tuyến chuyên gia, số tham số kích hoạt mỗi token, hậu huấn luyện, ngăn xếp suy luận, công cụ và quản lý ngữ cảnh đều ảnh hưởng đến hiệu năng thực tế. Một mô hình nhỏ hơn có thể vượt mô hình lớn hơn ở một số tác vụ nếu có dữ liệu tốt hơn, hậu huấn luyện tốt hơn, công cụ tốt hơn hoặc suy luận thời gian chạy tốt hơn.

Về bằng chứng công khai: Kimi K3 đang dẫn trước

Kimi K3 hiện có gói bằng chứng công khai tốt hơn. Hướng dẫn và blog kỹ thuật của Kimi K3 do Moonshot công bố nêu chi tiết kiến trúc, ngữ cảnh, thị giác, kích hoạt chuyên gia, giới hạn API và kế hoạch phát hành. Trang Kimi K3 của OpenLM phản chiếu bảng benchmark chi tiết trên lập trình, công việc tác tử, suy luận, công việc tri thức và thị giác. Kimi K3 đạt 1.679 điểm trên Frontend Code Arena và tổng hợp ngữ cảnh 1M của mô hình, kích hoạt chuyên gia 16/896, cùng tín hiệu về giá.

Qwen3.8-Max-Preview rất quan trọng, nhưng giai đoạn preview ít tài liệu hơn. Nguồn mạnh nhất hiện tại là trang ra mắt của Qoder và cấu hình OpenCode trên Alibaba Cloud Model Studio. Chúng có giá trị, nhưng vẫn chưa cung cấp mức chi tiết benchmark, số tham số kích hoạt, giải thích kiến trúc, điều khoản giấy phép, hoặc tuyến production qua CometAPI giống như Kimi K3.

AspectQwen3.8-Max (Preview)Qwen3.7-MaxKimi K3 (Moonshot)
Parameters2.4T~1T+ (trước đó)2.8T
MultimodalCó (ảnh/video/tài liệu)Giới hạn/Tập trung văn bảnCó (thị giác gốc/3D)
Context WindowLớn (đa phương thức)262K+1M token
StrengthsAgentic, lập trình, năng suất, đa phương thứcTác tử dài hạn, suy luậnTrọng số mở, đấu trường lập trình, suy luận
Benchmarks (Examples)KingBench mạnh (~hạng 2), nội bộ dẫn đầuGPQA 92,4, SWE-Pro 60,6Dẫn đầu nhiều (Frontend Arena), tổng thể cạnh tranh
Pricing (API approx.)Preview ~10% giá chuẩnCạnh tranh (~$1–5/M tổng hợp)$3 vào / $15 ra mỗi 1M
AccessAlibaba preview + CometAPIAlibaba + CometAPIAPI ngay, sắp mở trọng số
Best ForQuy trình đa phương thức doanh nghiệpKhung agent, devTự lưu trữ, tùy biến

Key Differences:

  • Độ mở: Kimi K3 thắng với trọng số đầy đủ sắp mở cho tự lưu trữ/tinh chỉnh. Qwen3.8-Max đang preview, “open” sớm.
  • Đa phương thức: Cả hai đều mạnh; Qwen nhấn mạnh tích hợp video/tài liệu.
  • Hiệu năng: Kimi K3 thường dẫn đầu benchmark (ví dụ: GPQA, đấu trường lập trình); Qwen cạnh tranh hoặc vượt trội trong khung tác tử/năng suất và tác vụ cụ thể như bảng tính/tối ưu kernel. Qwen rẻ hơn khi dùng API (ví dụ: rẻ hơn ~3 lần trong một số so sánh).
  • Ngữ cảnh & tốc độ: Kimi 1M ngữ cảnh; Qwen mạnh ngữ cảnh dài (262K+ trước đó). Qwen thường xuất ra nhanh hơn.
  • Tình huống sử dụng: Qwen cho hệ sinh thái Alibaba tích hợp, tự động hóa văn phòng, đa phương thức doanh nghiệp. Kimi cho cộng đồng nguồn mở và tùy biến tối đa.

Conclusion: Should You Adopt Qwen 3.8 Max?

Có — cho thử nghiệm và nhu cầu lập trình/đa phương thức, đặc biệt qua các nền tảng dễ tiếp cận như CometAPI. Chưa phải thay thế hoàn toàn nhóm mô hình đóng, nhưng là lựa chọn mạnh mẽ, giá phải chăng, thúc đẩy hệ sinh thái tiến lên. Theo dõi các benchmark và bản phát hành đầy đủ.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm