GPT-5.6 Luna price down 80%, Terra down 20% →

Qwen3.8 Max là gì?

CometAPI
AnnaAug 4, 2026
Qwen3.8 Max là gì?

TLDR Đội Qwen của Alibaba chính thức ra mắt Qwen3.8-Max vào ngày 3 tháng 8 năm 2026 — một mô hình Hỗn hợp Chuyên gia (MoE) thưa với tổng 2,4 nghìn tỷ tham số (95 tỷ đang hoạt động), cửa sổ ngữ cảnh 1 triệu token và hỗ trợ đa phương thức gốc (văn bản + hình ảnh + video).

Đây là mẫu Qwen cấp Max đầu tiên được lên lịch mở trọng số (dự kiến vào tuần kế tiếp). Với mức giá cạnh tranh $2 cho mỗi triệu token đầu vào và $6 cho mỗi triệu token đầu ra, nó mang lại kết quả mạnh ở các nhiệm vụ tác tử dài hạn, kỹ thuật phần mềm tự chủ (bao gồm một dự án mã hóa tự tiến hóa 16 ngày được ghi nhận), tái lập nghiên cứu và các thang đo đa phương thức. Nó cạnh tranh sát với các mô hình như Kimi K3 và vượt trên các lựa chọn nhẹ như DeepSeek V4 Flash về năng lực, đồng thời vẫn hiệu quả chi phí hơn nhiều so với các mô hình tiên phong phương Tây hàng đầu trong khối lượng công việc nặng về đầu ra. Nhà phát triển có thể truy cập ngay hôm nay qua QwenCloud / Alibaba Cloud Model Studio và thông qua các nền tảng hợp nhất như CometAPI.

Key Takeaways

  • Quy mô và hiệu suất: Kiến trúc MoE 2,4T tổng / 95B hoạt động xây dựng trên nền tảng Qwen 3.5, cho hiệu năng cấp tiên phong với chi phí suy luận thực tế.
  • Sức mạnh dài hạn: Minh chứng khả năng mã hóa tự chủ nhiều ngày (265 commit, 127 PR trong ~16 ngày không có can thiệp của con người), tái lập + cải tiến nghiên cứu, và điểm số mạnh trên các thang đo đa phương thức.
  • Điểm nhấn benchmark: PaperBench 93,0 (dẫn đầu), Terminal Bench 2.1 86,6, điểm tài liệu và đa phương thức tốt; cạnh tranh nhưng không thống trị mọi bảng xếp hạng tác tử thuần mã hóa so với Claude Fable 5 hoặc GPT-5.6 Sol.
  • Lợi thế giá: Đồng giá $2 / $6 mỗi 1M token trên toàn bộ ngữ cảnh 1M (đầu vào được lưu đệm ~ $0.25), rẻ hơn Kimi K3 về đầu ra và nhiều mô hình phương Tây.
  • Khả dụng: Đã hoạt động trên QwenCloud và Alibaba Cloud Model Studio (API tương thích OpenAI và Anthropic); trọng số mở được lên kế hoạch; đã được liệt kê trên CometAPI là qwen3.8-max để truy cập hợp nhất cùng 500+ mô hình khác. Trọng số mở sắp phát hành; biến thể nhỏ hơn Qwen3.8-27B cũng được lên kế hoạch cho triển khai cục bộ/biên thực tế.
  • Lợi thế thực tiễn: Xuất sắc trong sản xuất sản phẩm bàn giao end-to-end thay vì câu trả lời một lượt — lý tưởng cho tác tử mã hóa, quy trình nghiên cứu, công việc văn phòng và vòng lặp tác tử kéo dài.

What Is Qwen3.8-Max?

Qwen3.8-Max là mẫu đầu bảng mới nhất và mạnh nhất trong dòng Qwen của Alibaba, chính thức phát hành ngày 3 tháng 8 năm 2026 (sau bản xem trước giữa tháng 7 tại Hội nghị Thế giới về AI ở Thượng Hải). Nó đại diện cho một sự chuyển dịch có chủ đích hướng tới các mô hình có thể hoàn thành các nhiệm vụ phức tạp, kéo dài nhiều ngày từ đầu đến cuối với giám sát tối thiểu và tạo ra sản phẩm sẵn sàng giao hàng.

Về kiến trúc, đây là mô hình Hỗn hợp Chuyên gia (MoE) thưa, mở rộng tới 2,4 nghìn tỷ tham số tổng, trong đó chỉ khoảng 95 tỷ được kích hoạt trên mỗi token. Thiết kế này, dựa trên nền tảng Qwen 3.5, cân bằng giữa dung lượng khổng lồ và hiệu quả suy luận. Mô hình hỗ trợ cửa sổ ngữ cảnh 1 triệu token (đầu vào tối đa được ghi nhận khoảng 991K token và đầu ra tối đa khoảng 131K token), đầu vào đa phương thức gốc (văn bản, hình ảnh và video) và đầu ra văn bản. Nó bao gồm điều khiển mức nỗ lực suy lý (xhigh / medium / low) và hỗ trợ cả OpenAI Chat Completions lẫn các giao thức tương thích Anthropic, giúp có thể cắm-vào-dùng ngay với các khung tác tử phổ biến như Claude Code, Codex, Qoder CLI, Qwen Code và OpenClaw.

Khác với các mẫu cấp Max trước đây vẫn đóng, Alibaba cam kết phát hành trọng số của Qwen3.8-Max (và biến thể nhỏ hơn Qwen3.8-27B) vào tuần sau khi ra mắt qua Hugging Face và ModelScope — lần đầu một mẫu Qwen cấp Max sẽ được phát hành mở.

Mô hình được định vị cho tác tử mã hóa, công việc chuyên môn thực tế (“cowork”), nghiên cứu, lập kế hoạch dài hạn và vòng lặp tác tử đa phương thức. Các bản demo chính thức nhấn mạnh hành vi tự tiến hóa: mô hình tạo issue, tự giao việc, viết và kiểm thử mã, lặp lại dựa trên phản hồi và cải tiến công cụ của chính nó trong thời gian dài.

Nguồn: Blog Qwen chính thứcThông báo của Alibaba Cloud (tháng 8/2026); thẻ mô hình của Artificial Analysis; bài đánh giá độc lập tóm tắt phiên bản GA.

What Is New in Qwen3.8-Max?

So với tiền nhiệm Qwen3.7-Max, thế hệ 3.8 mang lại cải thiện đáng kể về tác tử mã hóa, độ tin cậy dài hạn, suy luận đa phương thức và hiệu năng tài liệu/văn phòng. Những đổi mới chính gồm:

Tự chủ dài hạn thực sự:

Mô hình có thể duy trì học thích ứng vòng kín qua hàng trăm lượt hoặc nhiều ngày. Ví dụ được ghi nhận gồm một dự án kỹ thuật phần mềm tự chủ 16 ngày sản xuất một công cụ CLI tự tiến hóa (oh-my-cli) với 265 commit, 127 pull request và 151 issue hoàn toàn không có can thiệp của con người; tái lập và cải thiện phương pháp của một bài nghiên cứu (bao gồm vòng huấn luyện GPU và cải thiện đo được trên thang đo); và mô phỏng vận hành thương mại điện tử trọn một năm với kết quả vượt trội so với đường cơ sở.

Đa phương thức như một vòng phản hồi liên tục:

Thị giác không chỉ là một kênh đầu vào. Mô hình sử dụng hiểu biết thị giác cho lập kế hoạch, theo dõi thực thi và tự hiệu chỉnh — cho phép các tác vụ như tái tạo từ ảnh chụp màn hình sang mã, tạo game/hoạt hình tương tác, và chuyển đổi 2D sang 3D.

Mô hình xếp hạng cao trên Text Arena (thứ năm được báo cáo) và Vision Arena (thứ hai được báo cáo) trong dữ liệu ban đầu sau phát hành.

Qwen3.8 Max là gì?

Qwen3.8 Max là gì?

Tập trung vào sản phẩm bàn giao end-to-end:

Nhấn mạnh sản xuất đầu ra đạt chất lượng cho vận hành trên hàng trăm chuyên môn, thay vì câu trả lời rời rạc.

Chế độ thinking và suy luận nhanh

Hai chế độ: chế độ thinking cho suy luận sâu và lập kế hoạch phức tạp; chế độ suy luận nhanh cho phản hồi độ trễ thấp khi tác vụ đơn giản. Tài liệu OpenCode của Alibaba Cloud cho thấy thinking được bật cho các tuyến Qwen3.8 và liệt kê điều khiển suy luận cho tuyến preview, gồm xhigh, mediumlow.

Phân tách này có giá trị cho thiết kế sản phẩm. Không nên dùng mức suy luận nặng nhất cho mọi yêu cầu. Một bot hỗ trợ có thể phân loại ticket đơn giản với chi phí thấp, tóm tắt bằng mô hình nhanh hơn và chỉ nâng cấp lên chế độ thinking của Qwen3.8-Max khi người dùng yêu cầu quyết định chính sách phức tạp, phân tích nguyên nhân gốc, rà soát hợp đồng hoặc kế hoạch di trú mã.

Những khả năng này được xác thực qua các thí nghiệm nội bộ chạy dài và một bộ đánh giá chuẩn toàn diện bao phủ tác tử mã hóa, tác tử tổng quát, suy luận đa phương thức, hiểu tài liệu và nhiệm vụ nhận thức/neo giữ.

Benchmarking: Data quantization performance

Alibaba công bố một bộ benchmark nội bộ rộng lớn ở thời điểm GA. Xác minh độc lập (Artificial Analysis Intelligence Index, LMArena, v.v.) vẫn đang cập nhật trong những ngày ngay sau phát hành; dữ liệu sớm của Artificial Analysis xếp Qwen3.8-Max ở Intelligence Index 53 (hạng ~16/186 trong tập theo dõi), lưu ý độ dài dòng cao và tốc độ tương đối thấp.

Một số điểm số chính thức/được báo cáo (Qwen3.8-Max so với một số đối thủ):

BenchmarkQwen3.8-MaxClaude Fable 5 / Opus 4.8GPT-5.6 Sol (max)Qwen3.7-Max
Terminal-Bench 2.186.684.688.874.5
PaperBench93.088.8 / 80.390.564.8
SWE-bench Pro67.780.0 / 69.264.660.6
FrontierSWE73.588.840.7
DeepSWE 1.156.670.073.021.6
IFBench82.8~63.579.1
GPQA Diamond92.692.694.192.4
OmniDocBench 1.592.1
OSWorld-Verified86.1

Qwen3.8-Max thường dẫn đầu hoặc nằm trong nhóm đầu về suy luận đa phương thức, tác vụ tài liệu/văn phòng và một số chỉ số tác tử mã hóa/nghiên cứu, trong khi theo sau các mẫu đóng mạnh nhất trên một số bộ tác tử kỹ nghệ phần mềm thuần. Bước nhảy thế hệ trên FrontierSWE và DeepSWE đặc biệt đáng chú ý. Xem số liệu nhà cung cấp như định hướng; chạy độc lập và đánh giá theo khối lượng công việc cụ thể vẫn là thiết yếu.

API Pricing of Qwen3.8-Max

Giá chính thức trên Alibaba Cloud Model Studio / QwenCloud cho Qwen3.8-Max (mức GA đầu tháng 8/2026):

  • Đầu vào: $2.00 cho mỗi 1 triệu token
  • Đầu ra: $6.00 cho mỗi 1 triệu token (bao gồm token thinking/suy luận)
  • Đầu vào lưu đệm: khoảng $0.25 cho mỗi 1 triệu token (tiết kiệm đáng kể cho ngữ cảnh dài lặp lại)

Giá đồng nhất trên toàn bộ cửa sổ ngữ cảnh 1M token — một lợi thế đáng kể so với nhiều đối thủ áp phụ phí ngữ cảnh dài. Chiết khấu theo lô và yếu tố khác có thể áp dụng tùy vùng triển khai và gói.

Bối cảnh so sánh (bảng giá tham khảo cùng kỳ):

  • Kimi K3: ~ $3 / $15
  • Các mẫu Claude / GPT đầu bảng cao cấp: thường $5+ / $15–25+
  • Biến thể DeepSeek V4 Flash: thấp hơn đáng kể (thường dưới $0.50 tổng cho nhiều trường hợp)

Với đội ngũ đã dùng nhiều nhà cung cấp, các cổng hợp nhất như CometAPI thường cung cấp chiết khấu ~20% so với giá chính thức, một endpoint tương thích OpenAI, hóa đơn hợp nhất và dễ dàng chuyển đổi hoặc dự phòng mô hình. Điều này giúp thử nghiệm Qwen3.8-Max (và đồng thời so sánh với DeepSeek V4 Flash, Kimi, hay các mô hình khác) đơn giản hơn về vận hành và thường rẻ hơn. Kiểm tra trang giá CometAPI và ưu đãi tín dụng miễn phí để biết mức hiệu dụng mới nhất.

How Qwen3.8-Max Matches Kimi K3 and DeepSeek V4 Flash

DimensionQwen3.8-MaxKimi K3DeepSeek V4 Flash
Total / Active params2.4T / ~95B~2.8T / ~104B284B / 13B
Context1M1M1M
MultimodalVăn bản + Hình ảnh + VideoVăn bản + Hình ảnh + VideoChỉ văn bản
Pricing (in/out)$2 / $6$3 / $15~$0.14 / $0.28 (rất rẻ)
Open weightsĐã lên kế hoạch (tuần tới)Đã phát hànhMIT, sẵn có
StrengthsTự chủ dài hạn, đa phương thức, PaperBench, giá đầu raĐiểm độc lập mạnh, dẫn đầu bảng đấu front-end codingHiệu quả chi phí cực cao, tác tử mã hóa tốt so với cỡ
Relative standingCạnh tranh/dẫn đầu trên một số bench tác tử & đa phương thứcLợi thế nhẹ trên một số chỉ số thông minh đã kiểm toánGiá trị tuyệt vời; năng lực tuyệt đối thấp hơn

Qwen3.8-Max thường tương đương hoặc vượt Kimi K3 về hiệu quả chi phí cho công việc nặng đầu ra và tác vụ đa phương thức, trong khi DeepSeek V4 Flash vẫn là “vua ngân sách” cho khối lượng văn bản lớn nơi đỉnh khả năng không phải ưu tiên hàng đầu. Nhiều đội sẽ dùng cả ba qua một cổng hợp nhất, định tuyến tác vụ đơn giản tới các mẫu dòng Flash và dành Qwen3.8-Max hoặc Kimi K3 cho phiên tác tử phức tạp.

Qwen3.8-Max có sánh ngang Kimi K3 không?

Ở một số khía cạnh, có. Nó sánh ngang hạng mục ngữ cảnh 1M, có vị thế đa phương thức mạnh và rẻ hơn theo giá chính thức đầu vào/đầu ra. Nó không khớp số tham số tổng 2,8T của Kimi, và tài liệu công khai của Kimi hiện cung cấp hướng dẫn chi tiết đặc biệt về công cụ, lưu đệm ngữ cảnh, đầu ra có cấu trúc và thị giác.

Qwen3.8-Max có sánh ngang DeepSeek V4 Flash không?

Cạnh tranh ở ngữ cảnh 1M và kiến trúc MoE, nhưng sản phẩm nhắm tới công việc khác nhau. DeepSeek V4 Flash là lựa chọn nhanh kinh tế. Qwen3.8-Max là tuyến năng lực cao hơn cho công việc mà hiểu đa phương thức, suy luận nâng cao và năng suất doanh nghiệp quan trọng hơn mức giá token thấp nhất.

What can Qwen3.8-Max do?

Lập trình và Kỹ thuật phần mềm

Qwen3.8-Max là ứng viên mạnh cho phát triển full-stack, rà soát mã, hiểu kho mã, lập kế hoạch di trú, thiết kế API, gỡ lỗi, suy luận kiểm thử và kiến trúc phần mềm. Ngữ cảnh dài hữu ích khi mô hình cần giữ nhiều tệp, log và yêu cầu trong tầm nhìn. Dùng cho bài mã khó, không cho mọi tác vụ tự động hoàn thành hoặc giải thích lint đơn giản.

Công việc văn phòng và tri thức

Định vị “Cowork” của mô hình quan trọng. Nhân viên doanh nghiệp không chỉ hỏi đáp qua chat. Họ so sánh PDF, tóm tắt họp, rà soát slide, diễn giải bảng tính, kiểm tra hợp đồng, viết báo cáo và chuẩn bị quyết định từ bằng chứng lộn xộn. Thiết kế đa phương thức và ngữ cảnh dài của Qwen3.8-Max phù hợp với quy trình văn phòng nơi cần suy luận kết hợp văn bản, tài liệu, ảnh chụp màn hình và dữ liệu có cấu trúc.

Quy trình tác tử

Qwen3.8-Max hữu ích cho lập kế hoạch tác tử: chia mục tiêu thành bước, quyết định gọi công cụ nào, đánh giá kết quả và chỉnh sửa kế hoạch. Trên CometAPI, điều này thực tế hơn vì cùng một ứng dụng có thể định tuyến bước đơn giản sang mô hình rẻ hơn và dành Qwen3.8-Max cho lập kế hoạch hoặc kiểm chứng.

Getting Started and CometAPI Integration Tips

  1. Truy cập trực tiếp: Dùng QwenCloud hoặc Alibaba Cloud Model Studio với ID mô hình qwen3.8-max. Cả endpoint tương thích OpenAI và Anthropic đều được hỗ trợ.
  2. Truy cập hợp nhất qua CometAPI: Đăng ký tại CometAPI.com, lấy khóa API, đặt base_url thành https://api.cometapi.com/v1, và gọi model="qwen3.8-max". Cùng một khóa hoạt động cho DeepSeek V4 Flash, Kimi K3, Claude, GPT và hàng trăm mô hình khác — lý tưởng cho thử nghiệm, kiểm soát chi phí và định tuyến sản xuất. CometAPI nhấn mạnh giá cạnh tranh, độ trễ thấp và bổ sung mô hình nhanh (Qwen3.8-Max được liệt kê ngay sau khi ra mắt).
  3. Khung tác tử: Cắm trực tiếp vào Claude Code, OpenClaw hoặc khung tùy biến. Bật mức nỗ lực suy luận cao hơn cho công việc dài hạn phức tạp.
  4. Trọng số mở: Theo dõi trên Hugging Face / ModelScope cho bản phát hành sắp tới nếu bạn cần triển khai on-premise hoặc tinh chỉnh.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm