TL;DR Qwen 3.8 Max có giá $2 cho mỗi 1 triệu token đầu vào và $6 cho mỗi 1 triệu token đầu ra trên QwenCloud. Tỷ lệ bộ nhớ đệm theo từng model là $0.25/M cho đầu vào được bộ nhớ đệm ngầm, $2.50/M cho việc tạo bộ nhớ đệm tường minh, và $0.17/M cho lượt đọc bộ nhớ đệm tường minh.
Cùng mức giá chuẩn áp dụng trên toàn bộ cửa sổ ngữ cảnh 1M token mà model hỗ trợ. Prompt lớn hơn tốn phí cao hơn vì chứa nhiều token hơn, không phải vì bước sang một bậc giá ngữ cảnh dài cao hơn.
Theo giá niêm yết, Qwen 3.8 Max rẻ hơn 20% so với Qwen 3.7 Max. Tuy nhiên, Qwen 3.7 Max rẻ hơn trong thời gian khuyến mãi 50% hiện tại. Lựa chọn tốt cho sản xuất phụ thuộc vào chi phí cho mỗi tác vụ được chấp nhận, bao gồm suy luận, tỷ lệ trúng bộ nhớ đệm, công cụ, retry, độ trễ và khâu rà soát của con người.
Bảng giá API Qwen 3.8 Max trong nháy mắt
| Hạng mục | Giá trị chính thức hiện tại |
|---|---|
| Model ID dùng sản xuất | qwen3.8-max |
| Ngày phát hành chính thức | August 3, 2026 |
| Kiến trúc | 2.4T tổng tham số; 95B tham số hoạt động |
| Giá chuẩn đầu vào | $2 / 1M tokens |
| Giá chuẩn đầu ra | $6 / 1M tokens |
| Đầu vào được đệm ngầm | $0.25 / 1M tokens |
| Tạo bộ đệm tường minh | $2.50 / 1M tokens |
| Đọc bộ đệm tường minh | $0.17 / 1M tokens |
| Cửa sổ ngữ cảnh | 1M tokens |
| Đầu vào tối đa | 991K không bật suy luận; 983K bật suy luận |
| Đầu ra tối đa | 131K |
| Suy luận tối đa | 262K |
| Kiểu dữ liệu đầu vào | Văn bản, hình ảnh và video |
| Kiểu dữ liệu đầu ra | Văn bản |
| Giới hạn tham chiếu QwenCloud | 2M TPM và 15K RPM |
Trang model QwenCloud là nguồn trực tiếp nhất cho model ID hiện tại, giá, tỷ lệ bộ nhớ đệm, giới hạn ngữ cảnh và kiểu dữ liệu. Hạn mức theo tài khoản và khu vực có thể khác nhau; vì vậy hãy dùng các giới hạn hiển thị trong chính console của bạn khi đặt mức đồng thời cho môi trường sản xuất.
Bản phát hành sản xuất cũng thay thế định danh preview bằng qwen3.8-max và bổ sung một bảng giá riêng cho model. Tài liệu ra mắt của Qwen mô tả các thiết lập nỗ lực suy luận low, medium và xhigh, nhưng hành vi trong sản xuất cần được xác minh theo endpoint và tài liệu API bạn thực dùng.
Lưu ý có tính thời điểm: Qwen thông báo rằng trọng số mở sẽ phát hành sau API. Tính đến August 4, 2026, không mô tả Qwen 3.8 Max là có thể tải xuống hoặc tự lưu trữ cho đến khi checkpoint và giấy phép chính thức được công bố.
Cách tính giá của Qwen 3.8 Max
QwenCloud hiện niêm yết mức giá chuẩn phẳng $2 cho mỗi 1M token đầu vào và $6 cho mỗi 1M token đầu ra trên toàn bộ cửa sổ ngữ cảnh 1M-token của Qwen 3.8 Max. Ảnh chụp bảng giá chính thức bên dưới được ghi nhận ngày August 4, 2026; luôn kiểm tra trang model trực tiếp trước khi đưa ra quyết định ngân sách sản xuất.

Nguồn***:*** QwenCloud, “Qwen3.8-Max” official
| Hạng mục tính cước | Giá trên 1M token | Khi nào áp dụng |
|---|---|---|
| Đầu vào chuẩn | $2.00 | Nội dung prompt mới, định nghĩa công cụ, và ngữ cảnh chưa được đệm |
| Đầu ra chuẩn | $6.00 | Đầu ra sinh ra và phần suy luận được tính cước |
| Trúng bộ đệm ngầm | $0.25 | Tự động tái sử dụng tiền tố prompt; không đảm bảo trúng |
| Tạo bộ đệm tường minh | $2.50 | Tạo tiền tố prompt có đánh dấu để tái sử dụng |
| Đọc bộ đệm tường minh | $0.17 | Tái sử dụng một khối bộ đệm tường minh hợp lệ |
Do đó, một yêu cầu 900K token tốn nhiều hơn yêu cầu 100K token vì xử lý số token đầu vào gấp chín lần—không phải vì vượt sang bậc giá cao hơn.
Suy luận có thể làm tăng chi phí đầu ra
Một câu trả lời ngắn hiển thị không phải lúc nào cũng là câu trả lời chi phí thấp. Cuộc gọi bật suy luận có thể tạo thêm token suy luận, vì vậy ước tính cho sản xuất nên dựa vào các trường usage mà API trả về thay vì độ dài câu trả lời nhìn thấy.
Nếu endpoint của bạn hỗ trợ điều khiển suy luận cho qwen3.8-max, hãy so sánh các thiết lập có sẵn trên cùng một bộ đánh giá. Đừng giả định rằng mặc định của bản preview giữ nguyên trên model GA.
Tiết kiệm từ bộ nhớ đệm phụ thuộc vào độ ổn định của prompt
Trang model của Qwen 3.8 Max công bố các tỷ lệ bộ nhớ đệm theo từng model. Hãy dùng các tỷ lệ đó—không dùng tỷ lệ chung—khi ước tính chi tiêu.
Mục bộ đệm tường minh có hiệu lực trong năm phút và một lần trúng thành công sẽ gia hạn thời hạn này. Bộ đệm ngầm là tự động, nhưng không đảm bảo trúng. Bộ đệm hữu ích nhất khi system prompt, định nghĩa công cụ, ngữ cảnh kho mã hoặc tài liệu lớn ổn định qua nhiều cuộc gọi.
Công cụ tích hợp phát sinh phí riêng
QwenCloud hiện liệt kê các phí công cụ sau bên cạnh phí token:
| Công cụ tích hợp | Phí hiện tại |
|---|---|
| Web Search | $10 / 1K cuộc gọi |
| Image Search | $8 / 1K cuộc gọi |
| Web Extractor | Miễn phí trong thời gian có hạn |
| Code Interpreter | Miễn phí trong thời gian có hạn |
Gọi hàm (function calling) và MCP không có phí công cụ riêng, nhưng mô tả công cụ vẫn tính vào token đầu vào. Khuyến mãi miễn phí công cụ có thể thay đổi, vì vậy hãy kiểm tra hướng dẫn giá QwenCloud trước khi chốt ngân sách sản xuất.
Ví dụ, một yêu cầu có 20K token đầu vào, 2K token đầu ra và hai cuộc gọi Web Search có chi phí xấp xỉ:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Trong ví dụ này, hai cuộc gọi tìm kiếm chiếm khoảng 27.8% tổng chi phí yêu cầu.
Ví dụ chi phí thực tế của Qwen 3.8 Max
Các ví dụ này sử dụng các mức giá theo model hiện tại của QwenCloud. Chưa tính thuế, retry, fallback và phần chênh lệch theo nhà cung cấp.
Ví dụ 1: Yêu cầu agent mức trung bình
Giả sử 50K token đầu vào và 5K token đầu ra:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Một lần thành công ngay nỗ lực đầu tiên có chi phí khoảng $0.13. Một lần retry đầy đủ sẽ nâng chi phí model lên khoảng $0.26.
Ví dụ 2: Phân tích tài liệu dài
Giả sử 800K token đầu vào và 20K token đầu ra:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Model không áp dụng phụ phí riêng cho ngữ cảnh dài trên bảng giá hiện tại, nhưng prompt lớn vẫn tạo chi phí tuyệt đối đáng kể.
Ví dụ 3: Phiên agent có bộ đệm
Giả sử một tiền tố có thể tái sử dụng 100K token, 10K token đầu vào mới, 5K token đầu ra và 50 cuộc gọi trong khi bộ đệm tường minh còn hiệu lực:
Cuộc gọi đầu tiên:
100K tạo bộ đệm × $2.50/M = $0.250
10K đầu vào mới × $2/M = $0.020
5K đầu ra × $6/M = $0.030
Tổng cuộc gọi đầu tiên = $0.300
Mỗi cuộc gọi trong 49 cuộc tiếp theo:
100K đọc bộ đệm × $0.17/M = $0.017
10K đầu vào mới × $2/M = $0.020
5K đầu ra × $6/M = $0.030
Tổng cho mỗi cuộc gọi = $0.067
Tổng phiên có bộ đệm = $3.583
50 cuộc gọi tương tự không dùng bộ đệm = $12.500
Ước tính tiết kiệm = $8.917, tức 71.3%
Mức tiết kiệm ước tính phụ thuộc vào các lần trúng bộ đệm thành công và một tiền tố ổn định. Khoảng gián đoạn dài hoặc thay đổi thường xuyên với system prompt và schema công cụ sẽ làm giảm lợi ích.
Qwen 3.8 Max so với Qwen 3.7 Max: So sánh giá
Qwen 3.8 Max rẻ hơn 20% so với Qwen 3.7 Max theo giá niêm yết, nhưng Qwen 3.7 Max rẻ hơn 37.5% trong thời gian khuyến mãi 50% hiện tại.
| Model và trạng thái giá | Đầu vào / 1M | Đầu ra / 1M | Ngữ cảnh |
|---|---|---|---|
| qwen3.8-max giá chuẩn | $2.00 | $6.00 | 1M |
| qwen3.7-max giá niêm yết | $2.50 | $7.50 | 1M |
| qwen3.7-max khuyến mãi hiện tại | $1.25 | $3.75 | 1M |
Giữ trang model Qwen3.7 Max trên CometAPI làm phương án dự phòng trong khi thử nghiệm model mới.
Giá theo token chỉ là một phần của quyết định. Qwen 3.8 Max vẫn có thể kinh tế hơn nếu cải thiện tỷ lệ thành công ngay lần đầu, dùng công cụ ổn định hơn, giảm retry hoặc cần ít chỉnh sửa của con người hơn.
Hãy dùng chỉ số sản xuất này:
Chi phí cho mỗi tác vụ được chấp nhận =
(token của model + cuộc gọi công cụ + retry + chi tiêu cho fallback + chi phí rà soát)
÷ số đầu ra được chấp nhận
Các số liệu benchmark do nhà cung cấp báo cáo là lý do để kiểm thử lại các quy trình coding và nghiệp vụ khó, chứ không phải bằng chứng rằng mọi khối lượng công việc của Qwen 3.7 đều nên chuyển đổi.
Cách di chuyển sang Qwen 3.8 Max
Đổi chuỗi model là cần thiết, nhưng không phải là toàn bộ quá trình di chuyển cho sản xuất.
1. Kiểm thử model ID sản xuất
Thay thế định danh preview bằng qwen3.8-max trong môi trường thử nghiệm. Đừng giả định alias preview, mặc định, độ trễ hoặc hành vi phản hồi sẽ giữ nguyên.
Một yêu cầu tối thiểu tương thích OpenAI có thể như sau:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Bắt đầu với yêu cầu tối thiểu theo tài liệu. Chỉ thêm điều khiển suy luận khi tài liệu API hiện tại cho endpoint của bạn hỗ trợ rõ ràng.
2. Chuẩn hóa lại số liệu chi phí và hiệu năng
Ghi lại ít nhất:
- token đầu vào, đầu ra và suy luận
- lượt trúng bộ đệm và token tạo bộ đệm
- thời gian đến token đầu tiên và tổng độ trễ
- cuộc gọi công cụ, retry và fallback
- đầu ra được chấp nhận so với bị từ chối
- thời gian chỉnh sửa của con người
3. Kiểm thử lại giao diện mà ứng dụng của bạn dùng
Xác minh sự kiện streaming, payload đa phương tiện, schema công cụ, đầu ra có cấu trúc, lý do kết thúc, trường usage, xử lý lỗi và hành vi nhiều lượt. Trang model sản xuất tài liệu truy cập qua DashScope và tương thích OpenAI; xác minh mọi lớp tương thích bổ sung trước khi phụ thuộc vào chúng.
4. Tôn trọng các giới hạn ngữ cảnh thực tế
Cửa sổ 1M ngữ cảnh không đồng nghĩa với prompt người dùng 1M token. QwenCloud liệt kê đầu vào tối đa 991K khi không bật suy luận và 983K khi bật suy luận. Thêm biên an toàn để yêu cầu vẫn còn chỗ cho đầu ra và suy luận.
5. Chạy Qwen 3.7 và Qwen 3.8 song song
Dùng prompt, công cụ, bộ kiểm định, quy tắc retry và bộ dữ liệu giống hệt nhau. So sánh chi phí cho mỗi tác vụ được chấp nhận và độ trễ thay vì đánh giá bằng mắt các phản hồi riêng lẻ.
Cách đánh giá và định tuyến Qwen 3.8 Max
Dùng khối lượng công việc thực tế thay vì điểm trung bình của benchmark chung.
| Khối lượng công việc | Số tác vụ gợi ý | Tín hiệu chấp nhận chính |
|---|---|---|
| Lập trình kho mã | 4 | Bài kiểm thử vượt qua mà không cần vá thủ công |
| Phân tích tài liệu dài | 3 | Lập luận được chứng minh bởi bằng chứng cung cấp |
| Phân tích đa phương tiện | 2 | Dùng đúng chi tiết ảnh hoặc video liên quan |
| Agent dùng công cụ | 3 | Chọn công cụ đúng và tham số hợp lệ |
Một chính sách định tuyến thực tế là:
Tác vụ đơn giản, nhạy với độ trễ
→ Model Plus chi phí thấp hơn
Khối lượng công việc hiện tại đã đạt mục tiêu chất lượng
→ Qwen 3.7 Max trong khi khuyến mãi vẫn hấp dẫn
Tác vụ lập trình khó, đa phương tiện, hoặc tác vụ dài hạn
→ Qwen 3.8 Max
Không qua kiểm định
→ Một lần retry có kiểm soát, rồi fallback đã kiểm thử
Dùng Qwen 3.8 Max cho công việc kho mã khó, agent dài hạn, phân tích đa phương tiện và các quy trình mà Qwen 3.7 không qua được bài kiểm định chấp nhận. Giữ Qwen 3.7 Max khi khuyến mãi giúp giảm chi phí đáng kể và model hiện tại đã đạt mục tiêu chất lượng.
Kiểm tra trang giá CometAPI và thông tin định tuyến trực tiếp trước khi khóa ngưỡng, vì tính sẵn sàng của nhà cung cấp và giá được định tuyến có thể thay đổi độc lập với giá niêm yết trực tiếp của QwenCloud. CometAPI Cookbook có thể giúp bạn xây dựng yêu cầu có thể lặp lại và một khung đánh giá nhất quán.
Câu hỏi thường gặp
API Qwen 3.8 Max có giá bao nhiêu?
QwenCloud hiện niêm yết Qwen 3.8 Max ở mức $2 cho mỗi 1 triệu token đầu vào và $6 cho mỗi 1 triệu token đầu ra. Việc dùng bộ nhớ đệm và công cụ tích hợp có mức giá riêng.
Qwen 3.8 Max có tốn nhiều hơn trên 128K token không?
Không có bậc giá ngữ cảnh dài riêng trên bảng giá theo model hiện tại. Yêu cầu dài tốn nhiều hơn vì chứa nhiều token hơn, không phải vì vượt sang một bậc giá theo đơn vị cao hơn.
Token suy luận của Qwen 3.8 Max có bị tính cước không?
Suy luận có thể làm tăng usage sinh ra và tổng chi phí. Hãy dùng các trường token suy luận và đầu ra do endpoint trả về thay vì ước từ độ dài câu trả lời hiển thị.
Qwen 3.8 Max có phải mã nguồn mở không?
Qwen thông báo rằng trọng số mở sẽ phát hành sau API. Không mô tả model là có thể tải xuống hoặc tự lưu trữ cho đến khi checkpoint và giấy phép chính thức có sẵn.
Người dùng Qwen 3.7 Max có nên chuyển ngay không?
Không tự động. Qwen 3.8 Max có giá niêm yết thấp hơn, trong khi Qwen 3.7 Max rẻ hơn trong thời gian khuyến mãi hiện tại. Hãy chuyển khi dữ liệu của chính bạn về chất lượng, độ trễ, hành vi bộ đệm và chi phí cho mỗi tác vụ được chấp nhận ủng hộ việc thay đổi.
Thử Qwen 3.8 Max với CometAPI
Dùng CometAPI Quickstart để cấu hình client tương thích OpenAI. Trước khi gửi lưu lượng sản xuất, xác nhận rằng qwen3.8-max đã hoạt động trong tài khoản của bạn và xác minh giá được định tuyến hiển thị tại đó.
So sánh với baseline Qwen 3.7 của bạn bằng prompt, bộ kiểm định, chính sách retry và telemetry giống hệt nhau. Điều này giúp chú trọng đánh giá vào model thay vì thay đổi ở khung thử nghiệm.
