Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, cửa sổ ngữ cảnh 1M
Tóm tắt
Qwen 3.8 Max có giá $2 cho mỗi 1 triệu token đầu vào và $6 cho mỗi 1 triệu token đầu ra trên QwenCloud. Mức giá cache theo mô hình là $0.25/M cho đầu vào trúng bộ nhớ đệm ngầm, $2.50/M để tạo bộ nhớ đệm tường minh, và $0.17/M cho lần đọc bộ nhớ đệm tường minh.
Cùng một mức giá token chuẩn áp dụng cho cửa sổ ngữ cảnh 1M token mà mô hình hỗ trợ. Prompt lớn tốn nhiều tiền hơn vì chứa nhiều token hơn, không phải do bước sang bậc giá ngữ cảnh dài hơn.
Theo giá niêm yết, Qwen 3.8 Max rẻ hơn Qwen 3.7 Max 20%. Tuy nhiên, Qwen 3.7 Max rẻ hơn khi chương trình khuyến mại 50% hiện tại còn hiệu lực. Lựa chọn tốt hơn cho sản xuất phụ thuộc vào chi phí mỗi tác vụ được chấp nhận, bao gồm suy luận, tỉ lệ trúng bộ nhớ đệm, công cụ, thử lại, độ trễ và rà soát thủ công.
Giá API Qwen 3.8 Max trong nháy mắt
| Hạng mục | Giá trị chính thức hiện tại |
|---|---|
| ID mô hình sản xuất | qwen3.8-max |
| Ngày phát hành chính thức | August 3, 2026 |
| Kiến trúc | 2.4T tổng số tham số; 95B tham số hoạt động |
| Giá đầu vào chuẩn | $2 / 1M tokens |
| Giá đầu ra chuẩn | $6 / 1M tokens |
| Đầu vào trúng cache ngầm | $0.25 / 1M tokens |
| Tạo cache tường minh | $2.50 / 1M tokens |
| Đọc cache tường minh | $0.17 / 1M tokens |
| Cửa sổ ngữ cảnh | 1M tokens |
| Đầu vào tối đa | 991K không suy luận; 983K có suy luận |
| Đầu ra tối đa | 131K |
| Suy luận tối đa | 262K |
| Phương thức đầu vào | Văn bản, hình ảnh và video |
| Phương thức đầu ra | Văn bản |
| Giới hạn tham chiếu QwenCloud | 2M TPM và 15K RPM |
Trang mô hình QwenCloud (https://www.qwencloud.com/models/qwen3.8-max) là nguồn trực tiếp nhất cho ID mô hình hiện tại, giá, mức cache, giới hạn ngữ cảnh và phương thức. Hạn ngạch theo tài khoản và khu vực có thể khác nhau, vì vậy hãy dùng các giới hạn hiển thị trong bảng điều khiển của bạn khi thiết lập đồng thời cho sản xuất.
Bản phát hành sản xuất cũng thay thế định danh preview bằng qwen3.8-max và bổ sung bảng giá cụ thể cho mô hình. Tài liệu ra mắt của Qwen mô tả các thiết lập nỗ lực suy luận low, medium và xhigh, nhưng hành vi sản xuất nên được xác minh theo endpoint và tài liệu API bạn thực sự sử dụng.
Lưu ý nhạy thời gian: Qwen thông báo rằng trọng số mở sẽ theo sau bản phát hành API. Tính đến August 4, 2026, không mô tả Qwen 3.8 Max là có thể tải xuống hoặc tự lưu trữ cho đến khi có checkpoint và giấy phép chính thức được công bố.
Cách hoạt động của giá Qwen 3.8 Max
QwenCloud hiện liệt kê mức giá chuẩn cố định là $2 cho mỗi 1M token đầu vào và $6 cho mỗi 1M token đầu ra trên cửa sổ ngữ cảnh 1M token mà Qwen 3.8 Max hỗ trợ. Ảnh chụp giá chính thức dưới đây được ghi vào ngày August 4, 2026; luôn kiểm tra trang mô hình trực tiếp trước khi đưa ra quyết định ngân sách sản xuất.

Nguồn***:*** QwenCloud, “Qwen3.8-Max” official
| Hạng mục thanh toán | Giá mỗi 1M token | Khi áp dụng |
|---|---|---|
| Đầu vào chuẩn | $2.00 | Nội dung prompt mới, định nghĩa công cụ và ngữ cảnh chưa lưu đệm |
| Đầu ra chuẩn | $6.00 | Đầu ra được tạo và phần suy luận bị tính phí |
| Trúng cache ngầm | $0.25 | Tự động tái sử dụng tiền tố prompt; không đảm bảo trúng |
| Tạo cache tường minh | $2.50 | Tạo tiền tố prompt có đánh dấu để tái sử dụng |
| Đọc cache tường minh | $0.17 | Tái sử dụng khối bộ nhớ đệm tường minh hợp lệ |
Do đó, một yêu cầu 900K token sẽ tốn nhiều hơn yêu cầu 100K token vì nó xử lý gấp chín lần số token đầu vào—không phải vì nó bước sang một bậc giá cao hơn.
Suy luận có thể làm tăng chi phí đầu ra
Một câu trả lời ngắn không phải lúc nào cũng là câu trả lời rẻ. Lời gọi bật suy luận có thể tạo thêm token suy luận, do đó ước tính sản xuất nên dùng các trường usage trả về bởi API thay vì độ dài phản hồi nhìn thấy.
Ở nơi endpoint của bạn hỗ trợ điều khiển suy luận cho qwen3.8-max, hãy so sánh các thiết lập hiện có trên cùng một bộ đánh giá. Đừng giả định mặc định của bản preview được giữ nguyên ở bản GA.
Tiết kiệm nhờ bộ nhớ đệm phụ thuộc vào độ ổn định của prompt
Trang mô hình của Qwen 3.8 Max công bố mức giá cache theo mô hình. Hãy dùng các mức đó—không dùng tỷ lệ bộ nhớ đệm chung chung—khi ước tính chi tiêu.
Mục cache tường minh có thời hạn hiệu lực 5 phút, và một lần trúng thành công sẽ đặt lại thời hạn đó. Bộ nhớ đệm ngầm là tự động, nhưng không đảm bảo trúng. Bộ nhớ đệm hữu ích nhất khi prompt hệ thống, định nghĩa công cụ, ngữ cảnh kho mã hoặc tài liệu lớn ổn định qua các lần gọi thường xuyên.
Công cụ tích hợp tạo chi phí riêng
QwenCloud hiện liệt kê các phí công cụ sau ngoài chi phí token:
| Công cụ tích hợp | Phí hiện tại |
|---|---|
| Web Search | $10 / 1K lần gọi |
| Image Search | $8 / 1K lần gọi |
| Web Extractor | Miễn phí trong thời gian giới hạn |
| Code Interpreter | Miễn phí trong thời gian giới hạn |
Function calling và MCP không có phí công cụ riêng, nhưng mô tả công cụ vẫn tính vào token đầu vào. Khuyến mại miễn phí công cụ có thể thay đổi, vì vậy hãy kiểm tra hướng dẫn giá QwenCloud (https://docs.qwencloud.com/developer-guides/getting-started/pricing) trước khi chốt ngân sách sản xuất.
Ví dụ, một yêu cầu có 20K token đầu vào, 2K token đầu ra và hai lần gọi Web Search có chi phí xấp xỉ:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
Trong ví dụ này, hai lần gọi tìm kiếm chiếm khoảng 27.8% tổng chi phí yêu cầu.
Ví dụ chi phí thực tế của Qwen 3.8 Max
Các ví dụ này sử dụng mức giá theo mô hình hiện tại trên QwenCloud. Không bao gồm thuế, thử lại, dự phòng và phần cộng thêm của nhà cung cấp.
Ví dụ 1: Yêu cầu tác tử mức trung bình
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
Một lần thử đầu tiên thành công có chi phí khoảng $0.13. Một lần thử lại đầy đủ sẽ nâng chi phí mô hình lên khoảng $0.26.
Ví dụ 2: Phân tích tài liệu dài
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
Mô hình không áp dụng phụ phí ngữ cảnh dài riêng trên bảng giá hiện tại, nhưng prompt lớn vẫn tạo chi phí tuyệt đối đáng kể.
Ví dụ 3: Phiên tác tử có bộ nhớ đệm
Giả sử một tiền tố có thể tái sử dụng 100K token, 10K token đầu vào mới, 5K token đầu ra và 50 lần gọi trong khi cache tường minh còn hiệu lực:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
Tiết kiệm ước tính = $8.917, tương đương 71.3%
Mức tiết kiệm ước tính phụ thuộc vào trúng cache thành công và tiền tố ổn định. Các khoảng trống dài hoặc thay đổi thường xuyên đối với prompt hệ thống và schema công cụ sẽ giảm lợi ích.
Qwen 3.8 Max so với Qwen 3.7 Max: So sánh giá
Qwen 3.8 Max rẻ hơn 20% so với Qwen 3.7 Max theo giá niêm yết, nhưng Qwen 3.7 Max rẻ hơn 37.5% khi khuyến mại 50% hiện tại còn hiệu lực.
| Mô hình và trạng thái giá | Đầu vào / 1M | Đầu ra / 1M | Ngữ cảnh |
|---|---|---|---|
| qwen3.8-max giá chuẩn | $2.00 | $6.00 | 1M |
| qwen3.7-max giá niêm yết | $2.50 | $7.50 | 1M |
| qwen3.7-max khuyến mại hiện tại | $1.25 | $3.75 | 1M |
Giữ trang mô hình Qwen3.7 Max trên CometAPI (https://www.cometapi.com/models/aliyun/qwen3-7-max/) như phương án dự phòng trong khi thử nghiệm mô hình mới.
Giá mỗi token chỉ là một phần của quyết định. Qwen 3.8 Max vẫn có thể kinh tế hơn nếu nó cải thiện tỉ lệ thành công ngay lần đầu, dùng công cụ đáng tin cậy hơn, giảm lần thử lại hoặc yêu cầu ít chỉnh sửa thủ công hơn.
Hãy dùng chỉ số sản xuất này:
Chi phí mỗi tác vụ được chấp nhận =
(model tokens + lần gọi công cụ + thử lại + chi tiêu dự phòng + chi phí rà soát)
÷ đầu ra được chấp nhận
Các cải thiện điểm benchmark do nhà cung cấp báo cáo là lý do để kiểm tra lại những quy trình lập trình và chuyên môn đòi hỏi cao, chứ không phải bằng chứng rằng mọi khối lượng công việc của Qwen 3.7 đều nên di chuyển.
Cách di chuyển sang Qwen 3.8 Max
Thay đổi chuỗi mô hình là cần thiết, nhưng không đủ cho một đợt di chuyển sản xuất hoàn chỉnh.
1. Kiểm thử ID mô hình sản xuất
Thay thế định danh preview bằng qwen3.8-max trong môi trường thử nghiệm. Đừng giả định alias preview, mặc định, độ trễ hoặc hành vi phản hồi sẽ giữ nguyên.
Một yêu cầu tương thích OpenAI tối thiểu có thể như sau:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
Bắt đầu với yêu cầu tối thiểu được tài liệu hóa. Chỉ thêm điều khiển suy luận khi tài liệu API hiện tại cho endpoint của bạn hỗ trợ rõ ràng.
2. Thiết lập lại đường cơ sở chi phí và telemetry hiệu năng
Ghi lại tối thiểu:
- token đầu vào, đầu ra và suy luận
- số lần trúng cache và token tạo cache
- thời gian đến token đầu tiên và tổng độ trễ
- lần gọi công cụ, thử lại và dự phòng
- đầu ra được chấp nhận so với bị từ chối
- thời gian chỉnh sửa thủ công
3. Kiểm thử lại giao diện mà ứng dụng của bạn sử dụng
Xác thực sự kiện streaming, payload đa phương thức, schema công cụ, đầu ra có cấu trúc, lý do kết thúc, trường usage, xử lý lỗi và hành vi nhiều lượt. Trang mô hình sản xuất ghi tài liệu truy cập theo DashScope và tương thích OpenAI; hãy xác minh mọi lớp tương thích bổ sung trước khi dựa vào.
4. Tuân thủ các giới hạn ngữ cảnh thực tế
Cửa sổ ngữ cảnh 1M không đồng nghĩa với prompt người dùng 1M token. QwenCloud liệt kê đầu vào tối đa là 991K khi không suy luận và 983K khi có suy luận. Thêm biên an toàn để yêu cầu vẫn còn chỗ cho đầu ra và suy luận.
5. Chạy Qwen 3.7 và Qwen 3.8 song song
Dùng prompt, công cụ, bộ kiểm, quy tắc thử lại và bộ dữ liệu giống hệt nhau. So sánh chi phí mỗi tác vụ được chấp nhận và độ trễ thay vì đánh giá từng phản hồi riêng lẻ bằng cảm quan.
Cách đánh giá và định tuyến Qwen 3.8 Max
Hãy dùng khối lượng công việc thực tế thay vì trung bình của benchmark rộng.
| Khối lượng công việc | Số tác vụ gợi ý | Tín hiệu chấp nhận chính |
|---|---|---|
| Lập trình trên kho mã | 4 | Kiểm thử vượt qua mà không cần vá thủ công |
| Phân tích tài liệu dài | 3 | Khẳng định được hỗ trợ bởi bằng chứng cung cấp |
| Phân tích đa phương thức | 2 | Chi tiết hình ảnh hoặc video liên quan được dùng đúng |
| Tác tử sử dụng công cụ | 3 | Chọn công cụ đúng và tham số hợp lệ |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
Dùng Qwen 3.8 Max cho công việc kho mã khó, tác tử dài hạn, phân tích đa phương thức và các quy trình nơi Qwen 3.7 không vượt qua bài kiểm. Giữ Qwen 3.7 Max khi khuyến mại giúp giảm chi phí đáng kể và mô hình hiện tại đã đạt mục tiêu chất lượng của bạn.
Kiểm tra trang giá CometAPI (https://www.cometapi.com/pricing/) và thông tin định tuyến trực tiếp trước khi khóa các ngưỡng vì khả dụng của nhà cung cấp và giá định tuyến có thể thay đổi độc lập với giá niêm yết trực tiếp của QwenCloud. CometAPI Cookbook (https://github.com/cometapi-dev/cometapi-cookbook) có thể giúp bạn xây dựng yêu cầu lặp lại và khung đánh giá nhất quán.
Câu hỏi thường gặp
API Qwen 3.8 Max có giá bao nhiêu?
QwenCloud hiện liệt kê Qwen 3.8 Max ở mức $2 cho mỗi 1 triệu token đầu vào và $6 cho mỗi 1 triệu token đầu ra. Việc dùng bộ nhớ đệm và công cụ tích hợp có mức giá riêng.
Qwen 3.8 Max có đắt hơn khi vượt 128K token không?
Không có bậc giá ngữ cảnh dài riêng trên bảng giá cụ thể của mô hình hiện tại. Yêu cầu dài tốn nhiều vì chứa nhiều token hơn, không phải vì bước sang bậc đơn giá cao hơn.
Token suy luận của Qwen 3.8 Max có bị tính phí không?
Suy luận có thể làm tăng usage được tạo ra và tổng chi phí. Hãy dùng các trường token suy luận và đầu ra do endpoint trả về thay vì ước tính theo độ dài câu trả lời hiển thị.
Qwen 3.8 Max có mã nguồn mở không?
Qwen thông báo rằng trọng số mở sẽ theo sau bản phát hành API. Đừng mô tả mô hình là có thể tải xuống hoặc tự lưu trữ cho đến khi có checkpoint và giấy phép chính thức.
Người dùng Qwen 3.7 Max có nên di chuyển ngay lập tức không?
Không tự động. Qwen 3.8 Max có giá niêm yết thấp hơn, trong khi Qwen 3.7 Max rẻ hơn trong thời gian khuyến mại hiện tại. Hãy di chuyển khi dữ liệu về chất lượng, độ trễ, hành vi bộ nhớ đệm và chi phí mỗi tác vụ được chấp nhận của chính bạn hỗ trợ sự thay đổi.
Thử nghiệm Qwen 3.8 Max với CometAPI
Dùng Quickstart của CometAPI (https://www.cometapi.com/quickstart/) để cấu hình client tương thích OpenAI. Trước khi gửi lưu lượng sản xuất, xác nhận rằng qwen3.8-max đã hoạt động trong tài khoản của bạn và xác minh mức giá định tuyến hiển thị ở đó.
So sánh với đường cơ sở Qwen 3.7 của bạn bằng prompt, bộ kiểm, chính sách thử lại và telemetry giống hệt. Điều này giúp việc đánh giá tập trung vào mô hình thay vì thay đổi trong khung thử nghiệm.
