GPT-5.6 Luna price down 80%, Terra down 20% →

Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, ngữ cảnh 1M

CometAPI
Mia MarenAug 4, 2026
Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, ngữ cảnh 1M

Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, cửa sổ ngữ cảnh 1M

Tóm tắt

Qwen 3.8 Max có giá $2 cho mỗi 1 triệu token đầu vào và $6 cho mỗi 1 triệu token đầu ra trên QwenCloud. Mức giá cache theo mô hình là $0.25/M cho đầu vào trúng bộ nhớ đệm ngầm, $2.50/M để tạo bộ nhớ đệm tường minh, và $0.17/M cho lần đọc bộ nhớ đệm tường minh.

Cùng một mức giá token chuẩn áp dụng cho cửa sổ ngữ cảnh 1M token mà mô hình hỗ trợ. Prompt lớn tốn nhiều tiền hơn vì chứa nhiều token hơn, không phải do bước sang bậc giá ngữ cảnh dài hơn.

Theo giá niêm yết, Qwen 3.8 Max rẻ hơn Qwen 3.7 Max 20%. Tuy nhiên, Qwen 3.7 Max rẻ hơn khi chương trình khuyến mại 50% hiện tại còn hiệu lực. Lựa chọn tốt hơn cho sản xuất phụ thuộc vào chi phí mỗi tác vụ được chấp nhận, bao gồm suy luận, tỉ lệ trúng bộ nhớ đệm, công cụ, thử lại, độ trễ và rà soát thủ công.

Giá API Qwen 3.8 Max trong nháy mắt

Hạng mụcGiá trị chính thức hiện tại
ID mô hình sản xuấtqwen3.8-max
Ngày phát hành chính thứcAugust 3, 2026
Kiến trúc2.4T tổng số tham số; 95B tham số hoạt động
Giá đầu vào chuẩn$2 / 1M tokens
Giá đầu ra chuẩn$6 / 1M tokens
Đầu vào trúng cache ngầm$0.25 / 1M tokens
Tạo cache tường minh$2.50 / 1M tokens
Đọc cache tường minh$0.17 / 1M tokens
Cửa sổ ngữ cảnh1M tokens
Đầu vào tối đa991K không suy luận; 983K có suy luận
Đầu ra tối đa131K
Suy luận tối đa262K
Phương thức đầu vàoVăn bản, hình ảnh và video
Phương thức đầu raVăn bản
Giới hạn tham chiếu QwenCloud2M TPM và 15K RPM

Trang mô hình QwenCloud (https://www.qwencloud.com/models/qwen3.8-max) là nguồn trực tiếp nhất cho ID mô hình hiện tại, giá, mức cache, giới hạn ngữ cảnh và phương thức. Hạn ngạch theo tài khoản và khu vực có thể khác nhau, vì vậy hãy dùng các giới hạn hiển thị trong bảng điều khiển của bạn khi thiết lập đồng thời cho sản xuất.

Bản phát hành sản xuất cũng thay thế định danh preview bằng qwen3.8-max và bổ sung bảng giá cụ thể cho mô hình. Tài liệu ra mắt của Qwen mô tả các thiết lập nỗ lực suy luận low, mediumxhigh, nhưng hành vi sản xuất nên được xác minh theo endpoint và tài liệu API bạn thực sự sử dụng.

Lưu ý nhạy thời gian: Qwen thông báo rằng trọng số mở sẽ theo sau bản phát hành API. Tính đến August 4, 2026, không mô tả Qwen 3.8 Max là có thể tải xuống hoặc tự lưu trữ cho đến khi có checkpoint và giấy phép chính thức được công bố.

Cách hoạt động của giá Qwen 3.8 Max

QwenCloud hiện liệt kê mức giá chuẩn cố định là $2 cho mỗi 1M token đầu vào và $6 cho mỗi 1M token đầu ra trên cửa sổ ngữ cảnh 1M token mà Qwen 3.8 Max hỗ trợ. Ảnh chụp giá chính thức dưới đây được ghi vào ngày August 4, 2026; luôn kiểm tra trang mô hình trực tiếp trước khi đưa ra quyết định ngân sách sản xuất.

Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, ngữ cảnh 1M

Nguồn***:*** QwenCloud, “Qwen3.8-Max” official

Hạng mục thanh toánGiá mỗi 1M tokenKhi áp dụng
Đầu vào chuẩn$2.00Nội dung prompt mới, định nghĩa công cụ và ngữ cảnh chưa lưu đệm
Đầu ra chuẩn$6.00Đầu ra được tạo và phần suy luận bị tính phí
Trúng cache ngầm$0.25Tự động tái sử dụng tiền tố prompt; không đảm bảo trúng
Tạo cache tường minh$2.50Tạo tiền tố prompt có đánh dấu để tái sử dụng
Đọc cache tường minh$0.17Tái sử dụng khối bộ nhớ đệm tường minh hợp lệ

Do đó, một yêu cầu 900K token sẽ tốn nhiều hơn yêu cầu 100K token vì nó xử lý gấp chín lần số token đầu vào—không phải vì nó bước sang một bậc giá cao hơn.

Suy luận có thể làm tăng chi phí đầu ra

Một câu trả lời ngắn không phải lúc nào cũng là câu trả lời rẻ. Lời gọi bật suy luận có thể tạo thêm token suy luận, do đó ước tính sản xuất nên dùng các trường usage trả về bởi API thay vì độ dài phản hồi nhìn thấy.

Ở nơi endpoint của bạn hỗ trợ điều khiển suy luận cho qwen3.8-max, hãy so sánh các thiết lập hiện có trên cùng một bộ đánh giá. Đừng giả định mặc định của bản preview được giữ nguyên ở bản GA.

Tiết kiệm nhờ bộ nhớ đệm phụ thuộc vào độ ổn định của prompt

Trang mô hình của Qwen 3.8 Max công bố mức giá cache theo mô hình. Hãy dùng các mức đó—không dùng tỷ lệ bộ nhớ đệm chung chung—khi ước tính chi tiêu.

Mục cache tường minh có thời hạn hiệu lực 5 phút, và một lần trúng thành công sẽ đặt lại thời hạn đó. Bộ nhớ đệm ngầm là tự động, nhưng không đảm bảo trúng. Bộ nhớ đệm hữu ích nhất khi prompt hệ thống, định nghĩa công cụ, ngữ cảnh kho mã hoặc tài liệu lớn ổn định qua các lần gọi thường xuyên.

Công cụ tích hợp tạo chi phí riêng

QwenCloud hiện liệt kê các phí công cụ sau ngoài chi phí token:

Công cụ tích hợpPhí hiện tại
Web Search$10 / 1K lần gọi
Image Search$8 / 1K lần gọi
Web ExtractorMiễn phí trong thời gian giới hạn
Code InterpreterMiễn phí trong thời gian giới hạn

Function calling và MCP không có phí công cụ riêng, nhưng mô tả công cụ vẫn tính vào token đầu vào. Khuyến mại miễn phí công cụ có thể thay đổi, vì vậy hãy kiểm tra hướng dẫn giá QwenCloud (https://docs.qwencloud.com/developer-guides/getting-started/pricing) trước khi chốt ngân sách sản xuất.

Ví dụ, một yêu cầu có 20K token đầu vào, 2K token đầu ra và hai lần gọi Web Search có chi phí xấp xỉ:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Trong ví dụ này, hai lần gọi tìm kiếm chiếm khoảng 27.8% tổng chi phí yêu cầu.

Ví dụ chi phí thực tế của Qwen 3.8 Max

Các ví dụ này sử dụng mức giá theo mô hình hiện tại trên QwenCloud. Không bao gồm thuế, thử lại, dự phòng và phần cộng thêm của nhà cung cấp.

Ví dụ 1: Yêu cầu tác tử mức trung bình

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Một lần thử đầu tiên thành công có chi phí khoảng $0.13. Một lần thử lại đầy đủ sẽ nâng chi phí mô hình lên khoảng $0.26.

Ví dụ 2: Phân tích tài liệu dài

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Mô hình không áp dụng phụ phí ngữ cảnh dài riêng trên bảng giá hiện tại, nhưng prompt lớn vẫn tạo chi phí tuyệt đối đáng kể.

Ví dụ 3: Phiên tác tử có bộ nhớ đệm

Giả sử một tiền tố có thể tái sử dụng 100K token, 10K token đầu vào mới, 5K token đầu ra và 50 lần gọi trong khi cache tường minh còn hiệu lực:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

Tiết kiệm ước tính = $8.917, tương đương 71.3%

Mức tiết kiệm ước tính phụ thuộc vào trúng cache thành công và tiền tố ổn định. Các khoảng trống dài hoặc thay đổi thường xuyên đối với prompt hệ thống và schema công cụ sẽ giảm lợi ích.

Qwen 3.8 Max so với Qwen 3.7 Max: So sánh giá

Qwen 3.8 Max rẻ hơn 20% so với Qwen 3.7 Max theo giá niêm yết, nhưng Qwen 3.7 Max rẻ hơn 37.5% khi khuyến mại 50% hiện tại còn hiệu lực.

Mô hình và trạng thái giáĐầu vào / 1MĐầu ra / 1MNgữ cảnh
qwen3.8-max giá chuẩn$2.00$6.001M
qwen3.7-max giá niêm yết$2.50$7.501M
qwen3.7-max khuyến mại hiện tại$1.25$3.751M

Giữ trang mô hình Qwen3.7 Max trên CometAPI (https://www.cometapi.com/models/aliyun/qwen3-7-max/) như phương án dự phòng trong khi thử nghiệm mô hình mới.

Giá mỗi token chỉ là một phần của quyết định. Qwen 3.8 Max vẫn có thể kinh tế hơn nếu nó cải thiện tỉ lệ thành công ngay lần đầu, dùng công cụ đáng tin cậy hơn, giảm lần thử lại hoặc yêu cầu ít chỉnh sửa thủ công hơn.

Hãy dùng chỉ số sản xuất này:

Chi phí mỗi tác vụ được chấp nhận =

(model tokens + lần gọi công cụ + thử lại + chi tiêu dự phòng + chi phí rà soát)

÷ đầu ra được chấp nhận

Các cải thiện điểm benchmark do nhà cung cấp báo cáo là lý do để kiểm tra lại những quy trình lập trình và chuyên môn đòi hỏi cao, chứ không phải bằng chứng rằng mọi khối lượng công việc của Qwen 3.7 đều nên di chuyển.

Cách di chuyển sang Qwen 3.8 Max

Thay đổi chuỗi mô hình là cần thiết, nhưng không đủ cho một đợt di chuyển sản xuất hoàn chỉnh.

1. Kiểm thử ID mô hình sản xuất

Thay thế định danh preview bằng qwen3.8-max trong môi trường thử nghiệm. Đừng giả định alias preview, mặc định, độ trễ hoặc hành vi phản hồi sẽ giữ nguyên.

Một yêu cầu tương thích OpenAI tối thiểu có thể như sau:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Bắt đầu với yêu cầu tối thiểu được tài liệu hóa. Chỉ thêm điều khiển suy luận khi tài liệu API hiện tại cho endpoint của bạn hỗ trợ rõ ràng.

2. Thiết lập lại đường cơ sở chi phí và telemetry hiệu năng

Ghi lại tối thiểu:

  • token đầu vào, đầu ra và suy luận
  • số lần trúng cache và token tạo cache
  • thời gian đến token đầu tiên và tổng độ trễ
  • lần gọi công cụ, thử lại và dự phòng
  • đầu ra được chấp nhận so với bị từ chối
  • thời gian chỉnh sửa thủ công

3. Kiểm thử lại giao diện mà ứng dụng của bạn sử dụng

Xác thực sự kiện streaming, payload đa phương thức, schema công cụ, đầu ra có cấu trúc, lý do kết thúc, trường usage, xử lý lỗi và hành vi nhiều lượt. Trang mô hình sản xuất ghi tài liệu truy cập theo DashScope và tương thích OpenAI; hãy xác minh mọi lớp tương thích bổ sung trước khi dựa vào.

4. Tuân thủ các giới hạn ngữ cảnh thực tế

Cửa sổ ngữ cảnh 1M không đồng nghĩa với prompt người dùng 1M token. QwenCloud liệt kê đầu vào tối đa là 991K khi không suy luận và 983K khi có suy luận. Thêm biên an toàn để yêu cầu vẫn còn chỗ cho đầu ra và suy luận.

5. Chạy Qwen 3.7 và Qwen 3.8 song song

Dùng prompt, công cụ, bộ kiểm, quy tắc thử lại và bộ dữ liệu giống hệt nhau. So sánh chi phí mỗi tác vụ được chấp nhận và độ trễ thay vì đánh giá từng phản hồi riêng lẻ bằng cảm quan.

Cách đánh giá và định tuyến Qwen 3.8 Max

Hãy dùng khối lượng công việc thực tế thay vì trung bình của benchmark rộng.

Khối lượng công việcSố tác vụ gợi ýTín hiệu chấp nhận chính
Lập trình trên kho mã4Kiểm thử vượt qua mà không cần vá thủ công
Phân tích tài liệu dài3Khẳng định được hỗ trợ bởi bằng chứng cung cấp
Phân tích đa phương thức2Chi tiết hình ảnh hoặc video liên quan được dùng đúng
Tác tử sử dụng công cụ3Chọn công cụ đúng và tham số hợp lệ
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

Dùng Qwen 3.8 Max cho công việc kho mã khó, tác tử dài hạn, phân tích đa phương thức và các quy trình nơi Qwen 3.7 không vượt qua bài kiểm. Giữ Qwen 3.7 Max khi khuyến mại giúp giảm chi phí đáng kể và mô hình hiện tại đã đạt mục tiêu chất lượng của bạn.

Kiểm tra trang giá CometAPI (https://www.cometapi.com/pricing/) và thông tin định tuyến trực tiếp trước khi khóa các ngưỡng vì khả dụng của nhà cung cấp và giá định tuyến có thể thay đổi độc lập với giá niêm yết trực tiếp của QwenCloud. CometAPI Cookbook (https://github.com/cometapi-dev/cometapi-cookbook) có thể giúp bạn xây dựng yêu cầu lặp lại và khung đánh giá nhất quán.

Câu hỏi thường gặp

API Qwen 3.8 Max có giá bao nhiêu?

QwenCloud hiện liệt kê Qwen 3.8 Max ở mức $2 cho mỗi 1 triệu token đầu vào và $6 cho mỗi 1 triệu token đầu ra. Việc dùng bộ nhớ đệm và công cụ tích hợp có mức giá riêng.

Qwen 3.8 Max có đắt hơn khi vượt 128K token không?

Không có bậc giá ngữ cảnh dài riêng trên bảng giá cụ thể của mô hình hiện tại. Yêu cầu dài tốn nhiều vì chứa nhiều token hơn, không phải vì bước sang bậc đơn giá cao hơn.

Token suy luận của Qwen 3.8 Max có bị tính phí không?

Suy luận có thể làm tăng usage được tạo ra và tổng chi phí. Hãy dùng các trường token suy luận và đầu ra do endpoint trả về thay vì ước tính theo độ dài câu trả lời hiển thị.

Qwen 3.8 Max có mã nguồn mở không?

Qwen thông báo rằng trọng số mở sẽ theo sau bản phát hành API. Đừng mô tả mô hình là có thể tải xuống hoặc tự lưu trữ cho đến khi có checkpoint và giấy phép chính thức.

Người dùng Qwen 3.7 Max có nên di chuyển ngay lập tức không?

Không tự động. Qwen 3.8 Max có giá niêm yết thấp hơn, trong khi Qwen 3.7 Max rẻ hơn trong thời gian khuyến mại hiện tại. Hãy di chuyển khi dữ liệu về chất lượng, độ trễ, hành vi bộ nhớ đệm và chi phí mỗi tác vụ được chấp nhận của chính bạn hỗ trợ sự thay đổi.

Thử nghiệm Qwen 3.8 Max với CometAPI

Dùng Quickstart của CometAPI (https://www.cometapi.com/quickstart/) để cấu hình client tương thích OpenAI. Trước khi gửi lưu lượng sản xuất, xác nhận rằng qwen3.8-max đã hoạt động trong tài khoản của bạn và xác minh mức giá định tuyến hiển thị ở đó.

So sánh với đường cơ sở Qwen 3.7 của bạn bằng prompt, bộ kiểm, chính sách thử lại và telemetry giống hệt. Điều này giúp việc đánh giá tập trung vào mô hình thay vì thay đổi trong khung thử nghiệm.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm