GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
new/Nghiên cứu CometAPI

Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, ngữ cảnh 1M

Qwen 3.8 Max có giá $2/M cho đầu vào và $6/M cho đầu ra. So sánh phí bộ nhớ đệm (cache), chi phí công cụ, ví dụ thực tế, giới hạn và lời khuyên chuyển đổi từ Qwen 3.7.

CometAPI
Mia MarenĐội ngũ nghiên cứu mô hình AI và API
Đã cập nhật Sep 3, 2026 14 phút đọc
Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, ngữ cảnh 1M
Sử dụng mẫu này

Thực hiện API call đầu tiên.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR Qwen 3.8 Max có giá $2 cho mỗi 1 triệu token đầu vào$6 cho mỗi 1 triệu token đầu ra trên QwenCloud. Tỷ lệ bộ nhớ đệm theo từng model là $0.25/M cho đầu vào được bộ nhớ đệm ngầm, $2.50/M cho việc tạo bộ nhớ đệm tường minh, và $0.17/M cho lượt đọc bộ nhớ đệm tường minh.

Cùng mức giá chuẩn áp dụng trên toàn bộ cửa sổ ngữ cảnh 1M token mà model hỗ trợ. Prompt lớn hơn tốn phí cao hơn vì chứa nhiều token hơn, không phải vì bước sang một bậc giá ngữ cảnh dài cao hơn.

Theo giá niêm yết, Qwen 3.8 Max rẻ hơn 20% so với Qwen 3.7 Max. Tuy nhiên, Qwen 3.7 Max rẻ hơn trong thời gian khuyến mãi 50% hiện tại. Lựa chọn tốt cho sản xuất phụ thuộc vào chi phí cho mỗi tác vụ được chấp nhận, bao gồm suy luận, tỷ lệ trúng bộ nhớ đệm, công cụ, retry, độ trễ và khâu rà soát của con người.

Bảng giá API Qwen 3.8 Max trong nháy mắt

Hạng mụcGiá trị chính thức hiện tại
Model ID dùng sản xuấtqwen3.8-max
Ngày phát hành chính thứcAugust 3, 2026
Kiến trúc2.4T tổng tham số; 95B tham số hoạt động
Giá chuẩn đầu vào$2 / 1M tokens
Giá chuẩn đầu ra$6 / 1M tokens
Đầu vào được đệm ngầm$0.25 / 1M tokens
Tạo bộ đệm tường minh$2.50 / 1M tokens
Đọc bộ đệm tường minh$0.17 / 1M tokens
Cửa sổ ngữ cảnh1M tokens
Đầu vào tối đa991K không bật suy luận; 983K bật suy luận
Đầu ra tối đa131K
Suy luận tối đa262K
Kiểu dữ liệu đầu vàoVăn bản, hình ảnh và video
Kiểu dữ liệu đầu raVăn bản
Giới hạn tham chiếu QwenCloud2M TPM và 15K RPM

Trang model QwenCloud là nguồn trực tiếp nhất cho model ID hiện tại, giá, tỷ lệ bộ nhớ đệm, giới hạn ngữ cảnh và kiểu dữ liệu. Hạn mức theo tài khoản và khu vực có thể khác nhau; vì vậy hãy dùng các giới hạn hiển thị trong chính console của bạn khi đặt mức đồng thời cho môi trường sản xuất.

Bản phát hành sản xuất cũng thay thế định danh preview bằng qwen3.8-max và bổ sung một bảng giá riêng cho model. Tài liệu ra mắt của Qwen mô tả các thiết lập nỗ lực suy luận low, mediumxhigh, nhưng hành vi trong sản xuất cần được xác minh theo endpoint và tài liệu API bạn thực dùng.

Lưu ý có tính thời điểm: Qwen thông báo rằng trọng số mở sẽ phát hành sau API. Tính đến August 4, 2026, không mô tả Qwen 3.8 Max là có thể tải xuống hoặc tự lưu trữ cho đến khi checkpoint và giấy phép chính thức được công bố.

Cách tính giá của Qwen 3.8 Max

QwenCloud hiện niêm yết mức giá chuẩn phẳng $2 cho mỗi 1M token đầu vào$6 cho mỗi 1M token đầu ra trên toàn bộ cửa sổ ngữ cảnh 1M-token của Qwen 3.8 Max. Ảnh chụp bảng giá chính thức bên dưới được ghi nhận ngày August 4, 2026; luôn kiểm tra trang model trực tiếp trước khi đưa ra quyết định ngân sách sản xuất.

Giá API Qwen 3.8 Max: $2 đầu vào, $6 đầu ra, ngữ cảnh 1M

Nguồn***:*** QwenCloud, “Qwen3.8-Max” official

Hạng mục tính cướcGiá trên 1M tokenKhi nào áp dụng
Đầu vào chuẩn$2.00Nội dung prompt mới, định nghĩa công cụ, và ngữ cảnh chưa được đệm
Đầu ra chuẩn$6.00Đầu ra sinh ra và phần suy luận được tính cước
Trúng bộ đệm ngầm$0.25Tự động tái sử dụng tiền tố prompt; không đảm bảo trúng
Tạo bộ đệm tường minh$2.50Tạo tiền tố prompt có đánh dấu để tái sử dụng
Đọc bộ đệm tường minh$0.17Tái sử dụng một khối bộ đệm tường minh hợp lệ

Do đó, một yêu cầu 900K token tốn nhiều hơn yêu cầu 100K token vì xử lý số token đầu vào gấp chín lần—không phải vì vượt sang bậc giá cao hơn.

Suy luận có thể làm tăng chi phí đầu ra

Một câu trả lời ngắn hiển thị không phải lúc nào cũng là câu trả lời chi phí thấp. Cuộc gọi bật suy luận có thể tạo thêm token suy luận, vì vậy ước tính cho sản xuất nên dựa vào các trường usage mà API trả về thay vì độ dài câu trả lời nhìn thấy.

Nếu endpoint của bạn hỗ trợ điều khiển suy luận cho qwen3.8-max, hãy so sánh các thiết lập có sẵn trên cùng một bộ đánh giá. Đừng giả định rằng mặc định của bản preview giữ nguyên trên model GA.

Tiết kiệm từ bộ nhớ đệm phụ thuộc vào độ ổn định của prompt

Trang model của Qwen 3.8 Max công bố các tỷ lệ bộ nhớ đệm theo từng model. Hãy dùng các tỷ lệ đó—không dùng tỷ lệ chung—khi ước tính chi tiêu.

Mục bộ đệm tường minh có hiệu lực trong năm phút và một lần trúng thành công sẽ gia hạn thời hạn này. Bộ đệm ngầm là tự động, nhưng không đảm bảo trúng. Bộ đệm hữu ích nhất khi system prompt, định nghĩa công cụ, ngữ cảnh kho mã hoặc tài liệu lớn ổn định qua nhiều cuộc gọi.

Công cụ tích hợp phát sinh phí riêng

QwenCloud hiện liệt kê các phí công cụ sau bên cạnh phí token:

Công cụ tích hợpPhí hiện tại
Web Search$10 / 1K cuộc gọi
Image Search$8 / 1K cuộc gọi
Web ExtractorMiễn phí trong thời gian có hạn
Code InterpreterMiễn phí trong thời gian có hạn

Gọi hàm (function calling) và MCP không có phí công cụ riêng, nhưng mô tả công cụ vẫn tính vào token đầu vào. Khuyến mãi miễn phí công cụ có thể thay đổi, vì vậy hãy kiểm tra hướng dẫn giá QwenCloud trước khi chốt ngân sách sản xuất.

Ví dụ, một yêu cầu có 20K token đầu vào, 2K token đầu ra và hai cuộc gọi Web Search có chi phí xấp xỉ:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

Trong ví dụ này, hai cuộc gọi tìm kiếm chiếm khoảng 27.8% tổng chi phí yêu cầu.

Ví dụ chi phí thực tế của Qwen 3.8 Max

Các ví dụ này sử dụng các mức giá theo model hiện tại của QwenCloud. Chưa tính thuế, retry, fallback và phần chênh lệch theo nhà cung cấp.

Ví dụ 1: Yêu cầu agent mức trung bình

Giả sử 50K token đầu vào và 5K token đầu ra:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

Một lần thành công ngay nỗ lực đầu tiên có chi phí khoảng $0.13. Một lần retry đầy đủ sẽ nâng chi phí model lên khoảng $0.26.

Ví dụ 2: Phân tích tài liệu dài

Giả sử 800K token đầu vào và 20K token đầu ra:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

Model không áp dụng phụ phí riêng cho ngữ cảnh dài trên bảng giá hiện tại, nhưng prompt lớn vẫn tạo chi phí tuyệt đối đáng kể.

Ví dụ 3: Phiên agent có bộ đệm

Giả sử một tiền tố có thể tái sử dụng 100K token, 10K token đầu vào mới, 5K token đầu ra và 50 cuộc gọi trong khi bộ đệm tường minh còn hiệu lực:

Cuộc gọi đầu tiên:
100K tạo bộ đệm × $2.50/M = $0.250
10K đầu vào mới × $2/M     = $0.020
5K đầu ra × $6/M           = $0.030
Tổng cuộc gọi đầu tiên     = $0.300
Mỗi cuộc gọi trong 49 cuộc tiếp theo:
100K đọc bộ đệm × $0.17/M  = $0.017
10K đầu vào mới × $2/M     = $0.020
5K đầu ra × $6/M           = $0.030
Tổng cho mỗi cuộc gọi      = $0.067
Tổng phiên có bộ đệm       = $3.583
50 cuộc gọi tương tự không dùng bộ đệm = $12.500

Ước tính tiết kiệm = $8.917, tức 71.3%

Mức tiết kiệm ước tính phụ thuộc vào các lần trúng bộ đệm thành công và một tiền tố ổn định. Khoảng gián đoạn dài hoặc thay đổi thường xuyên với system prompt và schema công cụ sẽ làm giảm lợi ích.

Qwen 3.8 Max so với Qwen 3.7 Max: So sánh giá

Qwen 3.8 Max rẻ hơn 20% so với Qwen 3.7 Max theo giá niêm yết, nhưng Qwen 3.7 Max rẻ hơn 37.5% trong thời gian khuyến mãi 50% hiện tại.

Model và trạng thái giáĐầu vào / 1MĐầu ra / 1MNgữ cảnh
qwen3.8-max giá chuẩn$2.00$6.001M
qwen3.7-max giá niêm yết$2.50$7.501M
qwen3.7-max khuyến mãi hiện tại$1.25$3.751M

Giữ trang model Qwen3.7 Max trên CometAPI làm phương án dự phòng trong khi thử nghiệm model mới.

Giá theo token chỉ là một phần của quyết định. Qwen 3.8 Max vẫn có thể kinh tế hơn nếu cải thiện tỷ lệ thành công ngay lần đầu, dùng công cụ ổn định hơn, giảm retry hoặc cần ít chỉnh sửa của con người hơn.

Hãy dùng chỉ số sản xuất này:

Chi phí cho mỗi tác vụ được chấp nhận =

(token của model + cuộc gọi công cụ + retry + chi tiêu cho fallback + chi phí rà soát)

÷ số đầu ra được chấp nhận

Các số liệu benchmark do nhà cung cấp báo cáo là lý do để kiểm thử lại các quy trình coding và nghiệp vụ khó, chứ không phải bằng chứng rằng mọi khối lượng công việc của Qwen 3.7 đều nên chuyển đổi.

Cách di chuyển sang Qwen 3.8 Max

Đổi chuỗi model là cần thiết, nhưng không phải là toàn bộ quá trình di chuyển cho sản xuất.

1. Kiểm thử model ID sản xuất

Thay thế định danh preview bằng qwen3.8-max trong môi trường thử nghiệm. Đừng giả định alias preview, mặc định, độ trễ hoặc hành vi phản hồi sẽ giữ nguyên.

Một yêu cầu tối thiểu tương thích OpenAI có thể như sau:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

Bắt đầu với yêu cầu tối thiểu theo tài liệu. Chỉ thêm điều khiển suy luận khi tài liệu API hiện tại cho endpoint của bạn hỗ trợ rõ ràng.

2. Chuẩn hóa lại số liệu chi phí và hiệu năng

Ghi lại ít nhất:

  • token đầu vào, đầu ra và suy luận
  • lượt trúng bộ đệm và token tạo bộ đệm
  • thời gian đến token đầu tiên và tổng độ trễ
  • cuộc gọi công cụ, retry và fallback
  • đầu ra được chấp nhận so với bị từ chối
  • thời gian chỉnh sửa của con người

3. Kiểm thử lại giao diện mà ứng dụng của bạn dùng

Xác minh sự kiện streaming, payload đa phương tiện, schema công cụ, đầu ra có cấu trúc, lý do kết thúc, trường usage, xử lý lỗi và hành vi nhiều lượt. Trang model sản xuất tài liệu truy cập qua DashScope và tương thích OpenAI; xác minh mọi lớp tương thích bổ sung trước khi phụ thuộc vào chúng.

4. Tôn trọng các giới hạn ngữ cảnh thực tế

Cửa sổ 1M ngữ cảnh không đồng nghĩa với prompt người dùng 1M token. QwenCloud liệt kê đầu vào tối đa 991K khi không bật suy luận và 983K khi bật suy luận. Thêm biên an toàn để yêu cầu vẫn còn chỗ cho đầu ra và suy luận.

5. Chạy Qwen 3.7 và Qwen 3.8 song song

Dùng prompt, công cụ, bộ kiểm định, quy tắc retry và bộ dữ liệu giống hệt nhau. So sánh chi phí cho mỗi tác vụ được chấp nhận và độ trễ thay vì đánh giá bằng mắt các phản hồi riêng lẻ.

Cách đánh giá và định tuyến Qwen 3.8 Max

Dùng khối lượng công việc thực tế thay vì điểm trung bình của benchmark chung.

Khối lượng công việcSố tác vụ gợi ýTín hiệu chấp nhận chính
Lập trình kho mã4Bài kiểm thử vượt qua mà không cần vá thủ công
Phân tích tài liệu dài3Lập luận được chứng minh bởi bằng chứng cung cấp
Phân tích đa phương tiện2Dùng đúng chi tiết ảnh hoặc video liên quan
Agent dùng công cụ3Chọn công cụ đúng và tham số hợp lệ
Một chính sách định tuyến thực tế là:
Tác vụ đơn giản, nhạy với độ trễ
→ Model Plus chi phí thấp hơn
Khối lượng công việc hiện tại đã đạt mục tiêu chất lượng
→ Qwen 3.7 Max trong khi khuyến mãi vẫn hấp dẫn
Tác vụ lập trình khó, đa phương tiện, hoặc tác vụ dài hạn
→ Qwen 3.8 Max
Không qua kiểm định
→ Một lần retry có kiểm soát, rồi fallback đã kiểm thử

Dùng Qwen 3.8 Max cho công việc kho mã khó, agent dài hạn, phân tích đa phương tiện và các quy trình mà Qwen 3.7 không qua được bài kiểm định chấp nhận. Giữ Qwen 3.7 Max khi khuyến mãi giúp giảm chi phí đáng kể và model hiện tại đã đạt mục tiêu chất lượng.

Kiểm tra trang giá CometAPI và thông tin định tuyến trực tiếp trước khi khóa ngưỡng, vì tính sẵn sàng của nhà cung cấp và giá được định tuyến có thể thay đổi độc lập với giá niêm yết trực tiếp của QwenCloud. CometAPI Cookbook có thể giúp bạn xây dựng yêu cầu có thể lặp lại và một khung đánh giá nhất quán.

Câu hỏi thường gặp

API Qwen 3.8 Max có giá bao nhiêu?

QwenCloud hiện niêm yết Qwen 3.8 Max ở mức $2 cho mỗi 1 triệu token đầu vào$6 cho mỗi 1 triệu token đầu ra. Việc dùng bộ nhớ đệm và công cụ tích hợp có mức giá riêng.

Qwen 3.8 Max có tốn nhiều hơn trên 128K token không?

Không có bậc giá ngữ cảnh dài riêng trên bảng giá theo model hiện tại. Yêu cầu dài tốn nhiều hơn vì chứa nhiều token hơn, không phải vì vượt sang một bậc giá theo đơn vị cao hơn.

Token suy luận của Qwen 3.8 Max có bị tính cước không?

Suy luận có thể làm tăng usage sinh ra và tổng chi phí. Hãy dùng các trường token suy luận và đầu ra do endpoint trả về thay vì ước từ độ dài câu trả lời hiển thị.

Qwen 3.8 Max có phải mã nguồn mở không?

Qwen thông báo rằng trọng số mở sẽ phát hành sau API. Không mô tả model là có thể tải xuống hoặc tự lưu trữ cho đến khi checkpoint và giấy phép chính thức có sẵn.

Người dùng Qwen 3.7 Max có nên chuyển ngay không?

Không tự động. Qwen 3.8 Max có giá niêm yết thấp hơn, trong khi Qwen 3.7 Max rẻ hơn trong thời gian khuyến mãi hiện tại. Hãy chuyển khi dữ liệu của chính bạn về chất lượng, độ trễ, hành vi bộ đệm và chi phí cho mỗi tác vụ được chấp nhận ủng hộ việc thay đổi.

Thử Qwen 3.8 Max với CometAPI

Dùng CometAPI Quickstart để cấu hình client tương thích OpenAI. Trước khi gửi lưu lượng sản xuất, xác nhận rằng qwen3.8-max đã hoạt động trong tài khoản của bạn và xác minh giá được định tuyến hiển thị tại đó.

So sánh với baseline Qwen 3.7 của bạn bằng prompt, bộ kiểm định, chính sách retry và telemetry giống hệt nhau. Điều này giúp chú trọng đánh giá vào model thay vì thay đổi ở khung thử nghiệm.

Tiếp tục học

Kết nối bài viết này với quyết định tiếp theo.

Xem tất cả chủ đề
Được xuất bản Aug 4, 2026
Cập nhật lần cuối Sep 3, 2026
199 lượt xem
Đã được xem xét về độ rõ ràng, ghi nguồn và thuật ngữ API hiện tại.

Sẵn sàng giảm 20% chi phí phát triển AI?

Bắt đầu miễn phí trong vài phút. Bao gồm tín dụng dùng thử miễn phí. Không cần thẻ tín dụng.

Đọc thêm