TL;DR Qwen3.7 Plus bắt đầu at $0.40/M input và $1.60/M output trên tuyến US-local của Alibaba, trong khi tuyến Global bắt đầu ở $0.276/M và $1.101/M. Để so sánh, CometAPI hiện niêm yết model ở mức $0.32/M input và $1.28/M output. Rủi ro chi phí chính là ngưỡng 256K của Alibaba: một khi yêu cầu vượt ngưỡng này, bậc giá cao hơn áp dụng cho toàn bộ yêu cầu.
Qwen3.7 Plus API Pricing at a Glance
Qwen3.7 Plus không có một mức giá API thống nhất. Chi phí cuối cùng phụ thuộc vào tuyến triển khai, độ dài yêu cầu, chiết khấu tạm thời, việc sử dụng cache, thinking output, số lần gọi Web Search và khả năng tính năng theo khu vực.
| Route | Input tokens per request | Input price / 1M | Output price / 1M | Current pricing note |
|---|---|---|---|---|
| Alibaba US-local qwen3.7-plus-us | 0–256K | $0.40 | $1.60 | Không có nhãn khuyến mãi trên dòng US-local hiện tại |
| Alibaba US-local qwen3.7-plus-us | >256K–1M | $1.20 | $4.80 | Bậc giá cao hơn áp dụng cho toàn bộ yêu cầu |
| Alibaba Global qwen3.7-plus | 0–256K | $0.28 | $1.10 | Hiện đang hiển thị chiết khấu giới hạn ban ngày và ban đêm |
| Alibaba Global qwen3.7-plus | >256K–1M | $0.83 | $3.30 | Hiện đang hiển thị chiết khấu giới hạn ban ngày và ban đêm |
| Alibaba International qwen3.7-plus | 0–256K | $0.40 list price | $1.60 list price | Trang hiện tại hiển thị chiết khấu 20% trong thời gian có hạn |
| Alibaba International qwen3.7-plus | >256K–1M | $1.20 list price | $4.80 list price | Trang hiện tại hiển thị chiết khấu 20% trong thời gian có hạn |
| CometAPI routed qwen3.7-plus | Check live route | $0.32 | $1.28 | Giá tiêu đề hiển thị trên trang model hiện tại |
Alibaba ghi nhận một context window 1,000,000-token cho qwen3.7-plus.
Sources:**Alibaba Cloud Model Studio pricing
A Note on Temporary Alibaba Discounts
Bảng giá hiện tại của Alibaba gắn nhãn qwen3.7-plus Global với chiết khấu ban ngày 20% và ban đêm 60% trong thời gian có hạn.
Khung giờ ban đêm được công bố là 22:00–08:00 UTC**+8**, dựa trên thời gian tính cước. Tuyến International hiện hiển thị chiết khấu 20% trong thời gian có hạn.
Vì các chương trình khuyến mãi có thể thay đổi hoặc hết hạn, các phép tính dưới đây sử dụng giá niêm yết tiêu chuẩn trừ khi có nêu rõ khác. Đối với dự báo vận hành trực tiếp, hãy kiểm tra bảng điều khiển Model Studio và trang giá vào ngày bạn chạy lưu lượng.
Alibaba US-Local vs Global Pricing
Khác biệt quan trọng nhất với các nhà phát triển tại Mỹ là tuyến US-local và Global của Alibaba không dùng cùng một dòng giá.
Model ID US-local là:
qwen3.7-plus-us
Giá niêm yết bắt đầu ở:
- $0.40 cho mỗi 1M token đầu vào
- $1.60 cho mỗi 1M token đầu ra
Model ID Global là:
qwen3.7-plus
Giá niêm yết bắt đầu ở:
- $0.276 cho mỗi 1M token đầu vào
- $1.101 cho mỗi 1M token đầu ra
Tuyến Global rẻ hơn dựa trên giá niêm yết đã công bố, nhưng chi phí không nên là yếu tố duy nhất để chọn tuyến.
Các nhóm cũng nên cân nhắc:
- Yêu cầu lưu trú dữ liệu
- Khả dụng theo khu vực
- Độ trễ
- Hỗ trợ công cụ
- Yêu cầu tuân thủ
- Độ ổn định dịch vụ
- Chiết khấu tạm thời của nhà cung cấp
Một tuyến Global giá thấp hơn có thể không phù hợp với khối lượng công việc cần xử lý tại một khu vực cụ thể.
How the 256K Pricing Tier Works
Alibaba Cloud sử dụng tổng số token đầu vào trong một yêu cầu để chọn bậc giá.
Nếu một yêu cầu vượt 256K token đầu vào, đơn giá cao hơn sẽ áp dụng cho mọi token được tính cước trong yêu cầu đó, bao gồm cả token đầu ra ở mức giá đầu ra của bậc cao hơn.
Một yêu cầu 300K-token không được tính như:
- 256K token theo giá thấp hơn
- 44K token theo giá cao hơn
Thay vào đó, toàn bộ yêu cầu sử dụng bậc giá cao hơn.
Đối với tuyến US-local, điều này có nghĩa mức giá thay đổi từ:
- $0.40 lên $1.20 cho mỗi 1M token đầu vào
- $1.60 lên $4.80 cho mỗi 1M token đầu ra
Mức giá cao hơn áp dụng cho tất cả token đầu vào và đầu ra được tính cước trong yêu cầu đó.
Qwen3.7 Plus Cost Examples
Example 1: A Request Below 256K
Giả sử một yêu cầu chứa:
- 100,000 token đầu vào
- 10,000 token đầu ra
| Route | Input calculation | Output calculation | Estimated list-price cost |
|---|---|---|---|
| Alibaba US-local | 100K ÷ 1M × $0.40 = $0.0400 | 10K ÷ 1M × $1.60 = $0.0160 | $0.0560 |
| Alibaba Global | 100K ÷ 1M × $0.276 = $0.0276 | 10K ÷ 1M × $1.101 = $0.0110 | $0.0386 |
| CometAPI | 100K ÷ 1M × $0.32 = $0.0320 | 10K ÷ 1M × $1.28 = $0.0128 | $0.0448 |
Các con số của Alibaba ở trên sử dụng giá niêm yết trước mọi chiết khấu tạm thời áp dụng.
Example 2: A Request Above 256K
Bây giờ giả sử một yêu cầu chứa:
- 400,000 token đầu vào
- 20,000 token đầu ra
Vì yêu cầu vượt 256K token đầu vào, Alibaba Cloud áp dụng bậc giá cao hơn cho tất cả token đầu vào và đầu ra trong yêu cầu.
| Route | Input calculation | Output calculation | Estimated cost |
|---|---|---|---|
| Alibaba US-local | 400K ÷ 1M × $1.20 = $0.4800 | 20K ÷ 1M × $4.80 = $0.0960 | $0.5760 |
| Alibaba Global | 400K ÷ 1M × $0.826 = $0.3304 | 20K ÷ 1M × $3.301 = $0.0660 | $0.3964 |
| CometAPI headline-rate scenario* | 400K ÷ 1M × $0.32 = $0.1280 | 20K ÷ 1M × $1.28 = $0.0256 | $0.1536* |
*Con số CometAPI là ước tính có điều kiện, không phải giá sản xuất đã xác nhận cho yêu cầu trên 256K.
Trang model công khai của CometAPI hiện hiển thị một mức giá tiêu đề và tối đa khoảng 991.8K token đầu vào. Tuy nhiên, trang không nêu rõ liệu yêu cầu trên 256K có:
- Giữ nguyên mức giá tiêu đề
- Sử dụng một bậc giá long-context riêng
- Chịu phụ phí định tuyến bổ sung
Nếu mức giá tiêu đề vẫn không đổi trên 256K, chi phí ước tính sẽ là:
- Đầu vào: 400K ÷ 1M × $0.32 = $0.1280
- Đầu ra: 20K ÷ 1M × $1.28 = $0.0256
- Tổng: $0.1536
Source*:* CometAPI Qwen3.7 Plus Pricing
Can Splitting a Large Request Reduce the Cost?
Trong một số trường hợp, có.
Giả sử tác vụ 400K-input có thể được chia thành hai yêu cầu độc lập, mỗi yêu cầu chứa:
- 200K token đầu vào
- 10K token đầu ra
Trên tuyến US-local:
| Plan | Calculation | Estimated cost |
|---|---|---|
| One 400K-input request | $0.4800 input + $0.0960 output | $0.576 |
| Two 200K-input requests | 2 × [($0.0800 input) + ($0.0160 output)] | $0.192 |
Phiên bản hai yêu cầu rẻ hơn đáng kể vì cả hai cuộc gọi đều nằm dưới ngưỡng 256K.
Tuy nhiên, đây là một tối ưu minh họa chứ không phải khuyến nghị chung.
Chia tách tác vụ có thể dẫn đến:
- Ngữ cảnh bị lặp lại
- Nhiều cuộc gọi API hơn
- Nhiều logic điều phối hơn
- Độ trễ cao hơn
- Mất ngữ cảnh xuyên tài liệu
- Chất lượng câu trả lời thấp hơn
Chỉ sử dụng cách tiếp cận này khi công việc có thể tách rời mà không làm suy yếu kết quả cuối cùng.
Context Cache Pricing for Qwen3.7 Plus
Context Cache có thể giảm chi phí cho các system prompt lặp lại, ngữ cảnh kho mã, tài liệu chính sách, danh mục sản phẩm và các tài liệu tham chiếu có thể tái sử dụng khác.
Alibaba Cloud cung cấp chế độ Context Cache rõ ràng (explicit) và ngầm định (implicit).
| Cache mode | Cache creation | Cached-input price | Operational detail |
|---|---|---|---|
| Explicit cache | 125% of standard input price | 10% of standard input price | Thời hạn 5 phút; bộ đếm thời gian đặt lại sau mỗi lần hit; xác định trong thời hạn hiệu lực |
| Implicit cache | 100% of standard input price | 20% of standard input price | Tự động phát hiện tiền tố chung; xác suất hit không được đảm bảo |
Nguồn: Alibaba Cloud Context Cache documentation.
Context Cache Cost Example
Giả sử một workflow US-local lặp lại việc gửi:
- 80K token tiền tố ổn định
- 5K token đầu vào mới
- 5K token đầu ra
| Scenario | Input cost | Output cost | Estimated cost per request |
|---|---|---|---|
| No cache | 85K ÷ 1M × $0.40 = $0.0340 | 5K ÷ 1M × $1.60 = $0.0080 | $0.04 |
| Implicit cache hit on 80K | (80K ÷ 1M × $0.08) + (5K ÷ 1M × $0.40) = $0.0084 | $0.01 | $0.02 |
| Explicit cache hit on 80K | (80K ÷ 1M × $0.04) + (5K ÷ 1M × $0.40) = $0.0052 | $0.01 | $0.01 |
Explicit cache có thời hạn hiệu lực năm phút và đặt lại sau mỗi lần hit thành công, không phải TTL tối thiểu một giờ.
Token tạo cache tốn 125% so với giá input bình thường, trong khi các lần hit cache sau đó tốn 10%.
When Does Explicit Cache Become Cheaper?
Đối với phần tiền tố ổn định, để N biểu thị tổng số yêu cầu có tiền tố giống hệt nhau.
Chi phí explicit-cache đã chuẩn hóa là:
1.25 + 0.10 × (N − 1)
Một chuỗi implicit-cache lý tưởng là:
1.00 + 0.20 × (N − 1)
Theo giả định đơn giản rằng mọi yêu cầu sau yêu cầu đầu tiên đều nhận được một implicit-cache hit, explicit cache trở nên rẻ hơn ở bốn yêu cầu tổng cộng:
- Một yêu cầu tạo cache
- Ba lần tái sử dụng cache thành công
So với không dùng cache, explicit cache trở nên rẻ hơn từ yêu cầu thứ hai.
Trong khối lượng công việc thực tế, điểm hòa vốn có thể khác vì implicit-cache hit không được đảm bảo.
Hãy theo dõi:
- Token đầu vào đã cache
- Token tạo cache
- Token đầu vào chưa cache
- Token đầu ra
- Tỷ lệ cache hit
- Số lần retry
- Tỷ lệ tác vụ thành công
Giảm tiêu thụ token sẽ không giúp ích nếu cache miss hoặc suy giảm chất lượng dẫn đến nhiều lần thử lại hơn.
Qwen Web Search Pricing
Đối với qwen3.7-plus, Alibaba hướng nhà phát triển sử dụng công cụ Responses API web_search.
Web Search thêm hai thành phần chi phí riêng biệt:
- Nội dung web được truy xuất sẽ được thêm vào prompt của model và tính như token đầu vào bình thường.
- Chính sách tìm kiếm có một khoản phí riêng theo mỗi 1,000 lần gọi.
Mức giá chính sách agent hiện được ghi nhận là:
| Deployment scope | Web Search fee / 1,000 calls |
|---|---|
| Chinese mainland and Global | $0.57 |
| International | $10.00 |
Nguồn: Alibaba Cloud Web Search documentation.
Bảng hỗ trợ hiện liệt kê qwen3.7-plus cho phạm vi triển khai Global và International, nhưng không liệt kê model ID US-local qwen3.7-plus-us.
Hãy xác minh khả dụng của công cụ trước khi thiết kế một workflow US-local dựa trên tính năng Web Search tích hợp của Alibaba.
International Web Search Cost Example
Giả sử một yêu cầu chứa:
- 10K token đầu vào bình thường
- 2K token đầu ra
- Hai lần gọi Web Search
Trước khi tính các token bổ sung được trả về bởi công cụ tìm kiếm:
| Cost component | Calculation | Cost |
|---|---|---|
| Model input | 10K ÷ 1M × $0.40 list price | $0.0040 |
| Model output | 2K ÷ 1M × $1.60 list price | $0.0032 |
| Web Search | 2 ÷ 1,000 × $10.00 | $0.0200 |
| Total before retrieved-content tokens | $0.0040 + $0.0032 + $0.0200 | $0.0272 |
Phí chính sách tìm kiếm chiếm:
$0.0200 ÷ $0.0272 = 73.5%
Trong ví dụ này, phí tìm kiếm chiếm 73.5% tổng chi phí trước khi tính các token nội dung được truy xuất, hoặc 74% khi làm tròn đến phần trăm nguyên gần nhất.
Trên tuyến Global, phí chính sách theo mỗi lần gọi thấp hơn nhiều. Tuy nhiên, các trang web được truy xuất vẫn có thể làm tăng đáng kể lượng token đầu vào hoặc đẩy một tác nhân chạy dài vượt qua ngưỡng giá 256K.
Đối với các workflow dựa trên tìm kiếm, hãy theo dõi cả:
- Số lần gọi tìm kiếm
- Số lượng token của nội dung được truy xuất
Batch API Pricing and Availability
Batch File API của Alibaba tính token đầu vào và đầu ra thành công ở mức 50% giá suy luận thời gian thực tương ứng.
API này được thiết kế cho khối lượng công việc ngoại tuyến nơi không cần phản hồi ngay lập tức, bao gồm:
- Đánh giá model
- Gắn thẻ tài liệu
- Phân loại quy mô lớn
- Tạo dữ liệu tổng hợp
- Bổ sung dữ liệu hằng đêm
- Xử lý đa phương thức ngoại tuyến
- Chạy benchmark
Tuy nhiên, chiết khấu Batch không nên được đưa vào mọi dự báo chi phí Qwen3.7 Plus một cách tự động.
Tài liệu hiện tại cho biết rằng:
- Model chính xác
qwen3.7-plusđược liệt kê dưới China (Beijing). - Phạm vi Singapore Batch liệt kê alias chung như
qwen-plus, thay vì model IDqwen3.7-pluschính xác. - Tài liệu không liệt kê
qwen3.7-plus-uslà model US-local hỗ trợ Batch. - Các yêu cầu Batch được hỗ trợ cho Qwen3.7 Plus có context tối đa 256K, không phải 1M.
- Batch không hỗ trợ Context Cache.
- Không thể kết hợp chiết khấu Batch và cache.
- Thinking mode được bật theo mặc định cho các job Batch dòng Qwen3.7 trừ khi được cấu hình rõ ràng.
- Thinking tokens được tính ở mức giá token đầu ra.
completion_windowcó thể cấu hình là khoảng chờ tối đa từ 24 đến 336 giờ.- Completion window không đảm bảo rằng mọi job sẽ mất 24 giờ hoặc hoàn thành tại thời điểm cụ thể.
Source*:* Alibaba Cloud OpenAI-compatible Batch API documentation**.
A 50% Batch Discount Does Not Always Mean a 50% Cheaper Task
Batch giảm một nửa đơn giá token đầu vào và đầu ra. Nó không kiểm soát số lượng thinking token mà model tạo ra.
Ví dụ sau sử dụng tỷ lệ giá vào/ra của US-local chỉ để minh họa phép tính. Ví dụ này không ngụ ý rằng tuyến US-local hiện hỗ trợ Batch.
| Illustrative scenario | Input tokens | Output including thinking | Estimated cost |
|---|---|---|---|
| Real-time, thinking disabled | 100K | 10K | $0.0560 |
| Batch, moderate thinking | 100K | 40K | $0.0520 |
| Batch, heavier thinking | 100K | 50K | $0.0600 |
Ví dụ thời gian thực được tính như sau:
- Đầu vào: 100K ÷ 1M × $0.40 = $0.0400
- Đầu ra: 10K ÷ 1M × $1.60 = $0.0160
- Tổng: $0.0560
Ví dụ Batch với thinking vừa phải được tính bằng mức giá giảm một nửa:
- Đầu vào: 100K ÷ 1M × $0.20 = $0.0200
- Đầu ra: 40K ÷ 1M × $0.80 = $0.0320
- Tổng: $0.0520
Ví dụ Batch với thinking nặng hơn:
- Đầu vào: 100K ÷ 1M × $0.20 = $0.0200
- Đầu ra: 50K ÷ 1M × $0.80 = $0.0400
- Tổng: $0.0600
Trong kịch bản cuối cùng, thinking output bổ sung hoàn toàn xóa bỏ phần tiết kiệm danh nghĩa của Batch.
Đối với các khối lượng công việc ngoại tuyến có tính quyết định như phân loại, trích xuất, gắn thẻ và định dạng, hãy đặt rõ:
{
"enable_thinking": false
}
Đối với các tác vụ khó hơn, hãy đặt thinking_budget phù hợp và so sánh chi phí trên mỗi tác vụ thành công thay vì giả định rằng chiết khấu Batch tiêu đề sẽ giảm hóa đơn cuối cùng đúng 50%.
Đối với kế hoạch US hoặc Global, coi khoản tiết kiệm Batch là chưa được xác nhận cho đến khi model ID và tuyến chính xác xuất hiện trong bảng điều khiển hiện tại hoặc tài liệu khu vực của bạn.
Thinking Tokens and Output Costs
Qwen3.7 Plus hỗ trợ chế độ thinking và non-thinking.
Thinking có thể cải thiện hiệu năng ở các workflow lập luận phức tạp, viết mã, lập kế hoạch và agent. Tuy nhiên, thinking token làm tăng lượng đầu ra và được tính theo mức giá token đầu ra.
Điều này quan trọng vì token đầu ra đắt gấp bốn lần token đầu vào trên các bậc giá của Qwen3.7 Plus của Alibaba.
Đối với tuyến US-local dưới 256K:
- Đầu vào: $0.40 cho mỗi 1M token
- Đầu ra: $1.60 cho mỗi 1M token
Trên 256K:
- Đầu vào: $1.20 cho mỗi 1M token
- Đầu ra: $4.80 cho mỗi 1M token
Đối với khối lượng công việc nhạy cảm với chi phí, cân nhắc tắt hoặc giới hạn thinking cho các tác vụ đơn giản như:
- Trích xuất dữ liệu
- Định dạng
- Phân loại
- Gắn thẻ nội dung
- Tóm tắt đơn giản
- Định tuyến cơ bản
- Tạo output có cấu trúc
Chỉ dùng ngân sách thinking dài hơn khi dữ liệu đánh giá cho thấy chúng cải thiện đáng kể tỷ lệ hoàn thành tác vụ.
Qwen3.7 Plus vs Qwen3.7 Max vs Qwen3.6 Plus Pricing in CometAPI
| Model | Current CometAPI listed price | Best first test | Main cost consideration |
|---|---|---|---|
| qwen3.7-plus | $0.32/M input; $1.28/M output | Tác nhân đa phương thức, ảnh chụp màn hình, visual coding, tài liệu, biểu đồ và workflow UI | Ngưỡng 256K trên tuyến Alibaba trực tiếp, vòng lặp công cụ và thinking output |
| qwen3.7-max | $1.36/M input; $4.08/M output | Lập trình tự động thuần văn bản, lập luận sâu và tác nhân tầm nhìn dài | Danh sách Qwen API hiện hiển thị chỉ đầu vào văn bản; không định tuyến workload ảnh hoặc video tới Max |
| qwen3.6-plus | $0.32/M input; $1.92/M output | Điểm xuất phát di trú cho các workflow Qwen3.6 hiện có | Mức giá đầu ra cao hơn Qwen3.7 Plus |
Sources: CometAPI Qwen3.7 Plus model page**; CometAPI Qwen3.7 Max model page;CometAPI Qwen3.6 Plus model page
Qwen định vị Qwen3.7 Plus là một model đa phương thức cho hiểu biết hình ảnh, viết mã, tương tác GUI, sử dụng công cụ và workflow năng suất.
Danh sách Qwen API hiện tại hiển thị Qwen3.7 Max với đầu vào văn bản và đầu ra văn bản, trong khi tài liệu hiểu hình ảnh của Alibaba liệt kê Qwen3.7 Plus cho đầu vào ảnh và video.
Hãy bắt đầu với Plus khi tác vụ bao gồm:
- Hình ảnh
- Video
- Ảnh chụp màn hình
- Tài liệu
- Biểu đồ
- Trạng thái giao diện
- Visual coding
- Tương tác GUI
Kiểm thử Max cho công việc thuần văn bản khi một tỷ lệ tác vụ giải quyết cao hơn có thể biện minh cho chi phí token cao hơn.
How to Reduce Qwen3.7 Plus API Costs
1. Measure Traffic Around the 256K Boundary
Nhóm các yêu cầu sản xuất theo tổng độ dài đầu vào:
- 0–32K
- 32K–128K
- 128K–256K
- Trên 256K
Sau đó xem lại những workflow nào thực sự cần bậc giá cao nhất.
Một yêu cầu không nên vượt 256K chỉ vì mọi tài liệu có sẵn, lượt hội thoại, kết quả công cụ hoặc file kho mã đều được đưa vào theo mặc định.
2. Add a Preflight Token Guard
Sử dụng bộ đếm token tương thích model trong lớp ứng dụng hoặc API-gateway trước mỗi yêu cầu được gửi.
Các ngưỡng sau là kinh nghiệm kỹ thuật thay vì quy định của Alibaba:
- Dưới 220K: Gửi bình thường.
- Giữa 220K và 240K: Ghi cảnh báo và ngăn chặn việc ngữ cảnh tăng không cần thiết.
- Trên khoảng 240K: Nén ngữ cảnh trước khi gửi.
- Trên 256K: Chỉ tiếp tục khi lợi ích chất lượng mong đợi biện minh cho bậc giá Alibaba cao hơn.
Khi guard được kích hoạt, workflow có thể:
- Tóm tắt các output công cụ cũ hơn.
- Loại bỏ kết quả tìm kiếm trùng lặp.
- Thay thế log thô bằng tóm tắt lỗi có cấu trúc.
- Chỉ truy xuất các đoạn tài liệu liên quan nhất.
- Di chuyển các lượt hội thoại cũ vào một khối bộ nhớ nén.
- Chia các nhóm tài liệu thực sự độc lập thành các cuộc gọi riêng.
- Định tuyến tác vụ đến nhà cung cấp có giá long-context phẳng đã xác nhận, khi phù hợp.
Để lại một ít khoảng an toàn vì:
- Đầu vào hình ảnh tiêu tốn token
- Lược đồ công cụ thêm ngữ cảnh
- System message có thể lớn
- Nội dung web được truy xuất có thể tăng bất ngờ
- Tokenizer có thể đếm cùng văn bản khác nhau
Các công cụ quan sát như Langfuse có thể giúp theo dõi việc sử dụng token. Một gateway như APISIX có thể cưỡng chế ngưỡng khi kết hợp với tokenizer phù hợp hoặc chính sách định tuyến tùy chỉnh.
3. Put Stable Content First
Đặt nội dung có thể tái sử dụng ở gần phần đầu prompt, bao gồm:
- Hướng dẫn hệ thống
- Khối chính sách
- Lược đồ công cụ
- Tóm tắt kho mã
- Danh mục sản phẩm
- Tài liệu tái sử dụng
- Hướng dẫn thương hiệu
- Lược đồ output
Đặt nội dung người dùng thay đổi nhiều ở phía sau.
Tiền tố ổn định cải thiện khả năng nhận được implicit cache hit và giúp khối explicit cache dễ quản lý hơn.
4. Summarize Old Tool Results
Workflow kiểu agent có thể tích lũy lượng ngữ cảnh lớn thông qua:
- Kết quả tìm kiếm
- Output trình duyệt
- Log thực thi mã
- Phản hồi model trước đó
- Thông báo lỗi
- Lược đồ công cụ
Thay vì giữ mọi output thô, định kỳ tóm tắt ngữ cảnh cũ và chỉ giữ thông tin cần thiết cho bước tiếp theo.
5. Control Thinking Output
Ghi log thinking token riêng với token câu trả lời hiển thị.
Với tác vụ đơn giản, tắt thinking nếu được hỗ trợ hoặc đặt ngân sách lập luận nhỏ hơn.
Với tác vụ phức tạp, so sánh chi phí lập luận bổ sung với mức giảm trong retry, lỗi và công sức kiểm duyệt của con người.
6. Count Tool Calls and Retrieved Tokens
Với tác nhân Web Search, ghi lại:
- Số lần gọi tìm kiếm
- Số lần gọi extractor
- Token nội dung được truy xuất
- Retry tìm kiếm
- Retry model
- Cuộc gọi fallback
- Kết quả tác vụ cuối cùng
Phí công cụ tìm kiếm có thể chiếm ưu thế trong các yêu cầu nhỏ, trong khi nội dung được truy xuất có thể chiếm ưu thế trong các yêu cầu dài.
7. Optimize for Cost per Completed Task
Đừng so sánh các tuyến chỉ bằng chi phí quảng cáo theo mỗi triệu token.
Hãy đo lường:
- Chi phí mỗi yêu cầu
- Chi phí mỗi tác vụ hoàn thành
- Tỷ lệ thành công tác vụ
- Tỷ lệ retry
- Tỷ lệ fallback
- Tỷ lệ cache hit
- Số lần gọi tìm kiếm mỗi tác vụ
- Độ trễ
- Thời gian kiểm duyệt của con người
Một model rẻ hơn có thể trở nên đắt hơn nếu nó tạo câu trả lời sai, cần thêm cuộc gọi hoặc tạo ra nhiều công việc thủ công hơn.
A Practical Qwen3.7 Plus Evaluation Plan
Trước khi chuyển lưu lượng sản xuất, hãy tạo một tập đánh giá tập trung dựa trên khối lượng công việc thực tế của bạn.
Một tập thử 30 tác vụ thường đủ để xác định khác biệt lớn về chi phí, độ trễ và chất lượng hoàn thành.
| Evaluation slice | Example tasks | Primary metric |
|---|---|---|
| Visual understanding | Ảnh chụp màn hình, hóa đơn, biểu đồ và trang UI | Độ chính xác và chất lượng bằng chứng |
| Visual coding | Mockup-to-component, screenshot-to-frontend, và tái dựng SVG | Output có thể chạy và thời gian chỉnh sửa |
| Long context dưới 256K | Chính sách, kho mã và tập tài liệu | Độ chính xác, độ trễ và tỷ lệ cache hit |
| Over-256K stress | Tác vụ với 300K–600K token đầu vào | Chất lượng thu được so với chi phí bậc bổ sung |
| Search-grounded QA | Sự kiện hiện tại và nghiên cứu sản phẩm | Số lần gọi tìm kiếm, token truy xuất và độ chính xác có căn cứ |
| Agent workflow | Nhiệm vụ lập trình nhiều bước hoặc duyệt web | Tỷ lệ tác vụ giải quyết, retry, độ trễ và tổng chi phí |
Với mỗi tác vụ, ghi lại:
- Token đầu vào
- Token đầu ra
- Thinking tokens
- Token đã cache
- Token tạo cache
- Số lần gọi tìm kiếm
- Token nội dung được truy xuất
- Độ trễ
- Số lần retry
- Kết quả tác vụ cuối cùng
CometAPI Cookbook bao gồm thêm các ví dụ tích hợp và định tuyến model cho kiểu đánh giá này.
FAQ
How Much Does the Qwen3.7 Plus API Cost?
Tuyến US-local qwen3.7-plus-us của Alibaba có giá $0.40 cho mỗi 1M token đầu vào và $1.60 cho mỗi 1M token đầu ra cho các yêu cầu có tối đa 256K token đầu vào.
Với các yêu cầu trên 256K và tối đa 1M, giá tăng lên $1.20 cho mỗi 1M token đầu vào và $4.80 cho mỗi 1M token đầu ra.
Tuyến Global của Alibaba có mức giá niêm yết thấp nhất trong so sánh này. Model cũng có sẵn qua CometAPI với mức $0.32 cho mỗi 1M token đầu vào và $1.28 cho mỗi 1M token đầu ra.
How Are Long-Context Requests Priced Through CometAPI?
Danh sách Qwen3.7 Plus hiển thị một mức giá $0.32/M đầu vào và $1.28/M đầu ra, nhưng hiện không nêu rõ liệu có bậc riêng áp dụng trên 256K token hay không.
Ở mức giá hiển thị**, một yêu cầu với 400K token đầu vào và 20K token đầu ra sẽ tốn $0.1536**. Hãy coi đây là ước tính cho đến khi chính sách tính cước long-context được xác nhận.
Is Qwen3.7 Plus Available in the US?
Có. Alibaba liệt kê một model ID US-local gọi là qwen3.7-plus-us tại khu vực US (Virginia).
Alibaba cũng liệt kê tuyến Global qwen3.7-plus trong cùng phần giá khu vực.
Chọn tuyến dựa trên:
- Yêu cầu triển khai
- Nơi xử lý dữ liệu
- Hỗ trợ công cụ
- Độ trễ
- Tính sẵn sàng
- Giá hiệu dụng
Why Does Qwen3.7 Plus Pricing Jump After 256K Tokens?
Alibaba chọn bậc giá dựa trên tổng số token đầu vào trong một yêu cầu.
Khi yêu cầu vượt 256K token đầu vào, tất cả token đầu vào và đầu ra được tính cước trong yêu cầu đó sử dụng mức giá cho bậc cao hơn.
Giá không được tính lũy tiến.
Does Context Cache Reduce Qwen3.7 Plus Costs?
Có.
Alibaba cho biết explicit cache hit được tính 10% mức giá đầu vào bình thường, trong khi implicit cache hit được tính 20%.
Việc tạo explicit cache tốn 125% giá đầu vào bình thường, và cache có hiệu lực trong năm phút với bộ đếm thời gian đặt lại sau mỗi lần hit thành công.
Trong so sánh lý tưởng với các implicit-cache hit lặp lại, explicit cache trở nên rẻ hơn sau một lần tạo và ba lần tái sử dụng thành công.
How Does Qwen Web Search Pricing Work?
Web Search thêm hai chi phí:
- Nội dung web truy xuất làm tăng lượng token đầu vào bình thường.
- Công cụ tìm kiếm có một khoản phí riêng theo mỗi 1,000 lần gọi.
Mức giá hiện được ghi nhận là:
- $0.573411 cho mỗi 1,000 lần gọi đối với phạm vi Global và Chinese-mainland
- $10 cho mỗi 1,000 lần gọi đối với phạm vi International
Does Qwen3.7 Plus Support the Batch API?
Model chính xác qwen3.7-plus hiện được liệt kê cho Batch dưới China (Beijing), nơi các token thành công được tính ở mức 50% giá suy luận thời gian thực và context được giới hạn ở 256K.
Tài liệu hiện không liệt kê tuyến US-local qwen3.7-plus-us cho Batch.
Đừng cho rằng chiết khấu Batch áp dụng cho các triển khai US-local hoặc Global nếu chưa kiểm tra khả dụng trong bảng điều khiển hiện tại.
Is Qwen3.7 Plus Cheaper Than Qwen3.7 Max?
Có, dựa trên các mức giá được sử dụng trong so sánh này.
Qwen3.7 Plus được niêm yết ở:
- $0.32 cho mỗi 1M token đầu vào
- $1.28 cho mỗi 1M token đầu ra
Qwen3.7 Max được niêm yết ở:
- $1.36 cho mỗi 1M token đầu vào
- $4.08 cho mỗi 1M token đầu ra
Tuy nhiên, Max vẫn có thể kinh tế hơn cho các tác vụ agent nặng văn bản nếu hoàn thành với ít lần retry hơn.
Should I Use Alibaba Directly or an API Aggregator?
Truy cập trực tiếp Alibaba là lựa chọn rõ ràng hơn khi khối lượng công việc phụ thuộc vào một phạm vi triển khai cụ thể, tính năng gốc của nhà cung cấp, kiểm soát theo khu vực hoặc quan hệ thanh toán trực tiếp.
Một lớp tổng hợp có thể thực tiễn hơn khi cùng một ứng dụng cần kiểm thử hoặc định tuyến qua nhiều họ model. Ví dụ, CometAPI cung cấp Qwen3.7 Plus cùng với các model từ OpenAI, Anthropic, Google, Moonshot và DeepSeek qua giao diện tương thích OpenAI.
Tuyến tốt hơn phụ thuộc vào yêu cầu khu vực, chi phí hiệu dụng, công sức tích hợp, nhu cầu fallback và việc có cần tính năng gốc của Alibaba hay không.
Run a Production-Style Comparison Before Choosing a Route
Mức giá theo token đã công bố hữu ích để thu hẹp lựa chọn, nhưng quyết định cuối cùng nên xuất phát từ một khối lượng công việc giống sản xuất.
Một cách thực tiễn là chạy cùng bộ đánh giá qua Qwen3.7 Plus, Qwen3.7 Max và một vài lựa chọn thay thế phù hợp. Một dịch vụ API hợp nhất như CometAPI có thể đơn giản hóa phép so sánh này bằng cách cung cấp các model Qwen, Claude, Gemini, GPT, Kimi và DeepSeek qua cùng giao diện tương thích OpenAI.
Trong quá trình thử nghiệm, ghi lại:
- Token đầu vào và đầu ra
- Việc sử dụng thinking-token
- Việc sử dụng cache
- Số lần gọi công cụ
- Retry
- Độ trễ
- Tác vụ thành công
Sử dụng Qwen3.7 Plus model page làm điểm khởi đầu, sau đó chọn tuyến có chi phí thấp nhất trên mỗi tác vụ hoàn thành—không đơn thuần là mức giá token quảng cáo thấp nhất.
