TL;DR Qwen 3.8 Max มีค่าใช้จ่าย $2 ต่อ 1 ล้านโทเคนอินพุต และ $6 ต่อ 1 ล้านโทเคนเอาต์พุต บน QwenCloud อัตราแคชแบบจำเพาะสำหรับโมเดลคือ $0.25/M สำหรับอินพุตที่ถูกแคชโดยปริยาย, $2.50/M สำหรับการสร้างแคชแบบระบุชัด, และ $0.17/M สำหรับการอ่านแคชแบบระบุชัด
อัตราโทเคนมาตรฐานเดียวกันถูกใช้ทั่วทั้งหน้าต่างบริบทขนาด 1M โทเคน ที่โมเดลรองรับ พรอมป์ต์ที่ใหญ่ขึ้นมีค่าใช้จ่ายมากขึ้นเพราะมีจำนวนโทเคนมากกว่า ไม่ใช่เพราะเข้าสู่ระดับราคาบริบทยาวที่สูงกว่า
ที่ราคาปกติ Qwen 3.8 Max ถูกกว่า 20% เมื่อเทียบกับ Qwen 3.7 Max อย่างไรก็ตาม Qwen 3.7 Max ถูกกว่าในขณะที่โปรโมชัน 50% ปัจจุบันยังคงเปิดใช้งาน ตัวเลือกสำหรับผลิตจริงที่ดีกว่าขึ้นอยู่กับ ต้นทุนต่อภารกิจที่ผ่านการยอมรับ ซึ่งรวมถึงการให้เหตุผล การตีแคช เครื่องมือ การลองใหม่ ความหน่วง และการทบทวนโดยมนุษย์
ภาพรวมราคา API ของ Qwen 3.8 Max
| รายการ | ค่าทางการปัจจุบัน |
|---|---|
| รหัสโมเดลสำหรับผลิตจริง | qwen3.8-max |
| วันที่เปิดตัวอย่างเป็นทางการ | 3 สิงหาคม 2026 |
| สถาปัตยกรรม | 2.4T พารามิเตอร์ทั้งหมด; 95B พารามิเตอร์ที่ใช้งาน |
| ราคามาตรฐานต่ออินพุต | $2 / 1M โทเคน |
| ราคามาตรฐานต่อเอาต์พุต | $6 / 1M โทเคน |
| อินพุตที่แคชโดยปริยาย | $0.25 / 1M โทเคน |
| การสร้างแคชแบบระบุชัด | $2.50 / 1M โทเคน |
| การอ่านแคชแบบระบุชัด | $0.17 / 1M โทเคน |
| หน้าต่างบริบท | 1M โทเคน |
| อินพุตสูงสุด | 991K โดยไม่เปิดการให้เหตุผล; 983K เมื่อเปิดการให้เหตุผล |
| เอาต์พุตสูงสุด | 131K |
| โทเคนการให้เหตุผลสูงสุด | 262K |
| รูปแบบอินพุต | ข้อความ ภาพ และวิดีโอ |
| รูปแบบเอาต์พุต | ข้อความ |
| ขีดจำกัดอ้างอิงของ QwenCloud | 2M TPM และ 15K RPM |
หน้ารุ่น QwenCloud เป็นแหล่งที่ตรงที่สุดสำหรับรหัสโมเดลปัจจุบัน ราคาค่าใช้จ่าย แคช ขีดจำกัดบริบท และรูปแบบอินพุต/เอาต์พุต โควตาที่เฉพาะบัญชีและภูมิภาคอาจแตกต่างกัน ดังนั้นให้ใช้ขีดจำกัดที่แสดงในคอนโซลของคุณเองเมื่อกำหนดค่าความขนานสำหรับผลิตจริง
รุ่นผลิตจริงยังแทนที่ตัวระบุรุ่นพรีวิวด้วย qwen3.8-max และเพิ่มตารางอัตราเฉพาะโมเดลที่สมบูรณ์ วัสดุเปิดตัวของ Qwen อธิบายการตั้งค่าความพยายามด้านการให้เหตุผล low, medium, และ xhigh แต่ควรตรวจสอบพฤติกรรมสำหรับผลิตจริงเทียบกับเอนด์พอยต์และเอกสารอ้างอิง API ที่คุณใช้งานจริง
หมายเหตุที่ไวต่อเวลา: Qwen ประกาศว่าจะปล่อย weight แบบเปิดต่อจากการเปิด API ณ วันที่ 4 สิงหาคม 2026 อย่าอธิบาย Qwen 3.8 Max ว่าสามารถดาวน์โหลดหรือโฮสต์เองได้จนกว่าจะมีเช็คพอยต์และไลเซนส์อย่างเป็นทางการเผยแพร่ออกมา
วิธีการคิดราคา Qwen 3.8 Max
ขณะนี้ QwenCloud แสดงอัตรามาตรฐานคงที่ $2 ต่อ 1M โทเคนอินพุต และ $6 ต่อ 1M โทเคนเอาต์พุต ทั่วหน้าต่างบริบทขนาด 1M โทเคนที่ Qwen 3.8 Max รองรับ สแน็ปราคาอย่างเป็นทางการด้านล่างถูกบันทึกเมื่อวันที่ 4 สิงหาคม 2026; ตรวจสอบหน้ารุ่นสดเสมอก่อนตัดสินใจงบประมาณสำหรับผลิตจริง

แหล่งที่มา: QwenCloud, “Qwen3.8-Max” official
| รายการการเรียกเก็บเงิน | ราคา/1M โทเคน | เมื่อถูกนำไปใช้ |
|---|---|---|
| อินพุตมาตรฐาน | $2.00 | เนื้อหาพรอมป์ต์ใหม่ คำอธิบายเครื่องมือ และบริบทที่ไม่ถูกแคช |
| เอาต์พุตมาตรฐาน | $6.00 | เอาต์พุตที่สร้างและโทเคนการให้เหตุผลที่มีการเรียกเก็บเงิน |
| การตีแคชโดยปริยาย | $0.25 | พรอมป์ต์พรีฟิกซ์ที่ถูกนำมาใช้ซ้ำโดยอัตโนมัติ; ไม่รับประกันการตี |
| การสร้างแคชแบบระบุชัด | $2.50 | การสร้างพรีฟิกซ์พรอมป์ต์ที่ทำเครื่องหมายสำหรับนำกลับมาใช้ |
| การอ่านแคชแบบระบุชัด | $0.17 | การนำบล็อกแคชแบบระบุชัดที่ยังใช้ได้กลับมาใช้ |
ดังนั้นคำขอ 900K โทเคนจึงมีค่าใช้จ่ายมากกว่าคำขอ 100K โทเคน เพราะประมวลผลโทเคนอินพุตมากกว่าเก้าเท่า ไม่ใช่เพราะข้ามไปยังระดับราคาที่สูงกว่า
การให้เหตุผลอาจเพิ่มค่าใช้จ่ายของเอาต์พุต
คำตอบที่มองเห็นได้สั้นไม่ใช่คำตอบที่มีต้นทุนต่ำเสมอไป การเรียกที่เปิดการให้เหตุผลอาจสร้างโทเคนการให้เหตุผลเพิ่มเติม ดังนั้นประมาณการสำหรับผลิตจริงควรใช้ฟิลด์การใช้งานที่เอ็นด์พอยต์ส่งกลับ ไม่ใช่ความยาวคำตอบที่มองเห็น
เมื่อเอนด์พอยต์ของคุณรองรับการควบคุมการให้เหตุผลสำหรับ qwen3.8-max ให้เปรียบเทียบการตั้งค่าที่มีอยู่บนชุดประเมินเดียวกัน อย่าคิดว่าค่าดีฟอลต์ของพรีวิวจะคงอยู่ในโมเดล GA
การประหยัดจากแคชขึ้นอยู่กับความคงที่ของพรอมป์ต์
หน้ารุ่นของ Qwen 3.8 Max เผยแพร่อัตราแคชเฉพาะโมเดล ใช้อัตราเหล่านั้น—ไม่ใช่อัตราส่วนแคชทั่วไป—เมื่อประมาณการค่าใช้จ่าย
รายการแคชแบบระบุชัดมีระยะเวลาความใช้ได้ห้านาที และการตีที่สำเร็จจะรีเซ็ตระยะเวลานั้น การแคชโดยปริยายทำงานอัตโนมัติ แต่ไม่รับประกันการตี แคชมีประโยชน์ที่สุดเมื่อพรอมป์ต์ระบบ คำอธิบายเครื่องมือ บริบทของรีโพ หรือเอกสารขนาดใหญ่คงที่ระหว่างการเรียกซ้ำบ่อย ๆ
เครื่องมือในตัวมีค่าใช้จ่ายแยกต่างหาก
ขณะนี้ QwenCloud แสดงค่าธรรมเนียมเครื่องมือดังต่อไปนี้เพิ่มเติมจากการใช้โทเคน:
| เครื่องมือในตัว | ค่าธรรมเนียมปัจจุบัน |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | Free for a limited time |
| Code Interpreter | Free for a limited time |
Function calling และ MCP ไม่มีค่าธรรมเนียมเครื่องมือแยกต่างหาก แต่คำอธิบายเครื่องมือยังคงนับเป็นโทเคนอินพุต โปรโมชันเครื่องมือฟรีอาจเปลี่ยนแปลงได้ ดังนั้นควรตรวจสอบ คู่มือราคา QwenCloud ก่อนสรุปงบประมาณสำหรับผลิตจริง
ตัวอย่างเช่น คำขอที่มีโทเคนอินพุต 20K โทเคนเอาต์พุต 2K และการเรียก Web Search สองครั้ง มีค่าใช้จ่ายโดยประมาณ:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
ในตัวอย่างนี้ การเรียกค้นหาสองครั้งคิดเป็นประมาณ 27.8% ของค่าใช้จ่ายคำขอทั้งหมด
ตัวอย่างต้นทุนจริงของ Qwen 3.8 Max
ตัวอย่างเหล่านี้ใช้อัตราเฉพาะโมเดลของ QwenCloud ปัจจุบัน ไม่รวมภาษี การลองใหม่ การใช้เส้นทางสำรอง และการบวกเพิ่มเฉพาะผู้ให้บริการ
ตัวอย่างที่ 1: คำขอเอเจนต์ระดับกลาง
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
ความพยายามครั้งแรกที่สำเร็จมีค่าใช้จ่ายประมาณ $0.13 การลองใหม่เต็มครั้งหนึ่งจะเพิ่มต้นทุนโมเดลขึ้นเป็นประมาณ $0.26
ตัวอย่างที่ 2: การวิเคราะห์เอกสารยาว
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
โมเดลไม่คิดค่าธรรมเนียมบริบทยาวแยกต่างหากบนตารางอัตราปัจจุบัน แต่พรอมป์ต์ใหญ่ยังสร้างค่าใช้จ่ายเชิงปริมาณที่สูง
ตัวอย่างที่ 3: เซสชันเอเจนต์ที่มีแคช
สมมติพรีฟิกซ์ที่นำกลับมาใช้ได้ขนาด 100K โทเคน อินพุตใหม่ 10K โทเคน เอาต์พุต 5K โทเคน และ 50 ครั้งในขณะที่แคชแบบระบุชัดยังคงใช้ได้:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
ประหยัดโดยประมาณ = $8.917 หรือ 71.3%
การประหยัดโดยประมาณขึ้นอยู่กับการตีแคชที่สำเร็จและพรีฟิกซ์ที่คงที่ ช่องว่างที่ยาวหรือการเปลี่ยนแปลงพรอมป์ต์ระบบและสคีมาเครื่องมือบ่อย ๆ จะลดประโยชน์ลง
Qwen 3.8 Max เทียบกับ Qwen 3.7 Max: การเปรียบเทียบราคา
Qwen 3.8 Max ถูกกว่า Qwen 3.7 Max 20% ที่ราคาปกติ แต่ Qwen 3.7 Max ถูกกว่า 37.5% ในขณะที่โปรโมชัน 50% ปัจจุบันยังคงเปิดใช้งาน
| สถานะรุ่นและราคา | อินพุต / 1M | เอาต์พุต / 1M | บริบท |
|---|---|---|---|
| qwen3.8-max ราคามาตรฐาน | $2.00 | $6.00 | 1M |
| qwen3.7-max ราคาปกติ | $2.50 | $7.50 | 1M |
| qwen3.7-max โปรโมชันปัจจุบัน | $1.25 | $3.75 | 1M |
เก็บ หน้ารุ่น Qwen3.7 Max บน CometAPI ไว้เป็นทางเลือกสำรองในขณะที่ทดสอบโมเดลใหม่
ราคาต่อโทเคนเป็นเพียงส่วนหนึ่งของการตัดสินใจ Qwen 3.8 Max ยังอาจประหยัดกว่าได้หากเพิ่มอัตราสำเร็จครั้งแรก ใช้เครื่องมือได้เชื่อถือมากขึ้น ลดการลองใหม่ หรือใช้การแก้โดยมนุษย์น้อยลง
ใช้เมตริกสำหรับผลิตจริงนี้:
ต้นทุนต่อภารกิจที่ผ่านการยอมรับ =
(โทเคนของโมเดล + การเรียกเครื่องมือ + การลองใหม่ + ค่าใช้จ่ายเส้นทางสำรอง + ต้นทุนการทบทวน)
÷ จำนวนเอาต์พุตที่ได้รับการยอมรับ
ผลชนะตามเบนช์มาร์กที่รายงานโดยผู้ขายเป็นเหตุผลให้ทดสอบใหม่กับเวิร์กโฟลว์ที่ต้องการทางด้านโค้ดและมืออาชีพ ไม่ใช่หลักฐานว่าทุกเวิร์กโหลดของ Qwen 3.7 ควรมาย้าย
วิธีการย้ายไปยัง Qwen 3.8 Max
การเปลี่ยนสตริงโมเดลเป็นสิ่งจำเป็น แต่ไม่ใช่การย้ายสำหรับผลิตจริงที่สมบูรณ์
1. ทดสอบรหัสโมเดลสำหรับผลิตจริง
แทนที่ตัวระบุพรีวิวด้วย qwen3.8-max ในสภาพแวดล้อมทดสอบ อย่าคิดว่าชื่อแฝงพรีวิว ค่าดีฟอลต์ ความหน่วง หรือพฤติกรรมการตอบจะยังคงเหมือนเดิม
คำขอแบบ OpenAI-compatible ขั้นต่ำอาจมีลักษณะดังนี้:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
เริ่มด้วยคำขอขั้นต่ำตามเอกสาร เพิ่มการควบคุมการให้เหตุผลเฉพาะเมื่อเอกสารอ้างอิง API ปัจจุบันสำหรับเอนด์พอยต์ของคุณรองรับอย่างชัดเจน
2. ตั้งฐานใหม่สำหรับเทเลเมทรีด้านต้นทุนและประสิทธิภาพ
บันทึกอย่างน้อย:
- โทเคนอินพุต เอาต์พุต และการให้เหตุผล
- การตีแคชและโทเคนการสร้างแคช
- เวลาไปยังโทเคนแรกและความหน่วงรวม
- การเรียกเครื่องมือ การลองใหม่ และเส้นทางสำรอง
- เอาต์พุตที่ยอมรับเทียบกับที่ปฏิเสธ
- เวลาการแก้ไขโดยมนุษย์
3. ทดสอบอินเทอร์เฟซที่แอปพลิเคชันของคุณใช้ใหม่
ตรวจสอบอีเวนต์สตรีมมิง เพย์โหลดแบบหลายโมดอล สคีมาเครื่องมือ เอาต์พุตแบบมีโครงสร้าง เหตุผลการสิ้นสุด ฟิลด์การใช้งาน การจัดการข้อผิดพลาด และพฤติกรรมหลายรอบ หน้ารุ่นสำหรับผลิตจริงระบุการเข้าถึงผ่าน DashScope และ OpenAI-compatible; ตรวจสอบเลเยอร์ความเข้ากันได้เพิ่มเติมก่อนพึ่งพามัน
4. เคารพขีดจำกัดบริบทในทางปฏิบัติ
หน้าต่างบริบท 1M ไม่เหมือนกับพรอมป์ต์ผู้ใช้ 1M โทเคน QwenCloud แสดงอินพุตสูงสุด 991K โดยไม่เปิดการให้เหตุผล และ 983K เมื่อเปิดการให้เหตุผล เพิ่มระยะเผื่อเพื่อให้คำขอยังมีพื้นที่สำหรับเอาต์พุตและการให้เหตุผล
5. รัน Qwen 3.7 และ Qwen 3.8 ควบคู่กัน
ใช้พรอมป์ต์ เครื่องมือ ตัวตรวจสอบ กฎการลองใหม่ และชุดข้อมูลที่เหมือนกัน เปรียบเทียบต้นทุนต่อภารกิจที่ผ่านการยอมรับและความหน่วง แทนที่จะตัดสินคำตอบเดี่ยว ๆ ด้วยสายตา
วิธีประเมินและกำหนดเส้นทาง Qwen 3.8 Max
ใช้เวิร์กโหลดจริงแทนค่าเฉลี่ยเบนช์มาร์กกว้าง ๆ
| เวิร์กโหลด | งานที่แนะนำ | สัญญาณการยอมรับหลัก |
|---|---|---|
| การเขียนโค้ดกับรีโพสิทอรี | 4 | ผ่านการทดสอบโดยไม่ต้องแก้ด้วยมนุษย์ |
| การวิเคราะห์เอกสารยาว | 3 | ข้ออ้างได้รับการสนับสนุนโดยหลักฐานที่ให้มา |
| การวิเคราะห์หลายโมดอล | 2 | รายละเอียดภาพหรือวิดีโอที่เกี่ยวข้องถูกใช้อย่างถูกต้อง |
| เอเจนต์ที่ใช้เครื่องมือ | 3 | เลือกเครื่องมือถูกต้องและอาร์กิวเมนต์ถูกต้อง |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
ใช้ Qwen 3.8 Max สำหรับงานรีโพที่ยาก เอเจนต์ระยะยาว การวิเคราะห์หลายโมดอล และเวิร์กโฟลว์ที่ Qwen 3.7 ไม่ผ่านการยอมรับ เก็บ Qwen 3.7 Max ไว้เมื่อโปรโมชันช่วยลดต้นทุนอย่างมีนัยสำคัญและโมเดลที่ใช้อยู่แล้วผ่านเป้าหมายคุณภาพของคุณ
ตรวจสอบ หน้าราคา CometAPI และข้อมูลการกำหนดเส้นทางสดก่อนล็อกเกณฑ์ เพราะความพร้อมของผู้ให้บริการและราคาที่ถูกจัดเส้นทางอาจเปลี่ยนแปลงได้โดยอิสระจากราคาปกติโดยตรงของ QwenCloud CometAPI Cookbook สามารถช่วยคุณสร้างคำขอที่ทำซ้ำได้และฮาร์เนสประเมินที่สอดคล้องกัน
คำถามที่พบบ่อย
Qwen 3.8 Max API มีค่าใช้จ่ายเท่าไร?
ขณะนี้ QwenCloud แสดง Qwen 3.8 Max ที่ $2 ต่อ 1 ล้านโทเคนอินพุต และ $6 ต่อ 1 ล้านโทเคนเอาต์พุต การใช้แคชและเครื่องมือในตัวมีอัตราแยกต่างหาก
Qwen 3.8 Max มีค่าใช้จ่ายมากขึ้นเมื่อเกิน 128K โทเคนหรือไม่?
ไม่มีระดับบริบทยาวแยกต่างหากแสดงบนตารางอัตราเฉพาะโมเดลปัจจุบัน คำขอยาวมีค่าใช้จ่ายมากขึ้นเพราะมีโทเคนมากขึ้น ไม่ใช่เพราะข้ามไปยังระดับราคาต่อหน่วยที่สูงกว่า
โทเคนการให้เหตุผลของ Qwen 3.8 Max ถูกเรียกเก็บเงินหรือไม่?
การให้เหตุผลอาจเพิ่มการใช้งานที่สร้างและต้นทุนรวม ใช้ฟิลด์โทเคนการให้เหตุผลและเอาต์พุตที่เอ็นด์พอยต์ส่งกลับ แทนการประมาณจากคำตอบที่มองเห็น
Qwen 3.8 Max เป็นโอเพ่นซอร์สหรือไม่?
Qwen ประกาศว่า weight แบบเปิดจะตามหลังการปล่อย API อย่าอธิบายโมเดลว่าสามารถดาวน์โหลดหรือโฮสต์เองได้จนกว่าจะมีเช็คพอยต์และไลเซนส์อย่างเป็นทางการ
ผู้ใช้ Qwen 3.7 Max ควรย้ายทันทีหรือไม่?
ไม่โดยอัตโนมัติ Qwen 3.8 Max มีราคามาตรฐานที่ต่ำกว่า ในขณะที่ Qwen 3.7 Max ถูกกว่าระหว่างโปรโมชันปัจจุบัน ย้ายเมื่อข้อมูลคุณภาพ ความหน่วง พฤติกรรมแคช และต้นทุนต่อภารกิจที่ผ่านการยอมรับของคุณสนับสนุนการเปลี่ยน
ทดสอบ Qwen 3.8 Max ด้วย CometAPI
ใช้ CometAPI Quickstart เพื่อตั้งค่าไคลเอนต์ที่เข้ากันได้กับ OpenAI ก่อนส่งทราฟฟิกสำหรับผลิตจริง ยืนยันว่า qwen3.8-max เปิดใช้งานในบัญชีของคุณและตรวจสอบราคาที่ถูกจัดเส้นทางซึ่งแสดงอยู่ที่นั่น
เปรียบเทียบกับฐาน Qwen 3.7 ของคุณโดยใช้พรอมป์ต์ ตัวตรวจสอบ นโยบายการลองใหม่ และเทเลเมทรีที่เหมือนกัน สิ่งนี้ช่วยให้การประเมินเน้นไปที่โมเดลแทนการเปลี่ยนแปลงในฮาร์เนสทดสอบ
