ราคาสำหรับ Qwen 3.8 Max API: อินพุต $2 เอาต์พุต $6 หน้าต่างบริบท 1M
TL;DR
Qwen 3.8 Max มีค่าใช้จ่ายที่ QwenCloud เท่ากับ $2 ต่อโทเค็นอินพุต 1 ล้าน และ $6 ต่อโทเค็นเอาต์พุต 1 ล้าน อัตราแคชเฉพาะรุ่นคือ $0.25/ล้าน สำหรับอินพุตที่ถูกแคชโดยอัตโนมัติ (implicit), $2.50/ล้าน สำหรับการสร้างแคชแบบชัดแจ้ง (explicit) และ $0.17/ล้าน สำหรับการอ่านแคชแบบชัดแจ้ง
อัตราโทเค็นมาตรฐานเดียวกันใช้กับหน้าต่างบริบท 1M โทเค็น ที่รองรับของโมเดล ข้อความนำเข้าที่ใหญ่ขึ้นมีค่าใช้จ่ายมากขึ้นเพราะมีโทเค็นมากกว่า ไม่ใช่เพราะเข้าสู่ระดับราคาบริบทยาวที่สูงกว่า
ที่ราคาปกติ (list price) Qwen 3.8 Max ถูกกว่า Qwen 3.7 Max 20% อย่างไรก็ตาม Qwen 3.7 Max ยังถูกกว่าในช่วงโปรโมชั่น 50% ที่ใช้งานอยู่ในปัจจุบัน ทางเลือกที่เหมาะสมสำหรับงานผลิตจริงขึ้นอยู่กับ ต้นทุนต่อภารกิจที่ผ่านการยอมรับ ซึ่งรวมการให้เหตุผล แคชที่ฮิต เครื่องมือ การลองใหม่ ความหน่วงเวลา และการตรวจทานโดยมนุษย์
ภาพรวมราคา Qwen 3.8 Max API
| รายการ | ค่าทางการปัจจุบัน |
|---|---|
| Production model ID | qwen3.8-max |
| Official release date | August 3, 2026 |
| Architecture | พารามิเตอร์รวม 2.4T; พารามิเตอร์ที่ใช้งาน 95B |
| Standard input price | $2 / 1M tokens |
| Standard output price | $6 / 1M tokens |
| Implicit cached input | $0.25 / 1M tokens |
| Explicit cache creation | $2.50 / 1M tokens |
| Explicit cache read | $0.17 / 1M tokens |
| Context window | 1M tokens |
| Maximum input | 991K โดยไม่มีการให้เหตุผล; 983K พร้อมการให้เหตุผล |
| Maximum output | 131K |
| Maximum reasoning | 262K |
| Input modalities | ข้อความ รูปภาพ และวิดีโอ |
| Output modality | ข้อความ |
| QwenCloud reference limits | 2M TPM และ 15K RPM |
หน้าโมเดล QwenCloud เป็นแหล่งข้อมูลโดยตรงที่สุดสำหรับ Model ID ปัจจุบัน ราคา อัตราแคช ขีดจำกัดบริบท และรูปแบบสื่อ ขีดจำกัดตามบัญชีและภูมิภาคอาจแตกต่างกัน ดังนั้นโปรดใช้ขีดจำกัดที่แสดงในคอนโซลของคุณเองเมื่อกำหนดค่าความขนานในงานผลิตจริง
รุ่นผลิตจริงยังแทนที่ตัวระบุแบบพรีวิวด้วย qwen3.8-max และเพิ่มอัตราราคาตามรุ่นแบบสมบูรณ์ เอกสารเปิดตัวของ Qwen กล่าวถึงการตั้งค่าความพยายามในการให้เหตุผล low, medium และ xhigh แต่ควรยืนยันพฤติกรรมในงานผลิตจริงกับเอนด์พอยต์และเอกสารอ้างอิง API ที่คุณใช้งานจริง
หมายเหตุสำคัญตามเวลา: Qwen ประกาศว่าจะเผยแพร่น้ำหนักโมเดลแบบเปิดตามหลังการปล่อย API ณ วันที่ August 4, 2026 อย่าอธิบาย Qwen 3.8 Max ว่าสามารถดาวน์โหลดหรือโฮสต์เองได้จนกว่าจะมีการเผยแพร่เช็คพอยต์และไลเซนส์อย่างเป็นทางการ
วิธีคิดค่าบริการของ Qwen 3.8 Max
QwenCloud ปัจจุบันแสดงอัตรามาตรฐานคงที่ $2 ต่อโทเค็นอินพุต 1M และ $6 ต่อโทเค็นเอาต์พุต 1M ตลอดหน้าต่างบริบท 1M โทเค็นที่ Qwen 3.8 Max รองรับ ภาพรวมราคาอย่างเป็นทางการด้านล่างถูกจับเมื่อ August 4, 2026; โปรดตรวจสอบหน้าโมเดลแบบสดทุกครั้งก่อนตัดสินใจงบประมาณในงานผลิตจริง

แหล่งที่มา***:*** QwenCloud, “Qwen3.8-Max” official
| รายการคิดเงิน | ราคา/โทเค็น 1M | ใช้เมื่อใด |
|---|---|---|
| Standard input | $2.00 | เนื้อหาพรอมป์ใหม่ คำอธิบายเครื่องมือ และบริบทที่ไม่ได้แคช |
| Standard output | $6.00 | เอาต์พุตที่สร้างขึ้นและการใช้งานโทเค็นสำหรับการให้เหตุผลที่ถูกคิดเงิน |
| Implicit cache hit | $0.25 | การใช้งานซ้ำคำนำของพรอมป์โดยอัตโนมัติ; ไม่การันตีว่าจะฮิตทุกครั้ง |
| Explicit cache creation | $2.50 | การสร้างคำนำของพรอมป์ที่ทำเครื่องหมายให้ใช้งานซ้ำได้ |
| Explicit cache read | $0.17 | การใช้งานซ้ำบล็อกแคชแบบชัดแจ้งที่ยังใช้ได้ |
ดังนั้นคำขอ 900K โทเค็นจึงมีค่าใช้จ่ายมากกว่าคำขอ 100K โทเค็น เพราะประมวลผลโทเค็นอินพุตมากกว่าถึงเก้าเท่า ไม่ใช่เพราะเข้าสู่ระดับราคาที่สูงขึ้น
การให้เหตุผลสามารถเพิ่มค่าใช้จ่ายเอาต์พุต
คำตอบที่มองเห็นสั้น ไม่ได้แปลว่าต้นทุนต่ำเสมอไป การเรียกที่เปิดใช้งานการให้เหตุผลอาจสร้างโทเค็นสำหรับการให้เหตุผลเพิ่มเติม ดังนั้นประมาณการในงานผลิตจริงควรใช้ฟิลด์การใช้งานที่ API ส่งกลับ แทนที่จะประเมินจากความยาวคำตอบที่มองเห็น
หากเอนด์พอยต์ของคุณรองรับการควบคุมการให้เหตุผลสำหรับ qwen3.8-max ให้เปรียบเทียบการตั้งค่าที่มีอยู่บนชุดประเมินเดียวกัน อย่าคิดว่าค่าเริ่มต้นของพรีวิวจะถูกรักษาไว้ในรุ่น GA
การประหยัดจากแคชขึ้นกับความนิ่งของพรอมป์
หน้าโมเดลของ Qwen 3.8 Max เผยแพร่อัตราแคชเฉพาะรุ่น ใช้อัตราเหล่านั้น—ไม่ใช่อัตราแคชโดยเฉลี่ยทั่วไป—เมื่อประมาณการค่าใช้จ่าย
เอนทรีแคชแบบชัดแจ้งมีอายุความถูกต้องห้านาที และการฮิตที่สำเร็จจะรีเซ็ตช่วงเวลานั้น แคชโดยอัตโนมัติจะทำงานเอง แต่ไม่การันตีว่าจะฮิต แคชมีประโยชน์ที่สุดเมื่อพรอมป์ระบบ คำอธิบายเครื่องมือ บริบทของรีโพซิทอรี หรือเอกสารขนาดใหญ่คงที่ตลอดการเรียกที่ถี่
เครื่องมือในตัวมีการคิดค่าบริการแยกต่างหาก
QwenCloud ปัจจุบันแสดงค่าธรรมเนียมสำหรับเครื่องมือดังต่อไปนี้ นอกเหนือจากการใช้งานโทเค็น:
| เครื่องมือในตัว | ค่าธรรมเนียมปัจจุบัน |
|---|---|
| Web Search | $10 / 1K calls |
| Image Search | $8 / 1K calls |
| Web Extractor | ฟรีช่วงเวลาจำกัด |
| Code Interpreter | ฟรีช่วงเวลาจำกัด |
การเรียกฟังก์ชัน (Function calling) และ MCP ไม่มีค่าธรรมเนียมเครื่องมือแยกต่างหาก แต่คำอธิบายเครื่องมือยังคงนับเป็นโทเค็นอินพุต โปรโมชันฟรีของเครื่องมืออาจเปลี่ยนแปลงได้ โปรดตรวจสอบ คู่มือราคา QwenCloud ก่อนทำงบประมาณงานผลิตจริง
ตัวอย่างเช่น คำขอที่มีอินพุต 20K โทเค็น เอาต์พุต 2K โทเค็น และเรียก Web Search สองครั้ง มีค่าใช้จ่ายโดยประมาณ:
Input: 20,000 / 1,000,000 × $2 = $0.040
Output: 2,000 / 1,000,000 × $6 = $0.012
Web Search: 2 / 1,000 × $10 = $0.020
Total: $0.072
ในตัวอย่างนี้ การค้นหาสองครั้งคิดเป็นประมาณ 27.8% ของค่าใช้จ่ายคำขอทั้งหมด
ตัวอย่างต้นทุนในโลกจริงของ Qwen 3.8 Max
ตัวอย่างเหล่านี้ใช้อัตราเฉพาะรุ่นของ QwenCloud ปัจจุบัน ไม่รวมภาษี การลองใหม่ โมเดลสำรอง และส่วนเพิ่มราคาจากผู้ให้บริการ
ตัวอย่างที่ 1: คำขอตัวแทนระดับกลาง
Assume 50K input tokens and 5K output tokens:
Input: 50,000 / 1,000,000 × $2 = $0.10
Output: 5,000 / 1,000,000 × $6 = $0.03
Total: $0.13
ความพยายามครั้งแรกที่สำเร็จมีค่าใช้จ่ายประมาณ $0.13 การลองใหม่เต็มรูปแบบหนึ่งครั้งจะเพิ่มค่าใช้จ่ายโมเดลเป็นประมาณ $0.26
ตัวอย่างที่ 2: การวิเคราะห์เอกสารยาว
Assume 800K input tokens and 20K output tokens:
Input: 800,000 / 1,000,000 × $2 = $1.60
Output: 20,000 / 1,000,000 × $6 = $0.12
Total: $1.72
โมเดลไม่มีค่าธรรมเนียมเพิ่มสำหรับบริบทยาวบนอัตราปัจจุบัน แต่พรอมป์ขนาดใหญ่ยังคงสร้างต้นทุนรวมที่มากขึ้น
ตัวอย่างที่ 3: เซสชันตัวแทนที่ใช้แคช
สมมุติคำนำที่ใช้งานซ้ำได้ 100K โทเค็น อินพุตใหม่ 10K โทเค็น เอาต์พุต 5K โทเค็น และ 50 คอล์ในขณะที่แคชแบบชัดแจ้งยังคงใช้ได้:
First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
First-call total = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M = $0.017
10K new input × $2/M = $0.020
5K output × $6/M = $0.030
Per-call total = $0.067
Cached session total = $3.583
Same 50 calls without cache = $12.500
การประหยัดโดยประมาณ = $8.917 หรือ 71.3%
การประหยัดที่ประมาณขึ้นกับการฮิตแคชที่สำเร็จและคำนำที่คงที่ ช่องว่างเวลานานหรือการเปลี่ยนแปลงบ่อยในพรอมป์ระบบและสคีม่าเครื่องมือจะลดประโยชน์ลง
Qwen 3.8 Max เทียบกับ Qwen 3.7 Max:เปรียบเทียบราคา
Qwen 3.8 Max ถูกกว่า Qwen 3.7 Max 20% ที่ราคาปกติ แต่ Qwen 3.7 Max ถูกกว่า 37.5% ขณะโปรโมชั่น 50% ปัจจุบันยังทำงานอยู่
| รุ่นและสถานะราคา | อินพุต / 1M | เอาต์พุต / 1M | บริบท |
|---|---|---|---|
| qwen3.8-max standard price | $2.00 | $6.00 | 1M |
| qwen3.7-max list price | $2.50 | $7.50 | 1M |
| qwen3.7-max current promotion | $1.25 | $3.75 | 1M |
เก็บหน้าโมเดล CometAPI Qwen3.7 Max ไว้เป็นแผนสำรองขณะทดสอบโมเดลใหม่
ราคาต่อโทเค็นเป็นเพียงส่วนหนึ่งของการตัดสินใจ Qwen 3.8 Max ยังอาจคุ้มค่ากว่า หากเพิ่มความสำเร็จตั้งแต่ครั้งแรก ใช้เครื่องมือได้เสถียรกว่า ลดการลองใหม่ หรือใช้เวลามนุษย์แก้น้อยลง
ใช้เมตริกสำหรับงานผลิตจริงนี้:
ต้นทุนต่อภารกิจที่ผ่านการยอมรับ =
(โทเค็นโมเดล + การเรียกเครื่องมือ + การลองใหม่ + ค่าใช้จ่ายโมเดลสำรอง + ค่าตรวจทาน)
÷ เอาต์พุตที่ผ่านการยอมรับ
ผลการทดสอบตามที่ผู้ขายรายงานเป็นเหตุผลที่ควรทดสอบงานโค้ดและเวิร์กโฟลว์ระดับมืออาชีพที่ยากอีกครั้ง ไม่ใช่หลักฐานว่าทุกงานของ Qwen 3.7 ควรย้ายทันที
วิธีการย้ายไปใช้ Qwen 3.8 Max
การเปลี่ยนสตริงโมเดลเป็นสิ่งจำเป็น แต่ไม่ใช่ทั้งหมดสำหรับการย้ายในงานผลิตจริง
1. ทดสอบ Production model ID
แทนที่ตัวระบุแบบพรีวิวด้วย qwen3.8-max ในสภาพแวดล้อมทดสอบ อย่าคิดว่าชื่อแฝง ค่าเริ่มต้น ความหน่วง หรือพฤติกรรมการตอบของพรีวิวจะคงเดิม
คำขอขั้นต่ำที่เข้ากันได้กับ OpenAI อาจเป็นดังนี้:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[
{
"role": "user",
"content": "Review this migration plan and identify production risks.",
}
],
)
print(response.choices[0].message.content)
เริ่มจากคำขอขั้นต่ำที่มีเอกสารกำกับ เพิ่มการควบคุมการให้เหตุผลก็ต่อเมื่อเอกสาร API ปัจจุบันสำหรับเอนด์พอยต์ของคุณรองรับอย่างชัดเจน
2. สร้างฐานอ้างอิงใหม่สำหรับเทเลเมทรีด้านต้นทุนและประสิทธิภาพ
บันทึกอย่างน้อย:
- โทเค็นอินพุต เอาต์พุต และการให้เหตุผล
- การฮิตแคชและโทเค็นสำหรับการสร้างแคช
- เวลาไปยังโทเค็นแรกและความหน่วงรวม
- การเรียกเครื่องมือ การลองใหม่ และโมเดลสำรอง
- เอาต์พุตที่ยอมรับเทียบกับที่ปฏิเสธ
- เวลาแก้ไขโดยมนุษย์
3. ทดสอบซ้ำอินเทอร์เฟซที่แอปของคุณใช้งาน
ตรวจสอบอีเวนต์แบบสตรีม เพย์โหลดแบบหลายสื่อ สคีม่าเครื่องมือ เอาต์พุตแบบมีโครงสร้าง เหตุผลการสิ้นสุด ฟิลด์การใช้งาน การจัดการข้อผิดพลาด และพฤติกรรมหลายบทสนทนา หน้าโมเดลผลิตจริงมีการเข้าถึงผ่าน DashScope และรูปแบบที่เข้ากันได้กับ OpenAI; ยืนยันเลเยอร์ความเข้ากันได้เพิ่มเติมก่อนพึ่งพา
4. เคารพขีดจำกัดบริบทเชิงปฏิบัติ
หน้าต่างบริบท 1M ไม่เหมือนกับพรอมป์ผู้ใช้ 1M โทเค็น QwenCloud แสดงขีดจำกัดอินพุตสูงสุด 991K โดยไม่มีการให้เหตุผล และ 983K เมื่อเปิดการให้เหตุผล เผื่อพื้นที่ปลอดภัยเพื่อให้คำขอยังมีที่ว่างสำหรับเอาต์พุตและการให้เหตุผล
5. รัน Qwen 3.7 และ Qwen 3.8 แบบขนาน
ใช้พรอมป์ เครื่องมือ ตัวตรวจสอบ กฎการลองใหม่ และชุดข้อมูลเหมือนกัน เปรียบเทียบต้นทุนต่อภารกิจที่ผ่านการยอมรับและความหน่วง แทนการตัดสินคำตอบเดี่ยวๆ ด้วยสายตา
วิธีประเมินและกำหนดเส้นทาง Qwen 3.8 Max
ใช้เวิร์กโหลดจริง แทนการอ้างค่าเฉลี่ยจากเบนช์มาร์กทั่วไป
| เวิร์กโหลด | งานที่แนะนำ | สัญญาณการยอมรับหลัก |
|---|---|---|
| การโค้ดบนรีโพซิทอรี | 4 | เทสต์ผ่านโดยไม่ต้องให้มนุษย์แก้ไขเพิ่มเติม |
| การวิเคราะห์เอกสารยาว | 3 | ข้ออ้างได้รับการสนับสนุนด้วยหลักฐานที่ให้มา |
| การวิเคราะห์หลายสื่อ | 2 | ใช้รายละเอียดจากรูปภาพหรือวิดีโออย่างถูกต้อง |
| ตัวแทนที่ใช้เครื่องมือ | 3 | เลือกเครื่องมือถูกต้องและอาร์กิวเมนต์ถูกต้อง |
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback
ใช้ Qwen 3.8 Max สำหรับงานรีโพซิทอรียากๆ ตัวแทนระยะยาว การวิเคราะห์หลายสื่อ และเวิร์กโฟลว์ที่ Qwen 3.7 ไม่ผ่านเกณฑ์ยอมรับ คงใช้ Qwen 3.7 Max เมื่อตัวโปรโมชันยังลดต้นทุนได้อย่างมีนัยสำคัญและโมเดลปัจจุบันบรรลุคุณภาพตามเป้าแล้ว
ตรวจสอบ หน้าราคา CometAPI และข้อมูลการกำหนดเส้นทางแบบสดก่อนล็อกเกณฑ์ เพราะความพร้อมใช้งานของผู้ให้บริการและราคาที่ถูกกำหนดเส้นทางอาจเปลี่ยนแยกจากราคาปกติของ QwenCloud ได้ CometAPI Cookbook ช่วยให้คุณสร้างคำขอที่ทำซ้ำได้และฮาร์เนสประเมินผลที่สม่ำเสมอ
คำถามที่พบบ่อย
Qwen 3.8 Max API มีค่าใช้จ่ายเท่าไร?
QwenCloud ปัจจุบันแสดงราคาของ Qwen 3.8 Max ที่ $2 ต่อโทเค็นอินพุต 1 ล้าน และ $6 ต่อโทเค็นเอาต์พุต 1 ล้าน การใช้แคชและเครื่องมือในตัวมีอัตราแยกต่างหาก
Qwen 3.8 Max มีค่าใช้จ่ายมากขึ้นเมื่อเกิน 128K โทเค็นหรือไม่?
ไม่มีระดับราคาบริบทยาวแยกต่างหากบนอัตราเฉพาะรุ่นปัจจุบัน คำขอยาวมีค่าใช้จ่ายมากขึ้นเพราะมีโทเค็นมากกว่า ไม่ใช่เพราะข้ามไปยังระดับราคาต่อหน่วยที่สูงกว่า
มีการคิดเงินโทเค็นสำหรับการให้เหตุผลของ Qwen 3.8 Max หรือไม่?
การให้เหตุผลสามารถเพิ่มการใช้งานโทเค็นที่สร้างและต้นทุนรวม ใช้ฟิลด์โทเค็นสำหรับการให้เหตุผลและเอาต์พุตที่เอนด์พอยต์ส่งกลับ แทนการประมาณจากคำตอบที่มองเห็น
Qwen 3.8 Max เป็นโอเพนซอร์สหรือไม่?
Qwen ประกาศว่าจะเผยแพร่น้ำหนักโมเดลแบบเปิดตามหลังการปล่อย API อย่าอธิบายว่าโมเดลสามารถดาวน์โหลดหรือโฮสต์เองได้ จนกว่าจะมีเช็คพอยต์และไลเซนส์อย่างเป็นทางการ
ผู้ใช้ Qwen 3.7 Max ควรย้ายทันทีหรือไม่?
ไม่โดยอัตโนมัติ Qwen 3.8 Max มีราคาปกติที่ต่ำกว่า ขณะที่ Qwen 3.7 Max ถูกกว่าระหว่างโปรโมชันปัจจุบัน ย้ายเมื่อข้อมูลของคุณเองด้านคุณภาพ ความหน่วง พฤติกรรมแคช และต้นทุนต่อภารกิจที่ผ่านการยอมรับสนับสนุนการเปลี่ยนแปลง
ทดสอบ Qwen 3.8 Max ด้วย CometAPI
ใช้ CometAPI Quickstart เพื่อกำหนดค่าไคลเอนต์ที่เข้ากันได้กับ OpenAI ก่อนส่งทราฟฟิกงานผลิตจริง โปรดยืนยันว่า qwen3.8-max เปิดใช้งานในบัญชีของคุณและตรวจสอบราคาที่ถูกกำหนดเส้นทางที่แสดงที่นั่น
เปรียบเทียบกับฐานอ้างอิง Qwen 3.7 ของคุณโดยใช้พรอมป์ ตัวตรวจสอบ นโยบายลองใหม่ และเทเลเมทรีเหมือนกัน วิธีนี้ช่วยให้การประเมินโฟกัสที่โมเดล แทนการเปลี่ยนแปลงในฮาร์เนสทดสอบ
