GPT-5.6 Luna price down 80%, Terra down 20% →

ราคา API ของ Qwen 3.8 Max: $2 อินพุต, $6 เอาต์พุต, บริบท 1M

CometAPI
Mia MarenAug 4, 2026
ราคา API ของ Qwen 3.8 Max: $2 อินพุต, $6 เอาต์พุต, บริบท 1M

ราคาสำหรับ Qwen 3.8 Max API: อินพุต $2 เอาต์พุต $6 หน้าต่างบริบท 1M

TL;DR

Qwen 3.8 Max มีค่าใช้จ่ายที่ QwenCloud เท่ากับ $2 ต่อโทเค็นอินพุต 1 ล้าน และ $6 ต่อโทเค็นเอาต์พุต 1 ล้าน อัตราแคชเฉพาะรุ่นคือ $0.25/ล้าน สำหรับอินพุตที่ถูกแคชโดยอัตโนมัติ (implicit), $2.50/ล้าน สำหรับการสร้างแคชแบบชัดแจ้ง (explicit) และ $0.17/ล้าน สำหรับการอ่านแคชแบบชัดแจ้ง

อัตราโทเค็นมาตรฐานเดียวกันใช้กับหน้าต่างบริบท 1M โทเค็น ที่รองรับของโมเดล ข้อความนำเข้าที่ใหญ่ขึ้นมีค่าใช้จ่ายมากขึ้นเพราะมีโทเค็นมากกว่า ไม่ใช่เพราะเข้าสู่ระดับราคาบริบทยาวที่สูงกว่า

ที่ราคาปกติ (list price) Qwen 3.8 Max ถูกกว่า Qwen 3.7 Max 20% อย่างไรก็ตาม Qwen 3.7 Max ยังถูกกว่าในช่วงโปรโมชั่น 50% ที่ใช้งานอยู่ในปัจจุบัน ทางเลือกที่เหมาะสมสำหรับงานผลิตจริงขึ้นอยู่กับ ต้นทุนต่อภารกิจที่ผ่านการยอมรับ ซึ่งรวมการให้เหตุผล แคชที่ฮิต เครื่องมือ การลองใหม่ ความหน่วงเวลา และการตรวจทานโดยมนุษย์

ภาพรวมราคา Qwen 3.8 Max API

รายการค่าทางการปัจจุบัน
Production model IDqwen3.8-max
Official release dateAugust 3, 2026
Architectureพารามิเตอร์รวม 2.4T; พารามิเตอร์ที่ใช้งาน 95B
Standard input price$2 / 1M tokens
Standard output price$6 / 1M tokens
Implicit cached input$0.25 / 1M tokens
Explicit cache creation$2.50 / 1M tokens
Explicit cache read$0.17 / 1M tokens
Context window1M tokens
Maximum input991K โดยไม่มีการให้เหตุผล; 983K พร้อมการให้เหตุผล
Maximum output131K
Maximum reasoning262K
Input modalitiesข้อความ รูปภาพ และวิดีโอ
Output modalityข้อความ
QwenCloud reference limits2M TPM และ 15K RPM

หน้าโมเดล QwenCloud เป็นแหล่งข้อมูลโดยตรงที่สุดสำหรับ Model ID ปัจจุบัน ราคา อัตราแคช ขีดจำกัดบริบท และรูปแบบสื่อ ขีดจำกัดตามบัญชีและภูมิภาคอาจแตกต่างกัน ดังนั้นโปรดใช้ขีดจำกัดที่แสดงในคอนโซลของคุณเองเมื่อกำหนดค่าความขนานในงานผลิตจริง

รุ่นผลิตจริงยังแทนที่ตัวระบุแบบพรีวิวด้วย qwen3.8-max และเพิ่มอัตราราคาตามรุ่นแบบสมบูรณ์ เอกสารเปิดตัวของ Qwen กล่าวถึงการตั้งค่าความพยายามในการให้เหตุผล low, medium และ xhigh แต่ควรยืนยันพฤติกรรมในงานผลิตจริงกับเอนด์พอยต์และเอกสารอ้างอิง API ที่คุณใช้งานจริง

หมายเหตุสำคัญตามเวลา: Qwen ประกาศว่าจะเผยแพร่น้ำหนักโมเดลแบบเปิดตามหลังการปล่อย API ณ วันที่ August 4, 2026 อย่าอธิบาย Qwen 3.8 Max ว่าสามารถดาวน์โหลดหรือโฮสต์เองได้จนกว่าจะมีการเผยแพร่เช็คพอยต์และไลเซนส์อย่างเป็นทางการ

วิธีคิดค่าบริการของ Qwen 3.8 Max

QwenCloud ปัจจุบันแสดงอัตรามาตรฐานคงที่ $2 ต่อโทเค็นอินพุต 1M และ $6 ต่อโทเค็นเอาต์พุต 1M ตลอดหน้าต่างบริบท 1M โทเค็นที่ Qwen 3.8 Max รองรับ ภาพรวมราคาอย่างเป็นทางการด้านล่างถูกจับเมื่อ August 4, 2026; โปรดตรวจสอบหน้าโมเดลแบบสดทุกครั้งก่อนตัดสินใจงบประมาณในงานผลิตจริง

ราคา API ของ Qwen 3.8 Max: $2 อินพุต, $6 เอาต์พุต, บริบท 1M

แหล่งที่มา***:*** QwenCloud, “Qwen3.8-Max” official

รายการคิดเงินราคา/โทเค็น 1Mใช้เมื่อใด
Standard input$2.00เนื้อหาพรอมป์ใหม่ คำอธิบายเครื่องมือ และบริบทที่ไม่ได้แคช
Standard output$6.00เอาต์พุตที่สร้างขึ้นและการใช้งานโทเค็นสำหรับการให้เหตุผลที่ถูกคิดเงิน
Implicit cache hit$0.25การใช้งานซ้ำคำนำของพรอมป์โดยอัตโนมัติ; ไม่การันตีว่าจะฮิตทุกครั้ง
Explicit cache creation$2.50การสร้างคำนำของพรอมป์ที่ทำเครื่องหมายให้ใช้งานซ้ำได้
Explicit cache read$0.17การใช้งานซ้ำบล็อกแคชแบบชัดแจ้งที่ยังใช้ได้

ดังนั้นคำขอ 900K โทเค็นจึงมีค่าใช้จ่ายมากกว่าคำขอ 100K โทเค็น เพราะประมวลผลโทเค็นอินพุตมากกว่าถึงเก้าเท่า ไม่ใช่เพราะเข้าสู่ระดับราคาที่สูงขึ้น

การให้เหตุผลสามารถเพิ่มค่าใช้จ่ายเอาต์พุต

คำตอบที่มองเห็นสั้น ไม่ได้แปลว่าต้นทุนต่ำเสมอไป การเรียกที่เปิดใช้งานการให้เหตุผลอาจสร้างโทเค็นสำหรับการให้เหตุผลเพิ่มเติม ดังนั้นประมาณการในงานผลิตจริงควรใช้ฟิลด์การใช้งานที่ API ส่งกลับ แทนที่จะประเมินจากความยาวคำตอบที่มองเห็น

หากเอนด์พอยต์ของคุณรองรับการควบคุมการให้เหตุผลสำหรับ qwen3.8-max ให้เปรียบเทียบการตั้งค่าที่มีอยู่บนชุดประเมินเดียวกัน อย่าคิดว่าค่าเริ่มต้นของพรีวิวจะถูกรักษาไว้ในรุ่น GA

การประหยัดจากแคชขึ้นกับความนิ่งของพรอมป์

หน้าโมเดลของ Qwen 3.8 Max เผยแพร่อัตราแคชเฉพาะรุ่น ใช้อัตราเหล่านั้น—ไม่ใช่อัตราแคชโดยเฉลี่ยทั่วไป—เมื่อประมาณการค่าใช้จ่าย

เอนทรีแคชแบบชัดแจ้งมีอายุความถูกต้องห้านาที และการฮิตที่สำเร็จจะรีเซ็ตช่วงเวลานั้น แคชโดยอัตโนมัติจะทำงานเอง แต่ไม่การันตีว่าจะฮิต แคชมีประโยชน์ที่สุดเมื่อพรอมป์ระบบ คำอธิบายเครื่องมือ บริบทของรีโพซิทอรี หรือเอกสารขนาดใหญ่คงที่ตลอดการเรียกที่ถี่

เครื่องมือในตัวมีการคิดค่าบริการแยกต่างหาก

QwenCloud ปัจจุบันแสดงค่าธรรมเนียมสำหรับเครื่องมือดังต่อไปนี้ นอกเหนือจากการใช้งานโทเค็น:

เครื่องมือในตัวค่าธรรมเนียมปัจจุบัน
Web Search$10 / 1K calls
Image Search$8 / 1K calls
Web Extractorฟรีช่วงเวลาจำกัด
Code Interpreterฟรีช่วงเวลาจำกัด

การเรียกฟังก์ชัน (Function calling) และ MCP ไม่มีค่าธรรมเนียมเครื่องมือแยกต่างหาก แต่คำอธิบายเครื่องมือยังคงนับเป็นโทเค็นอินพุต โปรโมชันฟรีของเครื่องมืออาจเปลี่ยนแปลงได้ โปรดตรวจสอบ คู่มือราคา QwenCloud ก่อนทำงบประมาณงานผลิตจริง

ตัวอย่างเช่น คำขอที่มีอินพุต 20K โทเค็น เอาต์พุต 2K โทเค็น และเรียก Web Search สองครั้ง มีค่าใช้จ่ายโดยประมาณ:

Input:      20,000 / 1,000,000 × $2  = $0.040
Output:      2,000 / 1,000,000 × $6  = $0.012
Web Search:  2 / 1,000 × $10          = $0.020
Total:                                      $0.072

ในตัวอย่างนี้ การค้นหาสองครั้งคิดเป็นประมาณ 27.8% ของค่าใช้จ่ายคำขอทั้งหมด

ตัวอย่างต้นทุนในโลกจริงของ Qwen 3.8 Max

ตัวอย่างเหล่านี้ใช้อัตราเฉพาะรุ่นของ QwenCloud ปัจจุบัน ไม่รวมภาษี การลองใหม่ โมเดลสำรอง และส่วนเพิ่มราคาจากผู้ให้บริการ

ตัวอย่างที่ 1: คำขอตัวแทนระดับกลาง

Assume 50K input tokens and 5K output tokens:
Input:  50,000 / 1,000,000 × $2 = $0.10
Output:  5,000 / 1,000,000 × $6 = $0.03
Total:                                $0.13

ความพยายามครั้งแรกที่สำเร็จมีค่าใช้จ่ายประมาณ $0.13 การลองใหม่เต็มรูปแบบหนึ่งครั้งจะเพิ่มค่าใช้จ่ายโมเดลเป็นประมาณ $0.26

ตัวอย่างที่ 2: การวิเคราะห์เอกสารยาว

Assume 800K input tokens and 20K output tokens:
Input:  800,000 / 1,000,000 × $2 = $1.60
Output:  20,000 / 1,000,000 × $6 = $0.12
Total:                                  $1.72

โมเดลไม่มีค่าธรรมเนียมเพิ่มสำหรับบริบทยาวบนอัตราปัจจุบัน แต่พรอมป์ขนาดใหญ่ยังคงสร้างต้นทุนรวมที่มากขึ้น

ตัวอย่างที่ 3: เซสชันตัวแทนที่ใช้แคช

สมมุติคำนำที่ใช้งานซ้ำได้ 100K โทเค็น อินพุตใหม่ 10K โทเค็น เอาต์พุต 5K โทเค็น และ 50 คอล์ในขณะที่แคชแบบชัดแจ้งยังคงใช้ได้:

First call:
100K cache creation × $2.50/M = $0.250
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
First-call total              = $0.300
Each of the next 49 calls:
100K cache read × $0.17/M     = $0.017
10K new input × $2/M          = $0.020
5K output × $6/M              = $0.030
Per-call total                = $0.067
Cached session total          = $3.583
Same 50 calls without cache   = $12.500

การประหยัดโดยประมาณ = $8.917 หรือ 71.3%

การประหยัดที่ประมาณขึ้นกับการฮิตแคชที่สำเร็จและคำนำที่คงที่ ช่องว่างเวลานานหรือการเปลี่ยนแปลงบ่อยในพรอมป์ระบบและสคีม่าเครื่องมือจะลดประโยชน์ลง

Qwen 3.8 Max เทียบกับ Qwen 3.7 Max:เปรียบเทียบราคา

Qwen 3.8 Max ถูกกว่า Qwen 3.7 Max 20% ที่ราคาปกติ แต่ Qwen 3.7 Max ถูกกว่า 37.5% ขณะโปรโมชั่น 50% ปัจจุบันยังทำงานอยู่

รุ่นและสถานะราคาอินพุต / 1Mเอาต์พุต / 1Mบริบท
qwen3.8-max standard price$2.00$6.001M
qwen3.7-max list price$2.50$7.501M
qwen3.7-max current promotion$1.25$3.751M

เก็บหน้าโมเดล CometAPI Qwen3.7 Max ไว้เป็นแผนสำรองขณะทดสอบโมเดลใหม่

ราคาต่อโทเค็นเป็นเพียงส่วนหนึ่งของการตัดสินใจ Qwen 3.8 Max ยังอาจคุ้มค่ากว่า หากเพิ่มความสำเร็จตั้งแต่ครั้งแรก ใช้เครื่องมือได้เสถียรกว่า ลดการลองใหม่ หรือใช้เวลามนุษย์แก้น้อยลง

ใช้เมตริกสำหรับงานผลิตจริงนี้:

ต้นทุนต่อภารกิจที่ผ่านการยอมรับ =

(โทเค็นโมเดล + การเรียกเครื่องมือ + การลองใหม่ + ค่าใช้จ่ายโมเดลสำรอง + ค่าตรวจทาน)

÷ เอาต์พุตที่ผ่านการยอมรับ

ผลการทดสอบตามที่ผู้ขายรายงานเป็นเหตุผลที่ควรทดสอบงานโค้ดและเวิร์กโฟลว์ระดับมืออาชีพที่ยากอีกครั้ง ไม่ใช่หลักฐานว่าทุกงานของ Qwen 3.7 ควรย้ายทันที

วิธีการย้ายไปใช้ Qwen 3.8 Max

การเปลี่ยนสตริงโมเดลเป็นสิ่งจำเป็น แต่ไม่ใช่ทั้งหมดสำหรับการย้ายในงานผลิตจริง

1. ทดสอบ Production model ID

แทนที่ตัวระบุแบบพรีวิวด้วย qwen3.8-max ในสภาพแวดล้อมทดสอบ อย่าคิดว่าชื่อแฝง ค่าเริ่มต้น ความหน่วง หรือพฤติกรรมการตอบของพรีวิวจะคงเดิม

คำขอขั้นต่ำที่เข้ากันได้กับ OpenAI อาจเป็นดังนี้:

import os
from openai import OpenAI
client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[
        {
            "role": "user",
            "content": "Review this migration plan and identify production risks.",
        }
    ],
)

print(response.choices[0].message.content)

เริ่มจากคำขอขั้นต่ำที่มีเอกสารกำกับ เพิ่มการควบคุมการให้เหตุผลก็ต่อเมื่อเอกสาร API ปัจจุบันสำหรับเอนด์พอยต์ของคุณรองรับอย่างชัดเจน

2. สร้างฐานอ้างอิงใหม่สำหรับเทเลเมทรีด้านต้นทุนและประสิทธิภาพ

บันทึกอย่างน้อย:

  • โทเค็นอินพุต เอาต์พุต และการให้เหตุผล
  • การฮิตแคชและโทเค็นสำหรับการสร้างแคช
  • เวลาไปยังโทเค็นแรกและความหน่วงรวม
  • การเรียกเครื่องมือ การลองใหม่ และโมเดลสำรอง
  • เอาต์พุตที่ยอมรับเทียบกับที่ปฏิเสธ
  • เวลาแก้ไขโดยมนุษย์

3. ทดสอบซ้ำอินเทอร์เฟซที่แอปของคุณใช้งาน

ตรวจสอบอีเวนต์แบบสตรีม เพย์โหลดแบบหลายสื่อ สคีม่าเครื่องมือ เอาต์พุตแบบมีโครงสร้าง เหตุผลการสิ้นสุด ฟิลด์การใช้งาน การจัดการข้อผิดพลาด และพฤติกรรมหลายบทสนทนา หน้าโมเดลผลิตจริงมีการเข้าถึงผ่าน DashScope และรูปแบบที่เข้ากันได้กับ OpenAI; ยืนยันเลเยอร์ความเข้ากันได้เพิ่มเติมก่อนพึ่งพา

4. เคารพขีดจำกัดบริบทเชิงปฏิบัติ

หน้าต่างบริบท 1M ไม่เหมือนกับพรอมป์ผู้ใช้ 1M โทเค็น QwenCloud แสดงขีดจำกัดอินพุตสูงสุด 991K โดยไม่มีการให้เหตุผล และ 983K เมื่อเปิดการให้เหตุผล เผื่อพื้นที่ปลอดภัยเพื่อให้คำขอยังมีที่ว่างสำหรับเอาต์พุตและการให้เหตุผล

5. รัน Qwen 3.7 และ Qwen 3.8 แบบขนาน

ใช้พรอมป์ เครื่องมือ ตัวตรวจสอบ กฎการลองใหม่ และชุดข้อมูลเหมือนกัน เปรียบเทียบต้นทุนต่อภารกิจที่ผ่านการยอมรับและความหน่วง แทนการตัดสินคำตอบเดี่ยวๆ ด้วยสายตา

วิธีประเมินและกำหนดเส้นทาง Qwen 3.8 Max

ใช้เวิร์กโหลดจริง แทนการอ้างค่าเฉลี่ยจากเบนช์มาร์กทั่วไป

เวิร์กโหลดงานที่แนะนำสัญญาณการยอมรับหลัก
การโค้ดบนรีโพซิทอรี4เทสต์ผ่านโดยไม่ต้องให้มนุษย์แก้ไขเพิ่มเติม
การวิเคราะห์เอกสารยาว3ข้ออ้างได้รับการสนับสนุนด้วยหลักฐานที่ให้มา
การวิเคราะห์หลายสื่อ2ใช้รายละเอียดจากรูปภาพหรือวิดีโออย่างถูกต้อง
ตัวแทนที่ใช้เครื่องมือ3เลือกเครื่องมือถูกต้องและอาร์กิวเมนต์ถูกต้อง
A practical routing policy is:
Simple, latency-sensitive task
→ Lower-cost Plus model
Existing workload that already meets quality targets
→ Qwen 3.7 Max while its promotion remains attractive
Hard coding, multimodal, or long-horizon task
→ Qwen 3.8 Max
Failed validation
→ One controlled retry, then a tested fallback

ใช้ Qwen 3.8 Max สำหรับงานรีโพซิทอรียากๆ ตัวแทนระยะยาว การวิเคราะห์หลายสื่อ และเวิร์กโฟลว์ที่ Qwen 3.7 ไม่ผ่านเกณฑ์ยอมรับ คงใช้ Qwen 3.7 Max เมื่อตัวโปรโมชันยังลดต้นทุนได้อย่างมีนัยสำคัญและโมเดลปัจจุบันบรรลุคุณภาพตามเป้าแล้ว

ตรวจสอบ หน้าราคา CometAPI และข้อมูลการกำหนดเส้นทางแบบสดก่อนล็อกเกณฑ์ เพราะความพร้อมใช้งานของผู้ให้บริการและราคาที่ถูกกำหนดเส้นทางอาจเปลี่ยนแยกจากราคาปกติของ QwenCloud ได้ CometAPI Cookbook ช่วยให้คุณสร้างคำขอที่ทำซ้ำได้และฮาร์เนสประเมินผลที่สม่ำเสมอ

คำถามที่พบบ่อย

Qwen 3.8 Max API มีค่าใช้จ่ายเท่าไร?

QwenCloud ปัจจุบันแสดงราคาของ Qwen 3.8 Max ที่ $2 ต่อโทเค็นอินพุต 1 ล้าน และ $6 ต่อโทเค็นเอาต์พุต 1 ล้าน การใช้แคชและเครื่องมือในตัวมีอัตราแยกต่างหาก

Qwen 3.8 Max มีค่าใช้จ่ายมากขึ้นเมื่อเกิน 128K โทเค็นหรือไม่?

ไม่มีระดับราคาบริบทยาวแยกต่างหากบนอัตราเฉพาะรุ่นปัจจุบัน คำขอยาวมีค่าใช้จ่ายมากขึ้นเพราะมีโทเค็นมากกว่า ไม่ใช่เพราะข้ามไปยังระดับราคาต่อหน่วยที่สูงกว่า

มีการคิดเงินโทเค็นสำหรับการให้เหตุผลของ Qwen 3.8 Max หรือไม่?

การให้เหตุผลสามารถเพิ่มการใช้งานโทเค็นที่สร้างและต้นทุนรวม ใช้ฟิลด์โทเค็นสำหรับการให้เหตุผลและเอาต์พุตที่เอนด์พอยต์ส่งกลับ แทนการประมาณจากคำตอบที่มองเห็น

Qwen 3.8 Max เป็นโอเพนซอร์สหรือไม่?

Qwen ประกาศว่าจะเผยแพร่น้ำหนักโมเดลแบบเปิดตามหลังการปล่อย API อย่าอธิบายว่าโมเดลสามารถดาวน์โหลดหรือโฮสต์เองได้ จนกว่าจะมีเช็คพอยต์และไลเซนส์อย่างเป็นทางการ

ผู้ใช้ Qwen 3.7 Max ควรย้ายทันทีหรือไม่?

ไม่โดยอัตโนมัติ Qwen 3.8 Max มีราคาปกติที่ต่ำกว่า ขณะที่ Qwen 3.7 Max ถูกกว่าระหว่างโปรโมชันปัจจุบัน ย้ายเมื่อข้อมูลของคุณเองด้านคุณภาพ ความหน่วง พฤติกรรมแคช และต้นทุนต่อภารกิจที่ผ่านการยอมรับสนับสนุนการเปลี่ยนแปลง

ทดสอบ Qwen 3.8 Max ด้วย CometAPI

ใช้ CometAPI Quickstart เพื่อกำหนดค่าไคลเอนต์ที่เข้ากันได้กับ OpenAI ก่อนส่งทราฟฟิกงานผลิตจริง โปรดยืนยันว่า qwen3.8-max เปิดใช้งานในบัญชีของคุณและตรวจสอบราคาที่ถูกกำหนดเส้นทางที่แสดงที่นั่น

เปรียบเทียบกับฐานอ้างอิง Qwen 3.7 ของคุณโดยใช้พรอมป์ ตัวตรวจสอบ นโยบายลองใหม่ และเทเลเมทรีเหมือนกัน วิธีนี้ช่วยให้การประเมินโฟกัสที่โมเดล แทนการเปลี่ยนแปลงในฮาร์เนสทดสอบ

พร้อมลดต้นทุนการพัฒนา AI ลง 20% แล้วหรือยัง?

เริ่มต้นฟรีภายในไม่กี่นาที มีเครดิตทดลองใช้ฟรี ไม่ต้องใช้บัตรเครดิต

อ่านเพิ่มเติม