TL;DR อัตราราคา API อย่างเป็นทางการเริ่มต้นที่ $10 ต่อโทเค็นขาเข้า 1 ล้าน และ $50 ต่อโทเค็นขาออก 1 ล้าน ซึ่งคิดเป็น 2.5 เท่าของราคามาตรฐานต่อโทเค็นของ GPT-5.6 Sol
GPT-6 Astra ถูกออกแบบมาสำหรับเวิร์กโฟลว์โค้ดดิ้ง การท่องเว็บ การใช้คอมพิวเตอร์ การวิจัย และงานเชิงเอเยนต์ที่ทำงานยาว ซึ่งต้นทุนจริงมักถูกกำหนดโดยการลองซ้ำ การเรียกใช้เครื่องมือ การเติบโตของคอนเท็กซ์ การใช้แคช และความน่าจะเป็นที่โมเดลจะทำงานสำเร็จ OpenAI วางตำแหน่ง Astra กับงาน end-to-end ที่ยากที่สุด แทนที่จะมุ่งเน้นการอินเฟอเรนซ์ปริมาณมากราคาถูก
ยังมี “หน้าผาราคา” ที่สำคัญ: เมื่อคำขอ เกิน 272K โทเค็นขาเข้า อัตราของ Astra จะเพิ่มขึ้นกับคำขอฉบับเต็ม
สิ่งที่ต้องสังเกต:
- ระวังขนาดคอนเท็กซ์: ข้าม 272K โทเค็นขาเข้าจะเปลี่ยนอัตราสำหรับคำขอทั้งฉบับ
- คิดเผื่อการแคช: คำนำคงที่ที่เกิดซ้ำสามารถมีต้นทุนต่ำลงมากเมื่อมีการใช้แคชซ้ำสำเร็จ
- เลือกชั้นการประมวลผล: Batch/Flex แลกความทันทีเป็นอัตราที่ต่ำลง; Fast มีค่าพรีเมียมเพิ่ม
- วัดผลลัพธ์งาน: รวมโทเค็น เครื่องมือ งานที่ล้มเหลว และเวลาที่มนุษย์แก้ไขในการเปรียบเทียบของคุณ
GPT-6 Astra ราคาโดยสรุป
ตารางอัตราแยกค่าโทเค็นขาเข้าปกติ การอ่านแคช การเขียนแคช และขาออก ช่วงคอนเท็กซ์หมายถึงจำนวนโทเค็นขาเข้า; ราคาทุกโทเค็นคำนวณต่อ 1 ล้านโทเค็น
Batch และ Flex ใช้อัตราเท่ากับครึ่งหนึ่งของ Standard ส่วน Fast ใช้อัตราเป็นสองเท่าของ Standard ที่เกี่ยวข้อง โหมดประมวลผลเหล่านี้ตอบโจทย์ความต้องการแฝงเวลาหน่วงและความพร้อมใช้งานที่ต่างกัน
| โหมดราคา / คอนเท็กซ์ | ขาเข้า / 1M | ขาเข้าแบบแคช / 1M | เขียนแคช / 1M | ขาออก / 1M |
|---|---|---|---|---|
| Standard ≤272K | $10.00 | $1.00 | $12.50 | $50.00 |
| Standard >272K | $20.00 | $2.00 | $25.00 | $75.00 |
| Batch/Flex ≤272K | $5.00 | $0.50 | $6.25 | $25.00 |
| Batch/Flex >272K | $10.00 | $1.00 | $12.50 | $37.50 |
| Fast ≤272K | $20.00 | $2.00 | $25.00 | $100.00 |
| Fast >272K | $40.00 | $4.00 | $50.00 | $150.00 |
ตัวเลขที่สำคัญที่สุดในตารางนี้อาจไม่ใช่ $10 หรือ $50 แต่คือ 272K
สำหรับพรอมป์ตที่เกิน 272K โทเค็นขาเข้า OpenAI จะใช้อัตรา 2× สำหรับขาเข้า/แคช และ 1.5× สำหรับขาออก กับคำขอทั้งฉบับ ดังนั้นการเพิ่มขึ้นเล็กน้อยใกล้ขอบเขตนั้นจึงอาจทำให้ต้นทุนเพิ่มขึ้นมาก
GPT-6 Astra คืออะไร?
GPT-6 Astra ผสานโค้ดดิ้ง การวิจัย และการโต้ตอบกับคอมพิวเตอร์ไว้ในโมเดลเดียว ความจุคอนเท็กซ์ ขีดจำกัดขาออก และเวิร์กโฟลว์ที่รองรับอธิบายได้ว่าราคาแบบพรีเมียมสำคัญตรงไหน
| สเปก API อย่างเป็นทางการ | ค่า |
|---|---|
| ผู้พัฒนา | OpenAI |
| รหัสโมเดล | gpt-6-astra |
| หน้าต่างคอนเท็กซ์ | 1,050,000 โทเค็น |
| เอาต์พุตสูงสุด | 128,000 โทเค็น |
| วันตัดความรู้ | 30 เมษายน 2026 |
| โมดาลิตีขาเข้า | ข้อความและภาพ |
| โมดาลิตีขาออก | ข้อความ |
| ระดับการให้เหตุผล | ต่ำ, กลาง, สูง, สูงมาก, สูงสุด |
| API ที่แนะนำ | Responses API สำหรับเวิร์กโฟลว์ที่ใช้เครื่องมือมาก |
| ปรับจูนเฉพาะงาน | ไม่รองรับ |
| เกณฑ์ราคาคอนเท็กซ์ยาว | มากกว่า 272K โทเค็นขาเข้า |
หน้าต่างคอนเท็กซ์ 1.05M โทเค็นนั้นเกี่ยวข้องกับราคาอย่างยิ่ง Astra สามารถรับข้อมูลจำนวนมาก เช่น รีโพซิทอรี เอกสาร ประวัติการใช้เครื่องมือ และวัสดุวิจัย แต่การใช้หน้าต่างคอนเท็กซ์ที่มีให้แบบเต็มที่ไม่ได้หมายความว่าคุ้มค่าในเชิงเศรษฐศาสตร์เสมอไป
ความสามารถ การเรียกใช้เครื่องมือแบบอะซิงก์และการปรับท่ามกลางรอบโต้ตอบ รองรับเวิร์กโฟลว์ที่ยาวขึ้น ร่วมกับการใช้คอมพิวเตอร์ การแคชพรอมป์ต การประสานงานหลายเอเยนต์ และการย่อข้อมูล การรองรับโดยโมเดลไม่ได้หมายความว่าผู้ให้บริการทุกรายจะเปิดใช้เครื่องมือหรือฟีเจอร์ทุกอย่าง
GPT-6 Astra มีค่าใช้จ่ายผ่าน CometAPI เท่าไหร่?
ปัจจุบัน CometAPI มี การเข้าถึง GPT-6 Astra API พร้อมอัตราโทเค็นคอนเท็กซ์สั้นและยาวที่ ต่ำกว่าราคาอย่างเป็นทางการที่สอดคล้องกัน 20%
- คอนเท็กซ์สั้น: CometAPI แสดง $8/M สำหรับขาเข้า และ $40/M สำหรับขาออก เมื่อเทียบกับ $10/M และ $50/M ของ OpenAI
- คอนเท็กซ์ยาว: CometAPI แสดง $16/M สำหรับขาเข้า และ $60/M สำหรับขาออก เมื่อเทียบกับ $20/M และ $75/M ของ OpenAI
- แคช: อัตราอ่าน/เขียนแคชคอนเท็กซ์สั้นคือ $0.80/M และ $10/M; คอนเท็กซ์ยาวคือ $1.60/M และ $20/M
- ความต่าง: อัตราที่ CometAPI แสดงต่ำกว่าราคา OpenAI ที่ตรงกันในแต่ละหมวด 20% โปรดยืนยันอัตราปัจจุบันก่อนวางงบประมาณโปรดักชัน
สำหรับตัวอย่างก่อนหน้า 100K ขาเข้า, 10K ขาออก:
OpenAI: 100K × $10/M + 10K × $50/M = $1.50
CometAPI: 100K × $8/M + 10K × $40/M = $1.20
ประหยัดต่อคำขอ: $0.30
ที่ 10,000 คำขอเทียบเท่า ความต่างแบบง่ายจะกลายเป็น $3,000
สำหรับงานคอนเท็กซ์ยาว 300K ขาเข้า, 20K ขาออก:
OpenAI: 300K × $20/M + 20K × $75/M = $7.50
CometAPI: 300K × $16/M + 20K × $60/M = $6.00
ประหยัดต่อคำขอ: $1.50
ราคา API และกฎการเรียกเก็บเงินอาจเปลี่ยนแปลงได้ การจัดงบประมาณโปรดักชันควรใช้อัตรา CometAPI ปัจจุบันสำหรับโมเดลและงานที่ใช้งานอยู่
ความต่างเชิงเปอร์เซ็นต์นั้นตรงไปตรงมา แต่เวิร์กโหลดเอเยนต์ขนาดใหญ่จะขยายผลกระทบในเชิงปริมาณ เพราะคำขอเดียวสามารถใช้โทเค็นขาเข้าเป็นหลายแสนได้
มีค่าใช้จ่ายอะไรบ้างนอกเหนือจากโทเค็นโมเดลใน GPT-6 Astra?
สำหรับการสร้างข้อความแบบดั้งเดิม โทเค็นขาเข้าและขาออกเป็นตัวกำหนดต้นทุนหลัก สำหรับเอเยนต์ Astra อาจเป็นเพียงส่วนหนึ่งของบิลเท่านั้น
OpenAI คิดค่าบริการแยกต่างหากสำหรับ เครื่องมือค้นเว็บและค้นไฟล์ การค้นเว็บมีค่าใช้จ่าย $10 ต่อ 1,000 ครั้ง โดยเนื้อหาที่ดึงมาจะถูกคิดที่อัตราโทเค็นของโมเดลด้วย การค้นไฟล์มีค่าใช้จ่าย $2.50 ต่อ 1,000 ครั้ง และค่าจัดเก็บคือ $0.10/GB/วัน หลังจากสิทธิ์ฟรี 1 GB
Hosted Shell และ Code Interpreter มี ค่าใช้คอนเทนเนอร์แยกต่างหาก: อัตรา 1 GB คือ $0.03 ต่อเซสชัน 20 นาทีต่อคอนเทนเนอร์ เซสชันที่เข้าเกณฑ์คิดค่าบริการเป็นรายนาทีโดยมีขั้นต่ำ 5 นาที การจัดสรรหน่วยความจำที่ใหญ่กว่ามีอัตราที่สูงขึ้น
เนื้อหาที่สร้างโดยเครื่องมือยังสามารถเพิ่มการใช้โทเค็นได้ เอเยนต์เบราว์เซอร์หรือการใช้คอมพิวเตอร์อาจเพิ่มภาพหน้าจอ หน้าเว็บ เอาต์พุตเทอร์มินัล เอกสารที่ดึงมา และประวัติเครื่องมือเข้าคอนเท็กซ์ซ้ำๆ แม้แต่ละการกระทำจะมีราคาถูก แต่ประวัติที่สะสมสามารถผลักคำขอโมเดลครั้งถัดไปให้ข้ามเกณฑ์ 272K ของ Astra ได้
ดังนั้นงบประมาณโปรดักชันควรติดตามอย่างน้อย: โทเค็นโมเดล + กิจกรรมแคช + การเรียกเครื่องมือ + การรันโฮสต์ + การลองซ้ำ + จำนวนสtepรวม + อัตรางานสำเร็จ
ยิ่งเวิร์กโฟลว์มีความอัตโนมัติสูง ราคาต่อโทเค็นล้านก็ยิ่งมีประโยชน์น้อยลงในฐานะ KPI เดี่ยว
ความพยายามในการให้เหตุผลมีผลต่อค่าใช้จ่าย GPT-6 Astra หรือไม่?
ความพยายามในการให้เหตุผลไม่ได้เป็นบรรทัดแยกในตารางอัตราโทเค็นที่เผยแพร่ แต่ยังสามารถเปลี่ยนค่าใช้จ่ายรวมได้โดยอ้อม: การให้เหตุผลลึกขึ้นอาจสร้างโทเค็นขาออกมากขึ้น ขยายการใช้เครื่องมือ หรือยืดเส้นทางของเอเยนต์ ขณะที่การตัดสินใจที่ดีขึ้นอาจลดการลองซ้ำและการแก้ไขโดยมนุษย์ เปรียบเทียบการตั้งค่าการให้เหตุผลกับชุดงานเดียวกัน และรายงานโทเค็นโมเดลรวม ค่าใช้จ่ายเครื่องมือ อัตราการทำสำเร็จ และเวลาแก้ไข
คุณกำลังซื้อสมรรถนะมากแค่ไหน?
การเปรียบเทียบราคาไม่สมบูรณ์หากไม่เข้าใจว่าราคาที่สูงขึ้นให้สิ่งใด
OpenAI รายงานการเพิ่มขึ้นอย่างมากในเชิงเอเยนต์และการประเมินด้านเทคนิค เปอร์เซ็นต์ด้านล่างเป็นผลจากผู้ขาย ไม่ใช่การวัดอิสระที่ทำเพื่อบทความนี้; ขีดหมายถึงไม่มีการรายงานผล
| เกณฑ์มาตรฐานทางการ (%) | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash |
|---|---|---|---|---|
| AutomationBench | 41.4 | 18.1 | 31.4 | — |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| Terminal-Bench Science 0.1 | 64.6 | 22.4 | 52.6 | — |
| FrontierMath Tier 4 (v2) | 97.6 | 83.0 | 87.8 | — |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
| ExploitBench | 100.0 | 78.5 | — | — |
ในการประเมินแบบออฟไลน์ OSWorld 2.0 ของ OpenAI Astra ได้ 72.6% เทียบกับ 65.7% ของ GPT-5.6 Sol การจำลองเวลาแฝงประเมินว่า ประมาณ 40 เทียบกับ 75 นาทีต่อภารกิจ เวลาเหล่านี้อธิบายการตั้งค่าการประเมิน ไม่ใช่การรับประกันเวลาแฝงทั่วไป
สิ่งนี้สำคัญในเชิงเศรษฐศาสตร์
โมเดลที่มีต้นทุนต่อโทเค็นสูงกว่า 2.5 เท่า ไม่จำเป็นต้องมีต้นทุนต่อภารกิจสำเร็จสูงกว่า 2.5 เท่า หากใช้รอบน้อยกว่า ต้องลองซ้ำน้อยกว่า ทำเวิร์กโฟลว์สำเร็จเร็วกว่า หรือหลีกเลี่ยงการยกระดับไปยังมนุษย์ได้
ในขณะเดียวกัน Astra ไม่ได้เป็นตัวเลือกคุ้มค่าที่สุดโดยอัตโนมัติสำหรับทุกงาน ค่าพรีเมียมจะพิสูจน์ได้ง่ายที่สุดเมื่อผลลัพธ์เชิงเอเยนต์ส่งผลต่อการปิดงานจริง
หน้าผาราคา 272K เปลี่ยนสมการทางเศรษฐศาสตร์
ส่วนที่มองข้ามได้ง่ายที่สุดของราคาของ GPT-6 Astra คือสิ่งที่เกิดขึ้นเมื่ออินพุต ข้าม 272K โทเค็น
ลองพิจารณาคำขอแบบ Standard ที่เรียบง่ายหลายแบบโดยไม่มีการแคชหรือค่าเครื่องมือเพิ่มเติม
| เวิร์กโหลด | ขาเข้า | ขาออก | ช่วงราคา | ค่าใช้จ่าย OpenAI โดยประมาณ |
|---|---|---|---|---|
| คำขอโค้ดสั้น | 20K | 2K | ≤272K | $0.30 |
| การวิเคราะห์ขนาดใหญ่ | 100K | 10K | ≤272K | $1.50 |
| เอเยนต์ใกล้เกณฑ์ | 270K | 10K | ≤272K | $3.20 |
| เอเยนต์ใหญ่ขึ้นเล็กน้อย | 280K | 10K | >272K | $6.35 |
| งานระดับรีโพซิทอรี | 300K | 20K | >272K | $7.50 |
ตัวอย่าง 270K โทเค็นมีต้นทุน:
270K × $10/M + 10K × $50/M = $3.20
เพิ่มอินพุตเพียง 10K โทเค็น คำขอก็ย้ายไปสู่อัตราคอนเท็กซ์ยาว:
280K × $20/M + 10K × $75/M = $6.35
อินพุตเพิ่มขึ้นประมาณ 3.7% แต่ต้นทุนคำขอรวมเพิ่มขึ้นเกือบ 98%
ดังนั้นการจัดการคอนเท็กซ์จึงเป็นกลไกควบคุมต้นทุนที่สำคัญสำหรับเอเยนต์ Astra แทนที่จะผนวกผลลัพธ์เครื่องมือ ไฟล์ ภาพหน้าจอ และรอบสนทนาทั้งหมดอย่างต่อเนื่อง เอเยนต์โปรดักชันสามารถสรุปสถานะเก่า ดึงเฉพาะไฟล์ที่เกี่ยวข้อง แยกคอนเท็กซ์คงที่เพื่อแคช และเริ่มซับเอเยนต์ใหม่สำหรับงานอิสระ
สำหรับ Astra การปรับโทเค็นให้เหมาะสมจึงไม่ใช่แค่ลดจำนวนโทเค็น แต่ยังเป็นการอยู่ฝั่งที่ถูกกว่าของขอบเขตราคา
การแคชพรอมป์ตเปลี่ยนต้นทุนขาเข้าของ GPT-6 Astra อย่างไร
สำหรับคำขอ Standard ในช่วงคอนเท็กซ์สั้น ขาเข้าปกติ $10/M การอ่านแคช $1/M และการเขียนแคช $12.50/M อัตราอ่านที่ต่ำกว่าจะใช้เฉพาะเมื่อคำนำที่นำกลับมาใช้ซ้ำถูกเสิร์ฟจากแคชสำเร็จ
การอ่านแคชที่สำเร็จมีต้นทุนหนึ่งในสิบของขาเข้าปกติ ในขณะที่การเขียนมีอัตราของตัวเอง การนำกลับมาใช้ซ้ำขึ้นกับ คำนำที่แคชไว้ตรงกัน ที่ยังคงมีอยู่ วัดการเขียนและการฮิตแยกกันแทนที่จะถือว่าพรอมป์ตที่ทำซ้ำทุกครั้งเป็นการฮิตแคช
ลองพิจารณาคำขอสมมุติ 10 คำขอที่แต่ละคำขอรวมคำนำ 100K โทเค็นเดียวกันและยังอยู่ภายใน 272K โทเค็นขาเข้าทั้งหมด เปรียบเทียบสองกรณีควบคุม: ไม่มีการแคช เทียบกับการเขียนแคชคำนำเต็มหนึ่งครั้งแล้วตามด้วยการอ่านแคชคำนำเต็มสำเร็จ 9 ครั้ง โดยไม่มีการเขียนเพิ่มเติม
| ต้นทุนคำนำซ้ำทั่ว 10 คำขอ | ไม่มีการแคช | เขียนหนึ่งครั้ง + อ่านเก้าครั้ง |
|---|---|---|
| ขาเข้าคำนำปกติ | 10 × 100K × $10/M = $10.00 | $0.00 |
| การเขียนแคชคำนำ | $0.00 | 100K × $12.50/M = $1.25 |
| การอ่านแคชคำนำ | $0.00 | 9 × 100K × $1/M = $0.90 |
| รวมสำหรับคำนำซ้ำอย่างเดียว | $10.00 | $2.15 |
ขอบเขตของตัวเลข 78.5%:
การลดลงจาก $10.00 เป็น $2.15 นั้นใช้กับต้นทุนขาเข้าของคำนำที่ทำซ้ำเท่านั้นในตัวอย่างเขียนหนึ่งครั้ง-ฮิตเก้าครั้งข้างต้น ไม่ใช่การประมาณการประหยัดทั่วไปของ
หรือการลดลง 78.5% ของบิล API ทั้งหมด
เพื่อรวมขาออก สมมติว่าคำขอทั้งสิบแต่ละรายการยังสร้างโทเค็นขาออกที่ต้องเสียเงิน 2,000 โทเค็น ที่ $50/M ขาออกจะเพิ่ม $1.00 ให้กับต้นทุนรวมของแต่ละสถานการณ์ เมื่อไม่มีขาเข้าอื่นหรือค่าใช้จ่ายอื่น โทเค็นโมเดลรวมจะเป็น $11.00 โดยไม่มีการแคช และ $3.15 พร้อมการแคช ลดลงประมาณ 71.4% ขาเข้าเพิ่มเติม การพลาดแคชหรือการเขียนซ้ำ เครื่องมือ และชั้นการประมวลผลที่ต่างกันจะเปลี่ยนยอดรวมอีกครั้ง
ประมาณการการประหยัดจาก การวัดการเขียนแคชและการอ่านที่สำเร็จ รวมกับค่าใช้จ่ายที่เหลือ คำนำที่นำกลับมาใช้ซ้ำขนาดใหญ่สามารถลดค่าใช้จ่ายฝั่งขาเข้าได้ แต่ผลต่อค่าใช้จ่ายทั้งหมดขึ้นกับคำนำดังกล่าวคิดเป็นสัดส่วนเท่าใดของบิล
GPT-6 Astra เทียบกับ Claude Fable 5.1: ราคาพาดหัวเท่ากัน แต่มิติแคชต่างกัน
Claude Fable 5.1 มีอัตราพาดหัว [$10/M ขาเข้า และ $50/M ขาออก] ตรงกับราคาขาเข้า/ขาออกระยะสั้นของ Astra แบบ Standard
ราคาพาดหัวจึงเหมือนกัน แต่การแคชไม่เหมือน
| มิติต้นทุน | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| ขาเข้า / 1M | $10.00 | $10.00 |
| ขาออก / 1M | $50.00 | $50.00 |
| อ่านแคช / 1M | $1.00 | $0.25 |
| เขียนแคช / 1M | $12.50 | $12.50 (แคช 5 นาที) |
| หน้าต่างคอนเท็กซ์ | 1.05M | 1M |
| Terminal-Bench 4.0 | 57.9 | 55.8 |
| AutomationBench | 41.4 | 31.4 |
อัตราอ่านแคชของ Fable $0.25/M เป็นหนึ่งในสี่ของอัตราอ่านแคช $1/M ของ Astra สำหรับคอนเท็กซ์สั้น อัตราเขียนแคช 5 นาทีของ Fable เท่ากับ $12.50/M ของ Astra; ตัวเลือกเขียน 1 ชั่วโมงของ Fable มีราคา $20/M
สำหรับเวิร์กโหลดที่ซ้ำมากเป็นพิเศษและถูกครอบงำโดยคำนำที่แคชไว้ Fable สามารถมีเศรษฐศาสตร์ฝั่งขาเข้าที่ดีกว่าแม้ทั้งสองโมเดลจะแสดงราคา $10/$50 เท่ากัน สำหรับงานวิศวกรรมซอฟต์แวร์และระบบอัตโนมัติที่ใช้เครื่องมือหนัก ผลงานที่แข็งแกร่งกว่าของ Astra บนเกณฑ์วัดเชิงเอเยนต์ที่คัดเลือกมาอาจชดเชยข้อเสียด้านแคชนั้น
ดังนั้นราคาขาเข้าและขาออกที่เท่ากันไม่ใช่ข้อบ่งชี้ว่าต้นทุนเวิร์กโหลดจะเท่ากัน อายุแคช อัตราฮิต ปริมาณขาออกที่สร้าง และความสำเร็จของงานต้องเปรียบเทียบร่วมกัน
GPT-6 Astra เทียบกับ GPT-5.6 Sol: ราคาโทเค็น 2.5× คุ้มไหม?
GPT-5.6 Sol มีราคา $4/M ขาเข้า และ $20/M ขาออก ในช่วงคอนเท็กซ์สั้นแบบ Standard เทียบกับ $10/M และ $50/M ของ Astra ตารางนี้แยกความต่างด้านราคาออกจากความสามารถ
| การเปรียบเทียบโมเดลทางการ | GPT-6 Astra | GPT-5.6 Sol | ความแตกต่าง |
|---|---|---|---|
| ขาเข้า / 1M | $10 | $4 | Astra 2.5× |
| ขาออก / 1M | $50 | $20 | Astra 2.5× |
| ขาเข้าแบบแคช / 1M | $1 | $0.40 | Astra 2.5× |
| คอนเท็กซ์ | 1.05M | 1.05M | เท่ากัน |
| เอาต์พุตสูงสุด | 128K | 128K | เท่ากัน |
| AutomationBench | 41.4 | 18.1 | Astra +23.3 จุด |
| Terminal-Bench 4.0 | 57.9 | 37.3 | Astra +20.6 จุด |
| OSWorld | 72.6 | 65.7 | Astra +6.9 จุด |
หากสองโมเดลใช้จำนวนโทเค็นเท่ากันและสำเร็จเท่าๆ กัน แน่นอนว่า Sol จะถูกกว่า
ด้วยราคาโทเค็นล้วนๆ Astra ต้องให้เวิร์กโฟลว์ใช้ “งานโทเค็นที่คิดเงิน” ราว 40% ของ Sol เพื่อชดเชยความต่างอัตรา 2.5×
แต่เวิร์กโฟลว์อัตโนมัติไม่ได้ประพฤติเช่นนั้นอย่างสะอาด คำลอง $1 ที่ล้มเหลวแล้วตามด้วยคำลอง $1 อีกครั้งมีต้นทุนมากกว่าคำขอ $1.50 ที่สำเร็จทันที เช่นเดียวกันเมื่อโมเดลที่อ่อนกว่าก่อให้เกิดการเรียกเครื่องมือมากขึ้น เส้นทางยาวขึ้น การทบทวนโดยมนุษย์ หรือการรันโค้ดซ้ำ
OpenAI รายงานว่า Astra ให้ผลลัพธ์ที่แข็งแกร่งขึ้นด้วยโทเค็นขาออกน้อยลงและ มีค่าใช้จ่าย API ต่อภารกิจโดยประมาณต่ำกว่า ในการประเมินหลายรายการ แม้อัตราต่อโทเค็นจะสูงกว่า
สำหรับแชทง่ายๆ การเขียนใหม่ การดึงข้อมูล การจัดประเภท และเวิร์กโหลดตรงไปตรงมาอื่นๆ ข้อโต้แย้งเดียวกันนี้อ่อนลงมาก
GPT-6 Astra เทียบกับ Gemini 3.8 Flash: คนละระดับราคามาก
Gemini 3.8 Flash อยู่ในระดับราคาที่ต่ำกว่า อัตราแนะนำของ Google คือ [$0.75/M ขาเข้า และ $3.75/M ขาออก] จนถึง 31 ธันวาคม 2026
นั่นทำให้ Astra แพงกว่าประมาณ 13.3× ทั้งขาเข้าและขาออกแบบไม่แคชในช่วงคอนเท็กซ์สั้นแบบ Standard
| มิติเปรียบเทียบ | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Gemini 3.8 Flash (ราคา) |
|---|---|---|---|---|
| ขาเข้า / 1M | $10.00 | $4.00 | $10.00 | $0.75* |
| ขาออก / 1M | $50.00 | $20.00 | $50.00 | $3.75* |
| ขาเข้าแบบแคช / 1M | $1.00 | $0.40 | $0.25 | $0.075* |
| คอนเท็กซ์ | 1.05M | 1.05M | 1M | 1,048,576 |
| เอาต์พุตสูงสุด | 128K | 128K | 128K | 65,536 |
| Terminal-Bench 4.0 | 57.9 | 37.3 | 55.8 | 19.1 |
| GPQA Diamond | 96.0 | 94.6 | 93.7 | 95.3 |
ราคาของ Gemini ในตารางเป็นอัตราแนะนำจนถึง
ตั้งแต่ 1 มกราคม 2027 อัตราขาเข้า/ขาออกจะเป็น $1.50/$7.50 ต่อโทเค็นล้าน และการอ่านแคชจะเป็น $0.15/M
ที่ $0.50/โทเค็นล้าน/ชั่วโมง ระหว่างปี 2026 และ $1/โทเค็นล้าน/ชั่วโมง ตั้งแต่มกราคม 2027 ราคาของ OpenAI ที่แสดงใช้งานช่วงคอนเท็กซ์สั้นแบบ Standard
การเปรียบเทียบนี้แสดงให้เห็นว่าการกำหนดเส้นทางโมเดลสามารถมีประสิทธิภาพมากกว่าการเลือกโมเดลเดียวสำหรับทุกคำขอ ใช้ Astra สำหรับงานวิศวกรรมระดับรีโพซิทอรีหรือระบบอัตโนมัติที่ยากที่สุด และส่งเวิร์กโหลดปริมาณมากที่เป็นกิจวัตรไปยังโมเดลที่ถูกกว่า อาจให้โปรไฟล์ต้นทุนโดยรวมที่ดีกว่าทั้งการใช้ Astra ทุกที่หรือไม่ใช้ Astra เลย
ต้นทุน GPT-6 Astra ตามชั้นการประมวลผล: Standard เทียบกับ Batch, Flex และ Fast
ชั้นการประมวลผลของ GPT-6 Astra สามารถเปลี่ยนบิลได้มากพอๆ กับการเลือกโมเดล
สำหรับคำขอ 300K ขาเข้า, 20K ขาออก จะใช้อัตราคอนเท็กซ์ยาว
| โหมดประมวลผล | ต้นทุนขาเข้า | ต้นทุนขาออก | รวม |
|---|---|---|---|
| Batch/Flex | $3.00 | $0.75 | $3.75 |
| Standard | $6.00 | $1.50 | $7.50 |
| Fast | $12.00 | $3.00 | $15.00 |
ดังนั้น Batch/Flex จึงลดบิลโทเค็นอย่างง่ายลงครึ่งหนึ่งเมื่อเทียบกับ Standard ในขณะที่ Fast ทำให้เป็นสองเท่า
Batch/Flex มีเหตุผลเมื่อเวลาเสร็จสิ้นยืดหยุ่นได้ เช่น การรันประเมิน การเติมข้อมูล การวิเคราะห์รีโพซิทอรีแบบออฟไลน์ งานเติมเอกสาร และงานวิจัยแบบอะซิงก์
Standard เป็นฐานที่เหมาะสมสำหรับเวิร์กโหลดโต้ตอบแบบโปรดักชันที่ไม่ได้เน้นย้ำว่าต้องถูกที่สุดหรือเร็วที่สุด
Fast อาจมีประโยชน์เมื่อเวลาที่ผ่านไปมีมูลค่าทางธุรกิจวัดได้ OpenAI อธิบาย Astra ที่เร็วขึ้นสูงสุด 2× ด้วยอัตราที่เป็นสองเท่าที่เกี่ยวข้อง Astra Fast ไม่มี SLA เวลาแฝง และไม่พร้อมใช้กับการพักข้อมูลในสหภาพยุโรป
ดังนั้นชั้นที่ดีที่สุดจึงเป็นการตัดสินใจทางธุรกิจ ไม่ใช่แค่การตั้งค่าประสิทธิภาพ
ต้นทุนต่อภารกิจสำเร็จคือเมตริกที่ดีกว่า
ลองพิจารณาเอเยนต์โค้ดดิ้งสมมุติสองตัว
สมมติว่าเอเยนต์ A ใช้โมเดลที่ถูกกว่า มีต้นทุน $0.80 ต่อการลอง และสำเร็จด้วยความน่าจะเป็น 55%; เอเยนต์ B ใช้ Astra มีต้นทุน $1.40 ต่อการลอง และสำเร็จด้วยความน่าจะเป็น 90% สำหรับภาพประกอบนี้เท่านั้น การลองแต่ละครั้งเป็นอิสระกัน แต่ละครั้งมีต้นทุนและความน่าจะเป็นสำเร็จเท่ากัน และมีการลองซ้ำจนกว่าจะสำเร็จ
ภายใต้สมมติฐานดังกล่าว ค่าใช้จ่ายโมเดลที่คาดหวังต่อภารกิจสำเร็จคือ ต้นทุนต่อการลอง หารด้วย ความน่าจะเป็นสำเร็จ:
เอเยนต์ A: $0.80 / 0.55 ≈ $1.45
เอเยนต์ B: $1.40 / 0.90 ≈ $1.56
อัตราส่วนนี้ทำให้เอเยนต์ B แพงกว่า ประมาณ 6.9% หรือราว 7% ตัวอย่างนี้ไม่ได้แสดงว่า Astra ประหยัดเงิน; มันแสดงให้เห็นว่าตัวคูณอัตราโทเค็นไม่เท่ากับตัวคูณต้นทุนต่อความสำเร็จ
สูตรนี้นับการลองซ้ำไว้แล้ว ดังนั้นอย่าเพิ่มเผื่อการลองซ้ำอีกชุด การทบทวนโดยมนุษย์ เครื่องมือ และค่าใช้จ่ายในการรัน สามารถเปลี่ยนการเปรียบเทียบได้หากวัดแยกกัน ความล้มเหลวจริงอาจมีความสัมพันธ์กัน ทำให้แบบจำลองง่ายๆ นี้ไม่เหมาะกับบางเวิร์กโฟลว์
สำหรับการประเมินจริง ให้หารค่าใช้จ่ายโมเดลและเครื่องมือทั้งหมดในชุดทดสอบด้วยจำนวนผลลัพธ์ที่ยอมรับได้ แล้วรายงานเวลาแก้ไขและความล้มเหลวที่ยังไม่แก้แยกต่างหาก ใช้ผลที่สังเกตได้เพื่อชี้ขาดว่างานใดคุ้มกับ Astra
วิธีลดค่าใช้จ่าย API ของ GPT-6 Astra
- รักษาคำขอประจำให้อยู่ต่ำกว่า 272K โทเค็นขาเข้า เมื่อเป็นไปได้ เพื่อไม่ให้การเพิ่มคอนเท็กซ์เล็กน้อยกระตุ้นราคาคอนเท็กซ์ยาวสำหรับคำขอทั้งฉบับ
- ออกแบบคำนำพรอมป์ตคงที่เพื่อการแคช คำสั่งระบบ แผนที่รีโพซิทอรี นโยบาย สคีมา และเอกสารสแตติก เหมาะเป็นผู้สมัครแคชมากกว่าพรอมป์ตที่ประกอบใหม่ซ้ำๆ
- ใช้การกำหนดเส้นทางโมเดล สงวน GPT-6 Astra สำหรับคำขอที่ความซับซ้อนให้ประโยชน์จริง ขณะที่ส่งงานดึงข้อมูล สรุป โค้ดเบา และการจัดประเภทที่คาดเดาได้ไปยังโมเดลที่ถูกกว่า
- เลือกชั้นประมวลผลที่เหมาะสม Batch หรือ Flex สามารถลดอัตราโทเค็นครึ่งหนึ่ง สำหรับเวิร์กโหลดที่ไม่ต้องการผลลัพธ์ทันที
- วัดเส้นทางเอเยนต์เต็มรูปแบบ การปรับที่เอาโทเค็นออก 20% แต่ทำให้การรันล้มเหลวมากขึ้น อาจทำให้ระบบแพงขึ้นแทนที่จะถูกลง
- จัดการประวัติอย่างแข็งขันด้วยการสรุป การดึงข้อมูล การใช้ซับเอเยนต์แบบมีขอบเขต และการเก็บผลลัพธ์เครื่องมือแบบคัดเลือก เพื่อป้องกันการเติบโตของคอนเท็กซ์ที่กลายเป็นปัญหาราคาเงียบๆ
คำถามที่พบบ่อย
Astra แพงกว่าโมเดลอื่นหรือไม่?
อัตราโทเค็นแบบ Standard คอนเท็กซ์สั้นของมันแพงกว่า Sol 2.5× และเท่ากับราคาพาดหัวของ Fable ในฝั่งขาเข้า/ขาออก Gemini Flash อยู่ในระดับราคาที่ต่ำกว่า การเปรียบเทียบข้างต้นแสดงว่าการใช้แคชและต้นทุนต่องานที่ยอมรับได้สามารถเปลี่ยนอันดับเชิงปฏิบัติได้
คำขอขนาดเล็กต้องจ่ายเต็มหน้าต่างคอนเท็กซ์หรือไม่?
ไม่ บิลสะท้อนโทเค็นที่ประมวลผล ช่วงคอนเท็กซ์ยาวจะใช้เมื่อขาเข้าเกิน 272,000 โทเค็น; แค่เลือกโมเดลที่มีหน้าต่างใหญ่ไม่ได้เปิดใช้งานช่วงนั้น
ควรประเมินการประหยัดจาก CometAPI อย่างไร?
ใช้อัตราขาเข้า ขาออก อ่านแคช และเขียนแคชของผู้ให้บริการที่ตรงกันกับองค์ประกอบโทเค็นเดียวกัน ความต่าง 20% ที่ระบุใช้กับหมวดหมู่เหล่านั้น; เพิ่มค่าใช้จ่ายอื่นๆ แยกต่างหากก่อนเปรียบเทียบบิลรวม
ข้อคิดส่งท้าย
ราคาของ Astra พิสูจน์ได้ง่ายที่สุดเมื่อความสามารถของมันปรับปรุงเวิร์กโฟลว์ที่ยากพอที่จะชดเชยอัตราที่สูงขึ้น เริ่มด้วยการทดสอบที่เป็นตัวแทน วัดผลลัพธ์ที่ยอมรับได้ และเปรียบเทียบค่าใช้จ่ายรวมและเวลาแก้ไขกับฐานเปรียบเทียบที่เหมาะสม
ควบคุมการเติบโตของคอนเท็กซ์ ออกแบบคำนำที่นำกลับมาใช้ซ้ำเพื่อการแคช และเลือกชั้นการประมวลผลที่เหมาะกับข้อกำหนดเวลา ใช้ GPT-6 Astra API บน CometAPI เมื่ออัตราที่เผยแพร่และฟีเจอร์ที่มีพร้อมเหมาะกับเวิร์กโหลด
