สรุปสั้นๆ
GLM-5.3-Flash คือโมเดลเน้นประสิทธิภาพแบบมัลติโมดัลเนทีฟของ Z.ai สำหรับเอเจนต์ด้านโค้ด เวิร์กโฟลว์เชิงภาพ เอกสารระดับมืออาชีพ และแอปพลิเคชันบริบทยาว สถาปัตยกรรมแบบไฮบริดถูกออกแบบเพื่อลดต้นทุนอินเฟอเรนซ์โดยยังคงความสามารถเชิงเอเจนต์ที่แข็งแรง
Z.ai รายงานการพัฒนาอย่างมากใน DeepSWE, Toolathlon, AutomationBench และ GDPval-AA v2 น้ำหนักเปิดภายใต้สัญญาอนุญาต MIT ยังทำให้การดีพลอยแบบส่วนตัวเป็นไปได้สำหรับทีมที่มีโครงสร้างพื้นฐานเพียงพอ
เหมาะที่สุด: เอเจนต์มัลติโมดัลปริมาณงานสูง งานกับรีโพสิทอรี การใช้งานเบราว์เซอร์หรือคอมพิวเตอร์ โค้ดดิ้งเชิงภาพ การผลิตเอกสาร และเวิร์กโฟลว์อื่นๆ ที่พรอมต์ยาวและการเรียกใช้เครื่องมือซ้ำๆ ทำให้ต้นทุนโทเคนเป็นประเด็นสำคัญ
GLM-5.3-Flash คืออะไร?
GLM-5.3-Flash เป็นโมเดลแบบ mixture-of-experts น้ำหนักเปิดจาก Z.ai มีพารามิเตอร์รวม 320B และเปิดใช้งาน 18B ต่อโทเคน รักษาคลังผู้เชี่ยวชาญขนาดใหญ่โดยไม่ต้องจ่ายค่าคอมพิวต์แบบ dense ในทุกโทเคน
“Flash” ไม่ได้หมายถึงการควอนไทซ์หรือกลั่น (distillation) อย่างง่ายจากรุ่นอื่น โมเดลนี้เริ่มจากฐานมัลติโมดัลที่เทรนใหม่ และใช้สถาปัตยกรรมและสูตรการฝึกที่ออกแบบใหม่ ความเข้าใจเชิงภาพแบบเนทีฟ การให้บริการบริบทยาวอย่างมีประสิทธิภาพ และต้นทุนดีพลอยที่ต่ำเป็นเป้าหมายเชิงสถาปัตยกรรมตั้งต้น
สเปกสำคัญ
| ข้อกำหนดอย่างเป็นทางการ | GLM-5.3-Flash |
|---|---|
| ประเภทโมเดล | โมเดลมัลติโมดัลแบบ mixture-of-experts เนทีฟ |
| พารามิเตอร์รวม/ที่ใช้งาน | 320B / 18B |
| หน้าต่างบริบท | 1,048,576 โทเคน |
| เอาต์พุตสูงสุด | สูงสุด 131,072 โทเคนในเส้นทาง API ที่รองรับ |
| อินพุต | ข้อความ รูปภาพ วิดีโอ และไฟล์ |
| เอาต์พุต | ข้อความ |
| กลไก Attention | Attention แบบสparse ผสานกับแบบเชิงเส้นด้วย IndexPool |
| การให้เหตุผล | เปิดตลอดเวลา; ระดับความพยายาม low, high, และ max |
| น้ำหนักเปิด | ใช่ ภายใต้สัญญาอนุญาต MIT |
| รหัสโมเดลใน API | glm-5.3-flash |
GLM-5.3-Flash ทำงานอย่างไร?
Hybrid Sparse + Linear Attention
Attention แบบเชิงเส้นจัดการการพึ่งพาแบบเฉพาะที่ได้อย่างมีประสิทธิภาพ ขณะที่ attention แบบสparse ใช้ตัวจัดทำดัชนีน้ำหนักเบาเพื่อดึงข้อมูลบริบทที่เกี่ยวข้องทั่วโลก IndexPool บีบอัดเวกเตอร์คีย์ของ indexer สี่ตัวให้เหลือหนึ่งก่อนการดึงแบบสparse ช่วยลดการใช้หน่วยความจำและเวลาแฝงเมื่อความยาวบริบทเพิ่มขึ้น
Z.ai รายงานการคำนวณ attention ต่อเลเยอร์ที่ลดลงและ KV cache ที่เล็กลง เมื่อเทียบกับสถาปัตยกรรมหลักของตน การประหยัดนี้ช่วยให้โมเดลรองรับบริบทระดับล้านโทเคนได้ที่ราคาต่อโทเคนที่ต่ำผิดปกติ

ภาพอย่างเป็นทางการ: การเปรียบเทียบสถาปัตยกรรมและประสิทธิภาพ**.ที่มา: เอกสารอย่างเป็นทางการของ Z.ai
mHC และการพรีเทรนแบบมัลติโมดัล
โมเดลใช้ Manifold-Constrained Hyper-Connections (mHC) ซึ่งเป็นการปรับปรุงด้านสเกลและประสิทธิภาพที่เสริมกับการออกแบบ attention ใหม่ การฝึกใช้คอร์ปัสมัลติโมดัล 30T โทเคน ทำให้สาขานี้เป็นฐานโมเดลมัลติโมดัลใหม่ ไม่ใช่เพียงการอัปเดตหลังการฝึก
วิชันแบบเนทีฟในลูปของเอเจนต์
โมเดลสามารถใช้ฟีดแบ็กเชิงภาพภายในเวิร์กโฟลว์แบบวนซ้ำ: สังเกตอินเทอร์เฟซหรืออาร์ติแฟกต์ที่เรนเดอร์ ทำการกระทำ ตรวจผลลัพธ์ และปรับแก้ ทำให้วิชันมีประโยชน์ต่อการทำงานด้าน frontend การใช้เบราว์เซอร์และคอมพิวเตอร์ งานออฟฟิศ วิดีโอ ฉาก 3D การสร้าง CAD และการพัฒนาเกม ไม่ใช่แค่คำบรรยายภาพครั้งเดียว
ผลการทดสอบเชิงเปรียบเทียบ
หมายเหตุวิธีวิจัย: ผลลัพธ์ด้านล่างเป็นข้อมูลที่ Z.ai รายงาน เฟรมเวิร์กประเมินผล โครงเอเจนต์ นโยบายเครื่องมือ การจัดการบริบท และเวลาให้ผลอาจเปลี่ยนผลลัพธ์ได้ ดังนั้นคะแนนจึงสะท้อนงานเฉพาะ ไม่ใช่อันดับสากลของโมเดล
ชุดทดสอบโค้ดดิ้งและเอเจนต์อย่างเป็นทางการของ Z.ai
| ชุดทดสอบ | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| Toolathlon Verified | 78.4 | 59.9 | 76.2 |
| AutomationBench | 48.8 | 26.2 | 41.0 |
| Agents' Last Exam | 26.3 | 20.4 | 27.0 |
| HLE w/ Tools | 55.3 | 54.7 | 57.9 |
| GDPval-AA v2 | 1773 | 1504 | 1582 |

ภาพอย่างเป็นทางการ: การเปรียบเทียบชุดทดสอบด้านโค้ดและเอเจนต์
ความก้าวหน้าที่ใหญ่ที่สุดเหนือGLM-5.2 ปรากฏใน DeepSWE, Toolathlon, AutomationBench และ GDPval-AA v2 แมทริกซ์เปิดตัวแสดงการเพิ่มขึ้น 22.6 คะแนนใน AutomationBench และ 269 Elo ใน GDPval-AA v2 GLM-5.3-Flash ใกล้เคียงกับ Claude Opus 4.8 บน Terminal-Bench ทำได้ดีกว่าในหลายงานเชิงเอเจนต์ และตามหลังใน HLE with Tools
GLM-5.3-Flash เทียบกับ GLM-5.3 เทียบกับ GLM-5.2
การเปรียบเทียบนี้แยกGLM-5.3-Flash ที่เน้นประสิทธิภาพ, GLM-5.3 ที่เน้นศักยภาพสูงสุด และGLM-5.2 รุ่นก่อนสำหรับโค้ดดิ้งและเอเจนต์
| มิติ | GLM-5.3-Flash | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| กลยุทธ์หลัก | โมเดลมัลติโมดัลที่เน้นประสิทธิภาพ | เรือธงที่เน้นศักยภาพสูงสุด | โมเดลโค้ดและเอเจนต์รุ่นก่อน |
| เชื้อสายฐานโมเดล | ฐานมัลติโมดัลใหม่ | อัปเกรดหลังการฝึกเหนือฐานเดิม | ฐาน GLM-5 รุ่นก่อน |
| อินพุตมัลติโมดัลเนทีฟ | ใช่ | ไม่ใช่จุดโฟกัสของรุ่นนี้ | ไม่ใช่จุดโฟกัสของรุ่นนี้ |
| จุดเน้นทางสถาปัตยกรรม | Attention แบบสparse ผสานเชิงเส้น | ศักยภาพสูงสุดด้านข้อความ โค้ด และเอเจนต์ | โค้ดดิ้งระยะยาวและเอเจนต์ |
| น้ำหนักเปิด | ใช่, MIT | ใช่ | ใช่ |
| เหมาะที่สุดสำหรับ | เอเจนต์มัลติโมดัลปริมาณงานสูง | ศักยภาพ GLM สูงสุด | เวิร์กโฟลว์โค้ด GLM ที่ตั้งหลักแล้ว |
ทางเลือกที่ใช้งานได้จริงขึ้นกับภาระงาน GLM-5.3 ยังคงเป็นตัวเลือกเพดานสูงกว่าเมื่อคุณภาพการให้เหตุผลหรือวิศวกรรมซอฟต์แวร์เป็นเรื่องสำคัญยิ่งกว่าราคา GLM-5.3-Flash เป็นค่าเริ่มต้นที่ดึงดูดกว่าหากต้องการวิชันแบบเนทีฟ การดีพลอยแบบเปิด และต้นทุนปฏิบัติการที่ต่ำลงไปพร้อมกัน
ราคาผ่าน API: Z.ai เทียบกับ CometAPI
| การใช้งาน | ราคาป้ายของ Z.ai | โปรโมชันเปิดตัวของ Z.ai | ราคาปัจจุบันของ CometAPI |
|---|---|---|---|
| อินพุต | $0.15 / 1M | $0.075 / 1M | $0.06 / 1M |
| อินพุตแคช | $0.03 / 1M | $0.015 / 1M | ไม่มีการระบุแยกต่างหาก |
| เอาต์พุต | $0.50 / 1M | $0.25 / 1M | $0.20 / 1M |
ราคามีผลตามเวลา: โปรโมชันลด 50% ของ Z.ai สิ้นสุดเวลา 24:00 วันที่ 9 กันยายน 2026 (UTC+8, Singapore time) ราคาของ CometAPI ข้างต้นตรวจสอบเมื่อ 27 สิงหาคม 2026 และอาจเปลี่ยนแปลง ควรยืนยันราคาจริงก่อนวางแผนงบประมาณการผลิต
ในช่วงเปิดตัว ราคาที่ระบุของ CometAPI สำหรับอินพุตและเอาต์พุตต่ำกว่าราคาโปรโมชันของ Z.ai อยู่ 20% ความต่างนี้มีนัยสำคัญสำหรับเอเจนต์ที่รันยาวซึ่งเรียกใช้เครื่องมือซ้ำ ตรวจสอบผลลัพธ์เชิงภาพ หรือเก็บพรอมต์ขนาดใหญ่ไว้
GLM-5.3-Flash ทำอะไรได้บ้าง?
โค้ดดิ้งเชิงภาพและการพัฒนา Frontend
โมเดลสามารถวิเคราะห์สกรีนช็อต อนุมานคอมโพเนนต์ที่ใช้ร่วมกันและกฎของระบบดีไซน์ สร้างแอปพลิเคชัน เรนเดอร์ เปรียบเทียบผลลัพธ์กับอ้างอิง และปรับแก้เลย์เอาต์ ไทโปกราฟี ระยะห่าง สี การครอป และอินเทอร์แอ็กชัน
การใช้งานเบราว์เซอร์และคอมพิวเตอร์
เมื่อไม่มี API แบบมีโครงสร้าง เอเจนต์สามารถให้เหตุผลจากอินเทอร์เฟซซอฟต์แวร์ที่มองเห็น ตัดสินใจว่าจะคลิกหรือพิมพ์ที่ใด ตรวจว่าการกระทำสำเร็จหรือไม่ และปรับขั้นตอนถัดไป
เอกสารออฟฟิศและระดับมืออาชีพ
Z.ai เน้นเวิร์กโฟลว์ PPTX, PDF, DOCX และ XLSX ลูปเชิงภาพช่วยตรวจจับข้อความล้น การเยื้องผิดพลาด องค์ประกอบทับซ้อน สไตล์ไม่สม่ำเสมอ และข้อบกพร่องอื่นที่การสร้างจากข้อความล้วนตรวจจับได้ไม่แม่น
งานวิจัยและการวิเคราะห์การเงิน
แพ็กหลักฐานขนาดใหญ่สามารถเชื่อมโยงกับรายงานที่ตรวจสอบย้อนกลับได้ ข้อสรุปที่มีแหล่งอ้างอิง โมเดลที่แก้ไขได้ และสมมุติฐานที่มีโครงสร้าง ผู้ใช้ยังควรกำหนดให้มีการตามรอยแหล่งที่มาและแยกแยะการเปิดเผยข้อมูลออกจากการวิเคราะห์
วิดีโอ, 3D, CAD และเวิร์กโฟลว์เกม
ความเป็นมัลติโมดัลแบบเนทีฟรองรับวิศวกรรมเชิงภาพแบบวนซ้ำในงานตัดต่อวิดีโอ ฉาก Blender CAD เชิงพารามิเตอร์ และการพัฒนาเกม มูลค่าเกิดจากการเรนเดอร์และการตรวจสอบซ้ำๆ ไม่ใช่การสร้างครั้งเดียว
น้ำหนักเปิดและการดีพลอยในเครื่อง
GLM-5.3-Flash มีน้ำหนักอย่างเป็นทางการบน Hugging Face ภายใต้สัญญาอนุญาต MIT เส้นทางการให้บริการที่รองรับในการ์ดโมเดลรวมถึง SGLang, vLLM, TokenSpeed, Transformers, KTransformers และ Unsloth
น้ำหนักเปิดไม่ได้ทำให้การดีพลอยเบา เช็กพอยต์ที่ปล่อยมีขนาดประมาณ 321B พารามิเตอร์ ดังนั้นการโฮสต์เองต้องการหน่วยความจำตัวเร่งจำนวนมาก การให้บริการแบบกระจาย ควอนไทซ์ หรือโครงสร้างพื้นฐานอินเฟอเรนซ์เฉพาะทาง การเข้าถึงผ่าน API โฮสต์อาจยังคุ้มค่ากว่า เว้นแต่ความเป็นส่วนตัว การปรับแต่ง หรือการควบคุมโครงสร้างพื้นฐานจะคุ้มกับภาระ
วิธีเข้าถึง GLM-5.3-Flash
Z.ai API
รหัสโมเดลอย่างเป็นทางการคือ glm-5.3-flash Z.ai แนะนำค่า temperature 1, top_p 0.95, reasoning_effort max และเปิดใช้งาน thinking รูปภาพถูกส่งผ่านบล็อกเนื้อหา image_url
CometAPI
GLM-5.3-Flash พร้อมใช้งานผ่าน CometAPI ด้วยเวิร์กโฟลว์ chat-completions ที่เข้ากันได้กับ OpenAI ทำให้ทีมทดสอบคู่กับผู้ให้บริการอื่นได้โดยไม่ต้องดูแลอินทิเกรชันแยกสำหรับแต่ละราย
curl https://api.cometapi.com/v1/chat/completions \\ -H "Content-Type: application/json" \\ -H "Authorization: Bearer YOUR_COMETAPI_KEY" \\ -d '{ "model": "glm-5.3-flash", "messages": [ {"role": "user", "content": "Explain hybrid attention in three bullets."} ] }'
ขั้นตอนถัดไป: เปิดหน้ารุ่น GLM-5.3-Flash, ยืนยันราคาและความพร้อมให้บริการปัจจุบัน และทดสอบภาระงานตัวแทนก่อนเปลี่ยนเส้นทางการผลิต
บทสรุปสุดท้าย
GLM-5.3-Flash เปลี่ยนสมดุลระหว่างต้นทุนและศักยภาพมากกว่าการดันเพดานคะแนนเบนช์มาร์ก ความเป็นมัลติโมดัลแบบเนทีฟ การรองรับบริบทยาว น้ำหนักเปิด ผลงานเชิงเอเจนต์ที่แข็งแรง และราคาต่อโทเคนที่ต่ำ ทำให้มันน่าดึงดูดสำหรับระบบปริมาณสูงที่ทำงานหลายสเต็ปอย่างต่อเนื่อง
เลือกเรือธงที่สูงกว่าเมื่อคุณภาพการให้เหตุผลสูงสุดสำคัญโดยไม่คำนึงถึงต้นทุน ทดสอบโมเดลมัลติโมดัลคู่แข่งเมื่อการรับรู้ภาพหรือวิดีโอที่กว้างเป็นข้อกำหนดหลัก เลือกGLM-5.3-Flash เมื่อเอเจนต์มัลติโมดัล น้ำหนักเปิดสำหรับดีพลอย และประสิทธิภาพการดำเนินงานต้องอยู่ร่วมกัน
คำถามที่พบบ่อย
GLM-5.3-Flash เป็นโอเพ่นซอร์สหรือไม่?
คำอธิบายที่ถูกต้องคือ “น้ำหนักเปิด” GLM-5.3-Flash มีน้ำหนักเผยแพร่ภายใต้สัญญาอนุญาต MIT ช่วยให้ดีพลอยแบบโฮสต์เองและนำกลับไปใช้ได้กว้าง
GLM-5.3-Flash ดีสำหรับเอเจนต์เขียนโค้ดหรือไม่?
GLM-5.3-Flash ทำผลงานเปิดตัวที่แข็งแรงบน Terminal-Bench 2.1, DeepSWE, Toolathlon, AutomationBench และ GDPval-AA v2 ทีมควรทดสอบในสแตกเอเจนต์ของตนเองเพราะเครื่องมือและการออร์เคสเตรตมีผลต่อผลลัพธ์สุดท้าย
GLM-5.3-Flash มีค่าใช้จ่ายเท่าไร?
GLM-5.3-Flash ถูกระบุโดย Z.ai ที่ $0.15 ต่อหนึ่งล้านโทเคนอินพุต, $0.03 ต่อหนึ่งล้านโทเคนอินพุตแบบแคช และ $0.50 ต่อหนึ่งล้านโทเคนเอาต์พุต ราคาโปรโมชันชั่วคราวและราคาตัวแทนจำหน่ายปรากฏในส่วนราคาเหนือ
GLM-5.3-Flash ดีพลอยในเครื่องได้หรือไม่?
ได้ GLM-5.3-Flash มีน้ำหนักสาธารณะและรองรับหลายเฟรมเวิร์กสำหรับให้บริการ แต่เช็กพอยต์ต้องการโครงสร้างพื้นฐานอินเฟอเรนซ์ระดับจริงจัง
