ข้อกำหนดทางเทคนิคของ GLM-5.3
| ข้อกำหนด | GLM-5.3 |
|---|---|
| ผู้พัฒนา | Z.ai / Zhipu AI |
| วันเผยแพร่ | August 14, 2026 |
| ประเภทโมเดล | โมเดลฐานเรือธง |
| อินพุต | ข้อความ |
| เอาต์พุต | ข้อความ |
| หน้าต่างบริบท | 1,000,000 tokens |
| ผลลัพธ์สูงสุด | 128,000 tokens |
| การคิด | หลายโหมด |
| การสตรีม | ใช่ |
| การเรียกใช้ฟังก์ชัน | ใช่ |
| ผลลัพธ์แบบมีโครงสร้าง | ใช่ |
| แคชบริบท | ใช่ |
| MCP | ใช่ |
| การใช้งานหลัก | การเขียนโค้ด, เอเจนต์, วิศวกรรม, ความมั่นคงปลอดภัยไซเบอร์ |
ที่เก็บโมเดลสาธารณะของ Z.ai ยังคงแสดง GLM-5.2 อย่างเด่นชัด มากกว่าสิ่งประดิษฐ์ของ GLM-5.3 ที่ดาวน์โหลดได้ ดังนั้นข้อกำหนดที่ยังไม่ได้เผยแพร่ควรถูกระบุอย่างชัดเจนว่าไม่ยืนยัน
GLM-5.3 คืออะไร?
GLM-5.3 เป็นรุ่นล่าสุดของตระกูล GLM ของ Z.ai และสะท้อนการเปลี่ยนแปลงไปสู่ระบบ AI ที่สามารถทำงานด้านความปลอดภัยและวิศวกรรมที่ซับซ้อนได้อย่างอัตโนมัติ
การประกาศครั้งนี้โดดเด่นเป็นพิเศษเพราะความมั่นคงปลอดภัยไซเบอร์ไม่ได้ถูกนำเสนอเพียงเป็นหมวดหมู่มาตรฐานอีกหนึ่งรายการ Z.ai กำลังใช้ GLM-5.3 เพื่อสาธิตระบบ AI ที่สามารถค้นหาช่องโหว่ซอฟต์แวร์และมีส่วนร่วมในเวิร์กโฟลว์การพัฒนาโจมตี
Reuters รายงานว่า Z.ai มีแผนจะปล่อยโมเดลสู่สาธารณะหลังจากเสร็จสิ้นการประเมินด้านความปลอดภัย ขณะที่ความสามารถขั้นสูงจะถูกจำกัดในระยะแรกผ่านกลไกการเข้าถึงที่เชื่อถือได้แบบ trusted-access mechanism
นี่คือการเปลี่ยนจุดเน้นที่สำคัญจาก GLM-5.2
GLM-5.2 ถูกวางตำแหน่งหลักรอบ ๆ วิศวกรรมซอฟต์แวร์ระยะยาวและการเขียนโค้ดเชิงเอเจนต์ หน้าการวิจัยของ Z.ai ในเดือนมิถุนายนอธิบาย GLM-5.2 ว่า "Built for Long-Horizon Tasks."
GLM-5.3 นำปรัชญาเชิงเอเจนต์นั้นเข้าสู่โดเมนที่อ่อนไหวกว่ามาก:
วิศวกรรมซอฟต์แวร์ → การค้นหาช่องโหว่ → การป้องกันไซเบอร์ → ความปลอดภัยเชิงรุกแบบควบคุมได้
คุณสมบัติหลักของ GLM-5.3 คืออะไร?
การให้เหตุผลที่เน้นความมั่นคงปลอดภัยไซเบอร์
ความสามารถหัวข้อใหญ่คือความมั่นคงปลอดภัยไซเบอร์
GLM-5.3 ทำได้:
84.5% บน CyberGym
CyberGym ประเมินความสามารถของระบบ AI ในการระบุช่องโหว่ซอฟต์แวร์ ผลลัพธ์นี้สูงกว่าคะแนนที่รายงานของ Mythos 5 เล็กน้อยที่ 83.8%
นั่นสำคัญเพราะความมั่นคงปลอดภัยไซเบอร์ต้องการมากกว่าการสร้างโค้ดที่ถูกต้องตามไวยากรณ์
เอเจนต์ด้านความปลอดภัยที่มีความสามารถต้องสามารถ:
- เข้าใจโค้ดที่ไม่คุ้นเคย
- ระบุพื้นผิวการโจมตี
- ตั้งสมมติฐานเกี่ยวกับช่องโหว่
- ติดตามการไหลของข้อมูลและการควบคุม
- ตรวจสอบความถูกต้องของสมมติฐาน
- พัฒนาหลักฐานแนวคิดที่เหมาะสม
- ระบุว่าช่องโหว่นั้นสามารถใช้ประโยชน์ได้จริงหรือไม่
คะแนน CyberGym ของ GLM-5.3 บ่งชี้ถึงความก้าวหน้าที่มีนัยสำคัญในส่วนแรกของสายโซ่นี้
การค้นหาช่องโหว่ที่แข็งแกร่ง
คะแนน CyberGym 84.5% อาจเป็นผลลัพธ์แรกที่น่าประทับใจที่สุด
มันทำให้ GLM-5.3 เหนือกว่า Mythos 5 เล็กน้อยในการระบุช่องโหว่:
| โมเดล | CyberGym |
|---|---|
| GLM-5.3 | 84.5% |
| Mythos 5 | 83.8% |
ส่วนต่างมีเพียง 0.7 จุด ดังนั้นการอธิบายว่า GLM-5.3 เหนือกว่าอย่างเด็ดขาดจึงจะทำให้เข้าใจผิด
ประเด็นที่น่าสนใจกว่าคือโมเดลแบบเปิดน้ำหนักจาก Z.ai กำลังก้าวเข้าสู่ระดับสมรรถนะเดียวกันกับระบบความมั่นคงปลอดภัยที่ถูกจำกัดอย่างเข้มงวด
การพัฒนาเอ็กซ์พลอยต์ยังเป็นจุดอ่อนอยู่
GLM-5.3 ไม่ได้เหนือกว่าทุกงานในด้านความมั่นคงปลอดภัยไซเบอร์
บน ExploitBench:
| โมเดล | ExploitBench |
|---|---|
| GLM-5.3 | 54.4% |
| Mythos 5 | 78.0% |
นั่นคือช่องว่าง 23.6-point
สิ่งนี้เผยให้เห็นความแตกต่างสำคัญ:
การค้นหาช่องโหว่ไม่ใช่เรื่องเดียวกับการใช้ประโยชน์จากมันได้อย่างน่าเชื่อถือ
GLM-5.3 ดูมีความสามารถสูงในการระบุจุดอ่อน แต่ผลลัพธ์ระยะแรกบ่งชี้ว่าการแปลงข้อค้นพบเหล่านั้นให้กลายเป็นการพัฒนาเอ็กซ์พลอยต์ที่เชื่อถือได้ยังคงยากกว่าอย่างมาก
สำหรับทีมความมั่นคงปลอดภัยระดับองค์กร สิ่งนี้ทำให้โมเดลน่าสนใจในฐานะผู้ช่วยวิเคราะห์ช่องโหว่เชิงป้องกัน มากกว่าที่จะเป็นเครื่องยนต์อัตโนมัติเชิงรุกเพียงอย่างเดียว
GLM-5.3 เทียบกับ GLM-5.2
GLM-5.2 ให้ค่าอ้างอิงที่ได้รับการยืนยันซึ่งมีประโยชน์ที่สุด
| คุณลักษณ์ | GLM-5.2 | GLM-5.3 |
|---|---|---|
| สถานะ | เปิดตัวแล้ว | ประกาศแล้ว |
| การวางตำแหน่งหลัก | เอเจนต์ระยะยาว | ความมั่นคงปลอดภัยไซเบอร์ + เอเจนต์ |
| การเขียนโค้ด | ยอดเยี่ยม | คาดว่าจะยังคงแข็งแกร่ง |
| ความมั่นคงปลอดภัยไซเบอร์ | ศักยภาพสูง | เน้นเป็นเรือธงอย่างชัดเจน |
| CyberGym | — | 84.5% |
| ExploitBench | — | 54.4% |
| บริบท | 1M | ยังไม่ยืนยัน |
| พารามิเตอร์ | ~753B | ยังไม่ยืนยัน |
| ไลเซนส์ | MIT | ประกาศแบบ open-weight |
| ราคา API | เผยแพร่แล้ว | ยังไม่เผยแพร่ |
| น้ำหนักโมเดลสาธารณะ | พร้อมใช้งาน | วางแผน |
สถาปัตยกรรมที่ยืนยันแล้วของ GLM-5.2 มีประมาณ 753B พารามิเตอร์ และแคตตาล็อกโมเดลสาธารณะของมันยังคงแสดงรุ่น 753B และเวอร์ชัน FP8
GLM-5.2 ยังทำได้ 81.0 บน Terminal-Bench 2.1 และ 62.1 บน SWE-bench Pro ตามรายงานจากบุคคลที่สามที่อ้างอิงจากวัสดุการประเมินโมเดลของ Z.ai
แต่ตัวเลขเหล่านั้นควรยังคงเป็นเกณฑ์มาตรฐานของ GLM-5.2 ไม่ควรถูกย attributed ให้กับ GLM-5.3
GLM-5.3 เทียบกับ Mythos 5
นี่เป็นการเปรียบเทียบเกณฑ์มาตรฐานที่มีความหมายที่สุดในตอนนี้
| เกณฑ์วัด | GLM-5.3 | Mythos 5 | ความแตกต่าง |
|---|---|---|---|
| CyberGym | 84.5% | 83.8% | +0.7 pp |
| ExploitBench | 54.4% | 78.0% | −23.6 pp |
ผลลัพธ์ทำให้ได้ข้อสรุปที่มีความละเอียดอ่อน
GLM-5.3 ชนะในการระบุช่องโหว่
แต่:
Mythos 5 ยังคงแข็งแกร่งกว่ามากในการพัฒนาเอ็กซ์พลอยต์
ดังนั้นการพูดว่า "GLM-5.3 ชนะ Mythos 5" จะเป็นการตีความข้อมูลที่มีอยู่ไม่ถูกต้อง
คำอธิบายที่ดีกว่าคือ:
GLM-5.3 ไปถึงระดับสมรรถนะของ Mythos 5 ในการค้นหาช่องโหว่ ขณะที่ยังตามหลังในการพัฒนาเอ็กซ์พลอยต์