สรุปสั้นๆ Z.ai เปิดตัว GLM-5.3 เมื่อวันที่ 14 สิงหาคม 2026 โดยใช้โมเดลฐาน Mixture-of-Experts ที่มีพารามิเตอร์ ~743–753B ตัวเดียวกันกับ GLM-5.2 ทุกความก้าวหน้าเกิดจากการขยายโพสต์เทรนนิงบนสภาพแวดล้อมระยะยาว ผลลัพธ์คือการปรับปรุงสัมพัทธ์ ~50% บน Code Bench ภายในของ Z.ai, ขึ้นเป็น SOTA แบบโอเพนซอร์สบน Terminal-Bench 3.0 (4.6 → 28.3) และ Agents’ Last Exam, คะแนนด้านเอเจนต์ดีขึ้นอย่างมาก และประสิทธิภาพด้านความมั่นคงปลอดภัยในระดับ state-of-the-art ที่เกิดขึ้นใหม่ (CyberGym 84.5%) ประสิทธิภาพเชิงโทเคนก็ดีขึ้นด้วย
น้ำหนักโมเดลคาดว่าจะปล่อยประมาณสองสัปดาห์หลังเปิดตัว ภายหลังการแข็งความปลอดภัย นักพัฒนาสามารถเข้าถึงโมเดล GLM ที่เกี่ยวข้องและทดสอบเวิร์กโฟลว์ได้อย่างมีประสิทธิภาพผ่านแพลตฟอร์มแบบรวม เช่น CometAPI
ประเด็นสำคัญ
- โมเดลฐานเดียวกับ GLM-5.2; ความก้าวหน้าทั้งหมดจากโพสต์เทรนนิง (IndexShare, SAO, เฟรมเวิร์ก slime + สภาพแวดล้อมและคอมพิวต์ที่มากขึ้น)
- การเขียนโค้ด: Terminal-Bench 3.0 4.6 → 28.3; DeepSWE v1.1 46.2 → 66.9; Z.ai Code Bench ภายในดีขึ้น ~50% พร้อมโทเคนเอาต์พุตน้อยลง
- เอเจนต์: AutomationBench 26.2 → 48.2; Agents’ Last Exam 23.8 → 28.5; GDPval-AA v2 1508 → 1769
- ไซเบอร์: CyberGym 77.2 → 84.5 (SOTA, แซง Mythos 5 และ GPT-5.6 Sol); ExploitBench มากกว่าสองเท่า (24.4 → 54.4) ผลลัพธ์จริง: พบช่องโหว่ 2,436 รายการใน 269 โปรเจ็กต์
- สเปคแกนสถาปัตยกรรมไม่เปลี่ยน: คอนเท็กซ์ 1M, เอาต์พุตสูงสุด 128K โทเคน, การคิดเปิดตลอดเวลาพร้อมระดับความพยายามต่ำ/สูง/สูงสุด
- การเข้าถึง: เปิดใช้ผ่าน GLM Coding Plan และ ZCode; API ทั่วไปและน้ำหนักแบบเปิด (คาดว่าแนว MIT) จะตามหลังการทบทวนความปลอดภัย CometAPI มีทางเข้าที่เข้ากันได้กับ OpenAI สำหรับทดสอบแบบเคียงข้างและส่งงานโปรดักชัน
GLM-5.3 เทียบกับ GLM-5.2 โดยย่อ
| มิติ | GLM-5.3 | GLM-5.2 | ผู้ชนะ / หมายเหตุ |
|---|---|---|---|
| โมเดลฐาน | MoE ~743–753B ตัวเดียวกัน | ตัวเดียวกัน | เหมือนกัน |
| โพสต์เทรนนิง | ขยายสภาพแวดล้อมอย่างหนัก | สแตกก่อนหน้า | 5.3 |
| Terminal-Bench 3.0 | 28.3 | 4.6 | 5.3 (มาก) |
| DeepSWE v1.1 | 66.9 | 46.2 | 5.3 |
| Internal Code Bench (Max) | 34.5% @ ~75K โทเคน | 23.4% @ ~96K โทเคน | 5.3 (ประสิทธิภาพ + คุ้มค่า) |
| Agents’ Last Exam | 28.5 | 23.8 | 5.3 |
| AutomationBench | 48.2 | 26.2 | 5.3 |
| CyberGym | 84.5 (SOTA) | 77.2 | 5.3 |
| ExploitBench | 54.4 | 24.4 | 5.3 |
| GDPval-AA v2 | 1769 | 1508 | 5.3 |
| คอนเท็กซ์ / เอาต์พุตสูงสุด | 1M / 128K | 1M / คล้ายกัน | เหมือนกัน |
| การคิด | เปิดตลอดเวลา (low/high/max) | ยืดหยุ่นกว่าเดิม | 5.3 (เปิดตลอดเวลา) |
| น้ำหนักแบบเปิด | ~2 สัปดาห์หลังเปิดตัว (วางแผน) | มีแล้ว (MIT) | 5.2 ตอนนี้ |
| ช่องทางการเข้าถึงหลักตอนนี้ | Coding Plan / ZCode | API + น้ำหนัก + Coding Plan | 5.2 โตเต็มที่กว่า |
บทนำ: โพสต์เทรนนิงมอบก้าวกระโดดเชิงเจนเนอเรชัน
กลางเดือนสิงหาคม 2026 ชุมชน AI ได้เห็นการไล่ระดับในสนามโอเพนน้ำหนักอีกครั้ง Z.ai (แบรนด์สากลของทีมเดิม Zhipu AI / ChatGLM) เปิดตัว GLM-5.3 เพียง 59 วันหลัง GLM-5.2 การประกาศชัดเจนผิดปกติ: โมเดลฐานยังคงเหมือนเดิม “การขยายโพสต์เทรนนิงคือทั้งหมดที่เราทำสำหรับ GLM-5.3,” บริษัทระบุ
ข้อความนั้นสำคัญ หลายปีที่ผ่านมามีเรื่องเล่าว่า “โมเดลใหญ่ชนะ” GLM-5.3 แสดงให้เห็นว่าการขยายสภาพแวดล้อมการเรียนรู้ด้วยการเสริมกำลัง, ความหลากหลายของงานระยะยาว, และโครงสร้างระบบ สามารถสร้างผลลัพธ์ใหญ่ในงานเขียนโค้ด งานเชิงเอเจนต์ และแม้กระทั่งเวิร์กโหลดความมั่นคงปลอดภัย โดยไม่ต้องพรีเทรนใหม่ ตัวเลขใหญ่พอในหลายเบนช์มาร์กยาก จนผู้สังเกตอิสระบรรยายว่าก้าวกระโดดนี้เป็นเชิงคุณภาพมากกว่าเพิ่มทีละน้อย ภาพรวมฟีเจอร์ เบนช์มาร์ก และหมายเหตุการเข้าถึงของ GLM-5.3
GLM-5.3 เทียบกับ GLM-5.2: อะไรเปลี่ยนจริง?
ความเข้าใจผิดใหญ่ที่สุดคือคิดว่า GLM-5.3 เป็น “GLM-5.2 ที่ใหญ่กว่า”
ไม่ใช่
โมเดลฐานยังคงเหมือนเดิมตาม Z.ai นวัตกรรมหลักคือการ “ขยายโพสต์เทรนนิง” Z.ai เน้นสามเสาหลัก:
- ปรับปรุงระบบภายใน slime — เทรนนิงดีขึ้น
- ขยายสภาพแวดล้อม — ไปป์ไลน์ที่สังเคราะห์สภาพแวดล้อมที่รันได้ ตรวจสอบได้ ระยะยาว จากเวิร์กโฟลว์มืออาชีพจริง เอเจนต์วิจัยสกัดแพทเทิร์นงาน; เอเจนต์ผู้ตัดสินตรวจสอบความสามารถในการแก้ได้; ตัวตรวจสอบถูกสร้างโดยไม่เข้าถึงวิธีแก้เชิงอ้างอิงเพื่อลดการ “โกงรางวัล”
- ใช้ SAO + การบีบอัด ต่อเนื่อง — ช่วยให้ผลลัพธ์คงอยู่บนทราจεκทอรีระยะยาวแทนที่จะยุบในทราจสั้น ๆ – ความสอดคล้องการโรลเอาต์ (ควบคุมความต่าง log-prob ราว ~1e-7), แคชแบบลำดับชั้น, รองรับครูหลายคน, การจัดตารางงานคำนึงโหลด, และรายงานการเพิ่ม throughput ปลาย-ปลาย >2.3× บนงาน RL โค้ดระยะยาว
การเปลี่ยนแปลงเหล่านี้สร้างการปรับปรุงที่วัดได้ทั่วชุดงานเขียนโค้ด เอเจนต์ และไซเบอร์ ที่สำคัญ กำไรสัมพัทธ์ใหญ่ที่สุดปรากฏบนการทดสอบที่ยากและฐานต่ำ ซึ่งเป็นรูปแบบที่คาดเมื่อผลักโมเดลไปสู่ระบอบที่ก่อนหน้านี้รับมือได้ไม่เสถียร
ผลลัพธ์คือการอัปเกรดที่เน้น “พฤติกรรมและความสามารถ” มากกว่า “สถาปัตยกรรม”
GLM-5.3 เทียบกับ GLM-5.2: เปรียบเทียบฟีเจอร์
1. โพสต์เทรนนิงแบบขยายแทนการพรีเทรนโมเดลฐานใหม่
Z.ai อธิบายว่าการขยายโพสต์เทรนนิงคือสูตรทั้งหมดของ GLM-5.3 เอเจนต์วิจัยแปลงแพทเทิร์นจากงานจริงเป็นงานที่รันได้พร้อมสถานะแอบแฝงและการพึ่งพาหลายขั้นตอน เอเจนต์ผู้ตัดสินตรวจสอบว่าทุกงานแก้ได้ ตัวตรวจสอบถูกสร้างขึ้นโดยไม่เห็นวิธีแก้อ้างอิง จากนั้นทดสอบกับสถานะ oracle, no-op, และยังไม่แก้ เพื่อบรรเทาทางลัดรางวัล
ระบบยังต้องการมนุษย์รีวิว และ Z.ai ระบุชัดว่าการสร้างสภาพแวดล้อมและการตรวจสอบแบบอัตโนมัติเต็มรูปแบบยังเป็นงานอนาคต ข้อแม้นี้เพิ่มความน่าเชื่อถือของคำกล่าว: นี่คือไปป์ไลน์เทรนนิงขนาดใหญ่ ไม่ใช่การอ้างว่าสภาพแวดล้อมสังเคราะห์สามารถปกครองตัวเองได้แล้ว
2. โค้ดระยะยาวแข็งแรงขึ้น
GLM-5.3 เก่งขึ้นในงานรีโพซิทอรี งานเทอร์มินัล โครงสร้างพื้นฐาน ML การปรับแต่งประสิทธิภาพ และการส่งมอบซอฟต์แวร์หลายขั้นตอน บน Z.ai Code Bench (การประเมินภายในเพื่อสะท้อนสถานการณ์ผู้ใช้จริง) Z.ai รายงานว่าผลงานโค้ดดีขึ้นราว 50% เทียบกับ GLM-5.2
ผลด้านประสิทธิภาพสำคัญพอ ๆ กับคะแนน ที่ระดับ Max GLM-5.3 ได้ 34.5% ใช้โทเคนเอาต์พุตราว 75K ต่อโจทย์ เทียบกับ GLM-5.2 ที่ 23.4% ใช้ 96K เป็นกำไรคุณภาพ 11.1 จุด โดยใช้โทเคนน้อยลงราว 22% ที่ระดับ High GLM-5.3 ทำได้ 31.4% ใช้ราว 50K โทเคน แซง Claude Opus 4.8 ที่ 29.5% ใช้ 120K ในชาร์ตแรกฝ่ายเดียวกัน ขณะที่ Claude Fable 5 ยังสูงกว่า 39.5% ที่ Max
3. ความสามารถไซเบอร์ซีเคียวริตี้ที่เกิดขึ้นใหม่
Z.ai เพิ่มสภาพแวดล้อมค้นหาช่องโหว่ระหว่างโพสต์เทรนนิง ตามรายงานเปิดตัว ความสามารถเติบโตเกินการหา flaw โดดเดี่ยว: โมเดลเริ่มให้เหตุผลข้ามหลายขั้นของโซ่การเจาะ
คะแนนสาธารณะชี้ทั้งความก้าวหน้าและข้อจำกัด GLM-5.3 นำตารางเทียบของ Z.ai บน CyberGym ที่ 84.5 เทียบกับ 77.2 ของ GLM-5.2 บน ExploitBench เพิ่มเท่าตัวกว่า GLM-5.2 ไปที่ 54.4 เทียบกับ 24.4 แต่ยังตามหลัง Fable 5 ที่ 78.0 และ GPT-5.6 Sol ที่ 76.5 บน ExploitGym สำเร็จ 105 งานในงบเวลาปรับปกติสองชั่วโมงและ 130 ในหกชั่วโมง เทียบกับ 29 และ 39 ของ GLM-5.2; GPT-5.6 Sol และ Fable 5 ยังนำหน้าอย่างมาก
ความสามารถเหล่านี้เป็นแบบสองด้าน องค์กรควรจำกัดการเข้าถึงโมเดล ทำ sandbox เครื่องมือ บันทึกการกระทำ ต้องการการอนุญาตสำหรับการสแกน และคงมนุษย์ในลูปเพื่อการยืนยันและเปิดเผยช่องโหว่
4. การให้เหตุผลเปิดตลอดเวลาพร้อมสามระดับความพยายาม
GLM-5.3 รองรับ low, high, และ max ระดับความพยายาม ในทางตรงกันข้ามกับ GLM-5.2 มันไม่รองรับการปิดการคิด การผสานเดิมที่ส่ง thinking.type: "disabled" ต้องเปลี่ยนค่าเป็น "enabled" ก่อนสลับรหัสโมเดล มิฉะนั้น Z.ai ระบุว่าคำขอจะล้มเหลว
ใช้ low สำหรับการแก้ไขแบบโต้ตอบและการแปลงความเสี่ยงต่ำ ใช้ high สำหรับงานรีโพซิทอรีขนาดใหญ่ และใช้ max สำหรับโค้ดยากหรือวิเคราะห์ความปลอดภัย ระดับสูงควรประเมินด้าน latency และค่าใช้จ่าย เพราะคำตอบที่แข็งแรงกว่าไม่จำเป็นต้องคุ้มค่าที่สุดเสมอ
5. throughput เทรนนิงดีขึ้นผ่าน slime
GLM-5.3 ยังคงใช้ slime เฟรมเวิร์กโอเพนซอร์สของ Z.ai โดยใช้ Megatron ฝั่งเทรนนิงและ SGLang ฝั่งโรลเอาต์ Z.ai รายงานการเพิ่มสำหรับ top-p masking, การกลั่นแบบ on-policy ทั้งแบบ top-k และเต็มคำศัพท์, การสลับครู, แคชชิง, และการจัดแนวตัวเลขระหว่างเทรนนิงกับโรลเอาต์ที่แน่นขึ้น รายงานเปิดตัวระบุว่าเฉลี่ยความต่าง log-prob คุมอยู่ที่ระดับ 1e-7 ต่ำกว่าเซ็ตอัปก่อนหน้าเกิน 99.99%
การจัดตารางตระหนักโหลดงานและบาลานซ์โหลดช่วยเพิ่ม throughput RL ปลาย-ปลายกว่า 2.3 เท่าในงานโค้ดระยะยาว นี่เป็นการปรับปรุงโครงสร้างฝึก ไม่ใช่การรับประกันอินเฟอเรนซ์ฝั่งผู้ใช้ แต่ช่วยอธิบายว่า Z.ai ขยายทราจที่ยาวและหลากหลายในหนึ่งเดือนได้อย่างไร
6. น้ำหนักแบบเปิดล่าช้าเพื่อทบทวนความปลอดภัย
Z.ai เรียก GLM-5.3 ว่าเป็นโมเดลแบบโอเพนน้ำหนัก แต่วันเปิดตัวยังดาวน์โหลดน้ำหนักไม่ได้ บริษัทระบุว่าจะปล่อยสองสัปดาห์หลังเปิดตัว ภายหลังการประเมินและแข็งความปลอดภัย นี่ต่างจาก GLM-5.2 ซึ่งน้ำหนัก MIT-licensed มีแล้วบน Hugging Face
สำหรับทีมส่วนใหญ่ การทดสอบผ่าน API โฮสต์ยังเป็นก้าวแรกที่ปฏิบัติได้ โมเดลมีขนาดใหญ่ และน้ำหนักแบบเปิดไม่ได้ลบค่าใช้จ่ายฮาร์ดแวร์อินเฟอเรนซ์ การควอนไทซ์ การให้บริการ การมอนิเตอร์ และการควบคุมความปลอดภัย
GLM-5.3 เทียบกับ GLM-5.2: การปรับปรุงเบนช์มาร์ก
ตารางต่อไปนี้ใช้ข้อมูลเปิดตัวทางการของ Z.ai “Change” เป็นการคำนวณง่ายจากคะแนนที่รายงาน เปอร์เซ็นต์สัมพัทธ์อาจดูมากเมื่อฐาน GLM-5.2 ต่ำ จึงแสดงการเปลี่ยนแปลงแบบสัมบูรณ์ด้วย
| เบนช์มาร์ก | GLM-5.2 | GLM-5.3 | การเปลี่ยนแปลงแบบสัมบูรณ์ | การเปลี่ยนแปลงแบบสัมพัทธ์ |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 81.0 | 88.2 | +7.2 | +8.9% |
| Terminal-Bench 3.0 | 4.6 | 28.3 | +23.7 | +515.2% |
| DeepSWE v1.1 | 46.2 | 66.9 | +20.7 | +44.8% |
| NL2Repo | 48.9 | 58.0 | +9.1 | +18.6% |
| ProgramBench Almost Solved | 9.5 | 19.0 | +9.5 | +100.0% |
| FrontierSWE | 67.5 | 78.1 | +10.6 | +15.7% |
| SWE-Marathon v1.1 | 19.4 | 42.5 | +23.1 | +119.1% |
| PostTrainBench | 31.7 | 39.8 | +8.1 | +25.6% |
| CyberGym | 77.2 | 84.5 | +7.3 | +9.5% |
| ExploitBench | 24.4 | 54.4 | +30.0 | +123.0% |
| ExploitGym, 2-hour tasks | 29 | 105 | +76 | +262.1% |
| ExploitGym, 6-hour tasks | 39 | 130 | +91 | +233.3% |
| Toolathlon Verified | 59.9 | 73.0 | +13.1 | +21.9% |
| AutomationBench v1.0.6 | 26.2 | 48.2 | +22.0 | +84.0% |
| Agents' Last Exam CLI | 23.8 | 28.5 | +4.7 | +19.7% |
| HLE with tools | 54.7 | 62.5 | +7.8 | +14.3% |
| GDPval-AA v2, Elo | 1508 | 1769 | +261 | +17.3% |
การปรับปรุงเบนช์มาร์ก: GLM-5.3 เทียบกับ GLM-5.2 และคู่แข่ง
ตัวเลขทั้งหมดด้านล่างรายงานโดยผู้ขายจากบล็อกทางการของ Z.ai (พร้อมหมายเหตุวิธีการเกี่ยวกับฮาร์เนส ความยาวคอนเท็กซ์ และการสุ่มตัวอย่าง) การตรวจสอบอิสระจะตามมาเมื่อมีน้ำหนักและการเข้าถึงกว้างขึ้น
เบนช์มาร์กการเขียนโค้ด
| เบนช์มาร์ก | GLM-5.3 | GLM-5.2 | หมายเหตุ / คู่แข่ง |
|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | แข่งขันกับโมเดลปิดระดับบน |
| Terminal Bench 3.0 | 28.3 | 4.6 | SOTA แบบโอเพนซอร์ส; เทียบ Fable 5 ~33.7, GPT-5.6 Sol ~34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | ก้าวกระโดดที่แข็งแรง |
| NL2Repo | 58.0 | 48.9 | — |
| ProgramBench Almost Solved | 19.0 | 9.5 | — |
| FrontierSWE | 78.1 | 67.5 | — |
| SWE-Marathon v1.1 | 42.5 | 19.4 | — |
| Z.ai Code Bench (ภายใน, Max effort) | ~34.5% completion @ ~75K โทเคน | ~23.4% @ ~96K โทเคน | ~50% ดีขึ้นโดยรวมในความรู้สึกการโค้ด; ประสิทธิภาพสูงขึ้น |
ที่ระดับ High GLM-5.3 ทำได้ 31.4% ด้วย ~50K โทเคน แซง Claude Opus 4.8 (29.5% กับ 120K โทเคน) บนเบนช์ภายใน ขณะยังตาม Claude Fable 5 (39.5% ที่ Max)
เบนช์มาร์กไซเบอร์ซีเคียวริตี้
| เบนช์มาร์ก | GLM-5.3 | GLM-5.2 | คู่แข่ง (ประมาณการ) |
|---|---|---|---|
| CyberGym | 84.5% | 77.2% | Mythos 5: 83.8%, GPT-5.6 Sol: 83.6% (SOTA) |
| ExploitBench | 54.4% | 24.4% | มากกว่าสองเท่าจากเดิม; โมเดลปิดสูงกว่า (Mythos 5 ~78%, GPT-5.6 Sol ~76.5%) |
| ExploitGym (2h/6h) | 105 / 130 | 29 / 39 | Mythos 5 ยังนำหน้า (181/247) |
กำไรใหญ่ขึ้นยิ่งเมื่อขึ้นไปตามโซ่การเจาะ ในการทดสอบจริงกับทีมความปลอดภัยจีน โมเดล (ต่อยอดจากงาน GLM-5.2) ระบุช่องโหว่ได้ 2,436 รายการ ใน 269 โปรเจ็กต์ รวม 1,097 รายการระดับกลางถึงสูง บางช่องโหว่ย้อนไป ~40 ปี (เก่าสุด ~1981) ผลการค้นพบติดตามใน Z.ai Security Disclosure Ledger สาธารณะ
เบนช์มาร์กเอเจนต์และอื่น ๆ
| เบนช์มาร์ก | GLM-5.3 | GLM-5.2 | หมายเหตุ |
|---|---|---|---|
| Toolathlon Verified | 73.0 | 59.9 | — |
| AutomationBench v1.0.6 | 48.2 | 26.2 | กำไรใหญ่ |
| Agents’ Last Exam (ALE-CLI) | 28.5 | 23.8 | แข่งขันได้แบบโอเพนซอร์ส |
| HLE w/ Tools | 62.5 | 54.7 | — |
| GDPval-AA v2 | 1769 | 1508 | ครอบคลุม 44 อาชีพ |
ผลลัพธ์เหล่านี้แสดงความก้าวหน้าชัดเจนบนงานมืออาชีพระยะยาวหลายขั้นตอน
ประสิทธิภาพโทเคน โหมดการคิด และพฤติกรรมใช้งานจริง
การปรับปรุงที่เงียบแต่สำคัญคือประสิทธิภาพโทเคน บน Code Bench ภายใน อัตราสำเร็จสูงขึ้นพร้อมโทเคนเอาต์พุตน้อยลง ซึ่งสำคัญต่อค่าใช้จ่ายและ latency ในลูปเอเจนต์โปรดักชัน
GLM-5.3 เปิดการคิดเสมอ รองรับสามระดับ: low, high, และ max (ค่าเริ่มต้นและแนะนำสำหรับการโค้ดคือ max) การปิดการคิดไม่รองรับอีกต่อไป แอปที่เคยตั้ง thinking.type: "disabled" ต้องย้ายค่า
คอนเท็กซ์ยังคง 1M โทเคน พร้อมเอาต์พุตสูงสุดถึง 128K สถาปัตยกรรมไม่เปลี่ยนจาก GLM-5.2 ดังนั้นการประมาณฮาร์ดแวร์สำหรับโฮสต์ด้วยตัวเองในอนาคตสามารถอิงจากประสบการณ์ GLM-5.2 (รอยเท้าหลังควอนไทซ์ยังใหญ่เมื่อเทียบกับจำนวนพารามิเตอร์รวม)
สำหรับนักพัฒนาที่ต้องการทดลองทันทีหรือรักษาความยืดหยุ่นระหว่างโมเดล เกตเวย์แบบรวมมีประโยชน์ CometAPI แสดงรายการโมเดลตระกูล GLM (รวม GLM-5.3 ภายใต้รหัส glm-5.3 เมื่อพร้อมใช้งาน) ด้วยเอ็นด์พอยต์ที่เข้ากันได้กับ OpenAI อัตราแข่งขัน ระบบคิดตามการใช้ และสามารถสลับระหว่าง GLM-5.2, GLM-5.3 และโมเดลแนวหน้าหรือโอเพนอื่น ๆ ได้โดยไม่ต้องเขียนโค้ดเชื่อมต่อใหม่ เหมาะอย่างยิ่งสำหรับ A/B ทดสอบเอเจนต์โค้ด วัดต้นทุนต่อโจทย์ที่สำเร็จจริง และกำหนดเส้นทางตามเวิร์กโหลด
ใครควรย้ายไป GLM-5.3 และประเมินอย่างไร
ทีมที่สร้างเอเจนต์โค้ด อัตโนมัติระยะยาว เวิร์กโฟลว์วิศวกรรมระดับรีโพซิทอรี หรือเครื่องมือป้องกันความปลอดภัย ควรให้ความสำคัญกับการประเมิน การผสมผสานระหว่างอัตราสำเร็จที่สูงขึ้น ประสิทธิภาพโทเคนที่ดีกว่าบนงานซับซ้อน และความเป็นเอเจนต์หลายขั้นตอนที่แข็งแรงขึ้น มีนัยสำคัญ
เส้นทางการประเมินที่แนะนำ:
- รันงานภายในชุดเดิม (หรือฮาร์เนสคงที่) บน GLM-5.2 และ GLM-5.3 (หรือผ่าน Coding Plan) ที่ระดับความพยายามเดียวกัน
- วัดไม่ใช่แค่ pass rate แต่รวมโทเคน เวลาจริง และอัตราการแทรกแซงจากมนุษย์
- ใช้ชั้น API แบบรวมอย่าง CometAPI เพื่อให้การเปรียบเทียบไร้แรงเสียดทาน และรักษาตัวเลือก fallback หรือการกำหนดเส้นทางแบบคัดเลือก
- สำหรับเวิร์กโหลดอ่อนไหวด้านความปลอดภัย รอให้น้ำหนักแบบเปิดที่แข็งความปลอดภัยเต็มรูปแบบ และทบทวนแนวทางการเปิดเผย
การโฮสต์เองจะน่าดึงดูดยิ่งขึ้นเมื่อปล่อยน้ำหนัก โดยเฉพาะองค์กรที่มีโครงสร้าง GLM-5.2 อยู่แล้ว
สรุป: โพสต์เทรนนิงเป็นแนวทางสเกลใหม่
GLM-5.3 เป็นหนึ่งในตัวอย่างที่ชัดเจนล่าสุดว่าการสเกลโพสต์เทรนนิง—สภาพแวดล้อมสมจริงยิ่งขึ้น โครงสร้าง RL ที่ดีขึ้น และคอมพิวต์ยืนระยะบนทราจยาว—สามารถสร้างก้าวกระโดดความสามารถที่ก่อนนี้ดูเหมือนต้องการโมเดลฐานใหม่ ผลงานด้านการโค้ดและเอเจนต์ใหญ่ชัด ส่วนผลไซเบอร์เกิดขึ้นใหม่และแข่งขันหรือชนะบนเบนช์มาร์กค้นหาช่องโหว่
สำหรับผู้ปฏิบัติ ข้อสรุปเชิงปฏิบัติคือ: ทดสอบโมเดลกับเวิร์กโหลดจริง วัดต้นทุนต่อผลลัพธ์ที่สำเร็จแทนการยึดอันดับลีดเดอร์บอร์ด และรักษาการผสานให้ยืดหยุ่น แพลตฟอร์มอย่าง CometAPI ทำให้กระบวนการนั้นง่ายขึ้น ด้วยคีย์เดียว อินเทอร์เฟซที่เข้ากันได้กับ OpenAI และการสลับง่ายระหว่างซีรีส์ GLM และโมเดลคู่แข่งในระหว่างตัดสินใจว่าจะรับความสามารถใหม่เชิงรุกเพียงใด
