FLUX 3 and Gemini 3.7 Flash are now live on CometAPI →
ai-comparisons/أبحاث CometAPI

GLM-5.3 مقابل GLM-5.2: المقارنات المعيارية والاختبارات تبيّن لنا ما الذي تغيّر

GLM-5.3 مقابل GLM-5.2: نفس النموذج الأساسي، التدريب اللاحق فقط يحقق قفزة ~50% في البرمجة (Terminal-Bench 3.0 4.6→28.3) & قدرات ناشئة على CyberGym بنسبة 84.5% SOTA.

CometAPI
Annaفريق أبحاث نماذج AI وAPI
تم التحديث Aug 17, 2026 12 دقائق للقراءة
GLM-5.3 مقابل GLM-5.2: المقارنات المعيارية والاختبارات تبيّن لنا ما الذي تغيّر
استخدم هذا النمط

أجرِ أول استدعاء لـ API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TLDR أطلقت Z.ai GLM-5.3 في 14 أغسطس 2026، اعتماداً على نفس نموذج الأساس Mixture-of-Experts بعدد معاملات ~743–753B تماماً كما في GLM-5.2. جاءت جميع المكاسب من توسيع مرحلة ما بعد التدريب على بيئات طويلة الأفق. النتيجة: تحسّن نسبي بنحو ~50% على Code Bench الداخلي لدى Z.ai، وتصدّر مفتوح المصدر على Terminal-Bench 3.0 (4.6 → 28.3) و Agents’ Last Exam، وتحسنات كبيرة في درجات الوكالة، وأداء أمن سيبراني متقدّم ناشئ (CyberGym 84.5%). كما تحسّنت كفاءة الرموز.

من المتوقع طرح الأوزان بعد نحو أسبوعين من الإطلاق عقب تعزيزات الأمان. يمكن للمطورين بالفعل الوصول إلى نماذج GLM ذات الصلة واختبار سير العمل بكفاءة عبر منصات موحّدة مثل CometAPI.

أهم النقاط المستخلصة

  • نفس نموذج الأساس كما في GLM-5.2؛ كل التحسينات من ما بعد التدريب (IndexShare و SAO وإطار slime + المزيد من البيئات والحوسبة).
  • الترميز: Terminal-Bench 3.0 من 4.6 → 28.3؛ DeepSWE v1.1 من 46.2 → 66.9؛ Code Bench الداخلي لدى Z.ai أفضل بنحو ~50% مع رموز إخراج أقل.
  • الوكالة: AutomationBench من 26.2 → 48.2؛ Agents’ Last Exam من 23.8 → 28.5؛ GDPval-AA v2 من 1508 → 1769.
  • الأمن السيبراني: CyberGym من 77.2 → 84.5 (SOTA، متقدّم على Mythos 5 و GPT-5.6 Sol)؛ ExploitBench تضاعف أكثر من مرتين (24.4 → 54.4). اكتشافات واقعية: 2,436 ثغرة عبر 269 مشروعاً.
  • المواصفات غير متغيرة في البنية الأساسية: سياق 1M، حتى 128K رموز إخراج، تفكير دائم التشغيل مع مستويات جهد low/high/max.
  • الوصول: مباشر عبر GLM Coding Plan و ZCode؛ واجهة API عامة وأوزان مفتوحة (متوقع بأسلوب MIT) قادمة بعد مراجعة الأمان. توفر CometAPI وصولاً متوافقاً مع OpenAI لعائلة GLM لاختبار متوازي وتوجيه الإنتاج بكفاءة.

GLM-5.3 مقابل GLM-5.2 بنظرة سريعة

البُعدGLM-5.3GLM-5.2الفائز / ملاحظات
نموذج الأساسنفس ~743–753B MoEنفسهمتطابق
ما بعد التدريببيئات موسّعة بشكل كبيرحزمة سابقة5.3
Terminal-Bench 3.028.34.65.3 (كبير)
DeepSWE v1.166.946.25.3
Internal Code Bench (Max)34.5% @ ~75K tokens23.4% @ ~96K tokens5.3 (الأداء + الكفاءة)
Agents’ Last Exam28.523.85.3
AutomationBench48.226.25.3
CyberGym84.5 (SOTA)77.25.3
ExploitBench54.424.45.3
GDPval-AA v2176915085.3
السياق / أقصى إخراج1M / 128K1M / مشابهنفسه
التفكيردائم التشغيل (low/high/max)كان أكثر مرونة سابقاً5.3 (دائم التشغيل)
الأوزان المفتوحة~أسبوعان بعد الإطلاق (مخطط)متاحة (MIT)5.2 حالياً
الوصول الأساسي الآنCoding Plan / ZCodeAPI + أوزان + Coding Plan5.2 أكثر نضجاً

المقدمة: ما بعد التدريب يحقق قفزة جيلية

في منتصف أغسطس 2026 شهد المجتمع التقني تكراراً سريعاً جديداً في سباق الأوزان المفتوحة. طرحت Z.ai (الواجهة الدولية لفريق Zhipu AI / ChatGLM سابقاً) GLM-5.3 بعد 59 يوماً فقط من GLM-5.2. كان الإعلان واضحاً على نحو غير معتاد: ظل نموذج الأساس مطابقاً. “Scaling post-training is all we did for GLM-5.3”، بحسب تصريح الشركة.

هذه المقولة مهمة. لسنوات ساد سردية “النماذج الأكبر تفوز”. يُظهر GLM-5.3 أن التوسيع العدواني لبيئات التعزيز، وتنوّع مهام طويلة الأفق، وبُنى الأنظمة يمكن أن ينتج مكاسب كبيرة في مهام الترميز الصعبة والوكالة، وحتى أعباء الأمن السيبراني، من دون تشغيل جديد لمرحلة ما قبل التدريب. الأرقام كبيرة بما يكفي على عدة معايير صعبة إلى درجة أن بعض المراقبين المستقلين وصفوا القفزة بأنها نوعية لا مجرد تراكمية. نظرة عامة على ميزات GLM-5.3 والمعايير وملاحظات الوصول.

GLM-5.3 مقابل GLM-5.2: ما الذي تغيّر فعلاً؟

أكبر سوء فهم سيكون افتراض أن GLM-5.3 هو ببساطة “GLM-5.2 لكن أكبر.”

ليس كذلك.

يبقى نموذج الأساس كما هو، وفقاً لـ Z.ai. الابتكار الرئيسي هو توسيع ما بعد التدريب. تؤكد Z.ai ثلاثة ركائز:

  1. تحسينات على مستوى الأنظمة داخل slime — تدريب أفضل
  2. توسيع البيئات — خطوط معالجة تولّد بيئات قابلة للتنفيذ والتحقق، طويلة الأفق، من سير عمل مهني حقيقي. يستخرج وكلاء البحث أنماط المهام؛ يتحقق وكيل القاضي من قابلية الحل؛ تُبنى أدوات التحقق دون الوصول إلى الحل المرجعي للحد من التحايل على المكافأة.
  3. الاستمرار في استخدام SAO + الضغط — يساعد على بقاء المكاسب عبر مسارات طويلة بدلاً من الانهيار في القصيرة. – اتساق الطرح (التحكم بفروق log-prob عند ~1e-7)، التخزين المخبئي الهرمي، دعم متعدد المعلّمين، جدولة واعية بحمولة العمل، وزيادة مُبلّغ عنها بأكثر من 2.3× في الإنتاجية الشاملة لمهام ترميز RL طويلة الأفق.

أنتجت هذه التغييرات تحسّنات قابلة للقياس عبر مجموعات الترميز والوكالة والأمن السيبراني. والأهم أن أكبر المكاسب النسبية تظهر على أصعب الاختبارات ذات الخط الأساسي المنخفض—وهو النمط المتوقع عندما يُدفَع النموذج إلى أنظمة لم يكن يتعامل معها بشكل موثوق سابقاً.

النتيجة هي ترقية نموذج تتمحور أساساً حول السلوك والقدرة، وليس مجرد البنية.

مقارنة الميزات: GLM-5.3 مقابل GLM-5.2

1. توسيع ما بعد التدريب بدلاً من نموذج أساس جديد

تصف Z.ai التوسيع في ما بعد التدريب كالوصفة الكاملة لـ GLM-5.3. يحوّل وكلاء البحث الأنماط المستخلصة من العمل الحقيقي إلى مهام قابلة للتشغيل مع حالة مخفية واعتماديات متعددة الخطوات. يتحقق وكيل القاضي من أن كل مهمة قابلة للحل. تُنشأ أدوات التحقق دون رؤية الحل المرجعي، ثم تُختبر مقابل حالات oracle و no-op و unsolved لتقليل اختصارات المكافأة.

لا يزال النظام يتطلّب مراجعة بشرية، وتصرّح Z.ai أن المزيد من التوليد والتحقق الذاتي للبيئات يبقى عملاً مستقبلياً. هذه الإشارة تزيد مصداقية الادعاء: نحن أمام خط تدريب كبير، لا ادعاء بأن البيئات الاصطناعية أصبحت مستقلّة بالكامل.

2. ترميز أقوى لسيناريوهات طويلة الأفق

يحسّن GLM-5.3 أداءه في العمل على المستودعات، ومهام الطرفية، وبنى تعلم الآلة، وتحسين الأداء، والتسليم البرمجي متعدد الخطوات. على Z.ai Code Bench، وهو تقييم داخلي خاص يهدف لعكس سيناريوهات المستخدم الواقعية، تُبلغ Z.ai عن تحسّن ترميز بنحو 50% مقارنة بـ GLM-5.2.

نتيجة الكفاءة لا تقل أهمية عن الدرجة. عند مستوى جهد Max، حقق GLM-5.3 نسبة 34.5% بحوالي 75K رمز إخراج لكل مهمة، مقابل 23.4% لـ GLM-5.2 عند 96K. هذا يعني زيادة جودة بمقدار 11.1 نقطة مع إنتاج حوالي 22% رموز أقل. عند مستوى High، وصل GLM-5.3 إلى 31.4% باستخدام حوالي 50K رمز، متقدّماً على Claude Opus 4.8 عند 29.5% مع 120K في نفس مخطط الطرف الأول. بقي Claude Fable 5 أعلى عند 39.5% ضمن Max.

3. قدرة أمن سيبراني ناشئة

أضافت Z.ai بيئات لاكتشاف الثغرات أثناء ما بعد التدريب. وبحسب تقرير الإطلاق، نمت القدرة إلى أبعد من العثور على عيوب معزولة: بدأ النموذج يستدل عبر مراحل متعددة من سلسلة الاستغلال.

تُظهر النتائج العامة تقدّماً وحدوداً. يتصدر GLM-5.3 جدول مقارنة Z.ai على CyberGym عند 84.5، مقابل 77.2 لـ GLM-5.2. وعلى ExploitBench تضاعف أكثر من مرتين، محققاً 54.4 مقابل 24.4، لكنه لا يزال خلف Fable 5 عند 78.0 و GPT-5.6 Sol عند 76.5. على ExploitGym يُكمل 105 مهمة في ميزانية ساعتين مُطبّعة و130 في ست ساعات، مقابل 29 و39 لـ GLM-5.2؛ ولا يزال GPT-5.6 Sol و Fable 5 متقدّمين بشكل ملحوظ.

هذه القدرات مزدوجة الاستخدام. ينبغي للمنظمات تقييد الوصول إلى النموذج، وعزل الأدوات، وتسجيل الإجراءات، واشتراط التفويض لعمليات المسح، والحفاظ على وجود بشري في التحقق من الثغرات والإفصاح عنها.

4. تفكير دائم التشغيل بثلاث مستويات جهد

يدعم GLM-5.3 مستويات جهد low و high و max. خلافاً لـ GLM-5.2، لا يدعم تعطيل التفكير. يجب على التكاملات القائمة التي ترسل thinking.type: "disabled" تغيير القيمة إلى enabled قبل تبديل معرّف النموذج، وإلا تقول Z.ai إن الطلب سيفشل.

استخدم low للتعديلات التفاعلية والتحويلات منخفضة المخاطر، وhigh لمهام المستودعات الكبيرة، وmax للترميز الصعب أو تحليل الأمان. ينبغي تقييم الجهد الأعلى من حيث زمن الاستجابة والكلفة لأن الإجابة الأقوى ليست تلقائياً الأكثر اقتصادية.

5. إنتاجية تدريب أفضل عبر slime

يواصل GLM-5.3 استخدام slime، إطار Z.ai مفتوح المصدر مع Megatron على جانب التدريب و SGLang على جانب الطرح. تُبلغ Z.ai عن إضافات لـ top-p masking و top-k و التقطير على السياسة بكامل المفردات، والتبديل بين المعلّمين، والتخزين المخبئي، ومواءمة رقمية أشد إحكاماً بين التدريب والطرح. يقول تقرير الإطلاق إن متوسط فروق احتمالات اللوغاريتم تمت السيطرة عليه عند مستوى 1e-7، وهو أقل بأكثر من 99.99% مقارنة بالإعدادات السابقة.

يُقال إن الجدولة الواعية بحمولة العمل وموازنة التحميل حسّنت الإنتاجية الشاملة للتعلّم التعزيزي بأكثر من 2.3 مرة في مهام الترميز طويلة الأفق. هذه تحسينات في بنية التدريب وليست ضمانات استدلال للمستخدم النهائي، لكنها تشرح كيف وسّعت Z.ai المسارات الأطول والأكثر تنوعاً خلال شهر.

6. تأخير الأوزان المفتوحة لمراجعة الأمان

تصف Z.ai GLM-5.3 بأنه نموذج بأوزان مفتوحة، لكن الأوزان لم تكن قابلة للتنزيل يوم الإطلاق. تقول الشركة إنها ستُنشر بعد أسبوعين من الإطلاق عقب تقييم الأمان والتقسية. هذا اختلاف جوهري عن GLM-5.2، الذي تتوفر أوزانه المرخّصة MIT بالفعل على Hugging Face.

بالنسبة لمعظم الفرق، يبقى اختبار API المُستضاف الخطوة العملية الأولى. النموذج كبير، والأوزان المفتوحة لا تُلغي كلفة عتاد الاستدلال أو الكمّ أو الخدمة أو المراقبة أو ضوابط الأمان.

GLM-5.3 مقابل GLM-5.2: تحسينات المعايير

يستخدم الجدول التالي بيانات الإطلاق الرسمية من Z.ai. “التغيير” هو حساب بسيط من الدرجات المبلّغ عنها. النسب المئوية قد تبدو دراماتيكية عندما يكون خط أساس GLM-5.2 منخفضاً، لذا يُعرض أيضاً التغيير المطلق.

المعيارGLM-5.2GLM-5.3التغيير المطلقالتغيير النسبي
Terminal-Bench 2.181.088.2+7.2+8.9%
Terminal-Bench 3.04.628.3+23.7+515.2%
DeepSWE v1.146.266.9+20.7+44.8%
NL2Repo48.958.0+9.1+18.6%
ProgramBench Almost Solved9.519.0+9.5+100.0%
FrontierSWE67.578.1+10.6+15.7%
SWE-Marathon v1.119.442.5+23.1+119.1%
PostTrainBench31.739.8+8.1+25.6%
CyberGym77.284.5+7.3+9.5%
ExploitBench24.454.4+30.0+123.0%
ExploitGym، مهام ساعتين29105+76+262.1%
ExploitGym، مهام ست ساعات39130+91+233.3%
Toolathlon Verified59.973.0+13.1+21.9%
AutomationBench v1.0.626.248.2+22.0+84.0%
Agents' Last Exam CLI23.828.5+4.7+19.7%
HLE with tools54.762.5+7.8+14.3%
GDPval-AA v2، Elo15081769+261+17.3%

تحسينات المعايير: GLM-5.3 مقابل GLM-5.2 والمنافسين

كل الأرقام أدناه من تقارير المورّد على مدونة Z.ai الرسمية (مع ملاحظات منهجية عن الأطر، أطوال السياق، وأخذ العينات). سيتبع تحقق مستقل بمجرد توفر الأوزان ووصول أوسع.

معايير الترميز

المعيارGLM-5.3GLM-5.2ملاحظات / منافسون
Terminal Bench 2.188.281.0منافس مع أفضل النماذج المغلقة
Terminal Bench 3.028.34.6SOTA مفتوح المصدر؛ مقابل Fable 5 ~33.7، GPT-5.6 Sol ~34.6
DeepSWE v1.166.946.2قفزة قوية
NL2Repo58.048.9
ProgramBench Almost Solved19.09.5
FrontierSWE78.167.5
SWE-Marathon v1.142.519.4
Z.ai Code Bench (داخلي، Max)~34.5% إتمام @ ~75K رموز~23.4% @ ~96K رموز~50% تحسّن إجمالي في إحساس الترميز؛ كفاءة أعلى

عند مستوى High، وصل GLM-5.3 إلى 31.4% إتمام مع ~50K رمز، متجاوزاً Claude Opus 4.8 (29.5% مع 120K رمز) على المعيار الداخلي، مع بقائه خلف Claude Fable 5 (39.5% عند Max).

معايير الأمن السيبراني

المعيارGLM-5.3GLM-5.2منافسون (تقريباً)
CyberGym84.5%77.2%Mythos 5: 83.8%، GPT-5.6 Sol: 83.6% (SOTA)
ExploitBench54.4%24.4%أكثر من تضاعف؛ النماذج المغلقة أعلى (Mythos 5 ~78%، GPT-5.6 Sol ~76.5%)
ExploitGym (2h/6h)105 / 13029 / 39Mythos 5 لا يزال متقدّماً (181/247)

تكون المكاسب الأكبر أبعد على سلسلة الاستغلال. في اختبار واقعي مع فرق أمن صينية، حدّد النموذج (بناءً على عمل GLM-5.2) 2,436 ثغرة عبر 269 مشروعاً، بينها 1,097 مشكلة متوسطة إلى عالية الشدة. يعود تاريخ بعض العيوب إلى ~40 عاماً (الأقدم ~1981). تُتتبّع النتائج في السجل العام Z.ai Security Disclosure Ledger.

معايير الوكالة ومعايير أخرى

المعيارGLM-5.3GLM-5.2ملاحظات
Toolathlon Verified73.059.9
AutomationBench v1.0.648.226.2مكسب كبير
Agents’ Last Exam (ALE-CLI)28.523.8منافس مفتوح المصدر
HLE w/ Tools62.554.7
GDPval-AA v217691508يغطي 44 مهنة

تُظهر هذه النتائج تقدماً واضحاً في مهام مهنية طويلة الأفق متعددة الخطوات.

كفاءة الرموز، أوضاع التفكير، والسلوك العملي

تحسّن هادئ ولكنه مهم هو كفاءة الرموز. على Code Bench الداخلي، تأتي معدلات إتمام أعلى مع رموز إخراج أقل. هذا مهم للكلفة وزمن الاستجابة في حلقات الوكلاء الإنتاجية.

يُفعّل GLM-5.3 التفكير دائماً. تتوفر ثلاثة مستويات جهد: low و high و max (الإعداد الافتراضي والمستحسن للترميز هو max). لم يعد تعطيل التفكير مدعوماً؛ يجب على التطبيقات التي كانت تضبط thinking.type: "disabled" أن تنتقل.

يبقى السياق 1M رمز مع حد أقصى للإخراج حتى 128K. لم تتغير البنية عن GLM-5.2، لذا يمكن تقدير حجم العتاد لاستضافة ذاتية مستقبلية من تجربة GLM-5.2 القائمة (البصمات بعد الكمّ ما تزال كبيرة نظراً لإجمالي عدد المعاملات).

للمطورين الراغبين بالتجربة الفورية أو الحفاظ على المرونة عبر النماذج، تكون البوابات الموحّدة مفيدة. تسرد CometAPI نماذج سلسلة GLM (بما في ذلك GLM-5.3 تحت معرّف النموذج glm-5.3 عند توفره) مع نقاط نهاية متوافقة مع OpenAI، وأسعار تنافسية، وفوترة حسب الاستخدام، والقدرة على التبديل بين GLM-5.2 و GLM-5.3 وعشرات النماذج الأخرى من دون إعادة كتابة كود التكامل. هذا عملي بشكل خاص لاختبار A/B لوكلاء الترميز، وقياس الكلفة الواقعية لكل مهمة ناجحة، وتوجيه المرور حسب عبء العمل.

من ينبغي أن ينتقل إلى GLM-5.3 وكيف يُقيَّم

ينبغي للفرق التي تبني وكلاء ترميز، وأتمتة طويلة الأفق، وسير عمل هندسي على مستوى المستودعات، أو أدوات أمن دفاعي أن تُعطي الأولوية للتقييم. يجتمع ارتفاع معدلات الإتمام، وتحسّن كفاءة الرموز على المهام المعقدة، ووِكالة أقوى متعددة الخطوات—وهي عوامل جوهرية.

مسار تقييم موصى به:

  1. نفّذ نفس المهام الداخلية (أو إطار ثابت) على GLM-5.2 و GLM-5.3 (أو عبر Coding Plan) عند مستويات جهد متطابقة.
  2. قِس ليس فقط معدل النجاح بل أيضاً عدد الرموز، زمن الجدار، ومعدل التدخل البشري.
  3. استخدم طبقة API موحّدة مثل CometAPI لإبقاء المقارنة منخفضة الاحتكاك وللاحتفاظ بإمكانية التراجع أو التوجيه الانتقائي.
  4. لأعباء العمل الحسّاسة أمنياً، انتظر الأوزان المفتوحة المُقساة بالكامل وراجع ممارسات الإفصاح.

ستصبح الاستضافة الذاتية جذّابة بمجرد طرح الأوزان، وخاصة للمنظمات التي تُشغّل بالفعل بنية GLM-5.2.

الخلاصة: ما بعد التدريب كحدّ توسّع جديد

يُعد GLM-5.3 أحد أوضح العروض الأخيرة بأن توسّع مرحلة ما بعد التدريب—بيئات أكثر واقعية، وبنى RL أفضل، وحوسبة مستمرة على مسارات طويلة—يمكن أن يُحدث قفزات قدرات كانت تبدو سابقاً بحاجة إلى نماذج أساس جديدة. مكاسب الترميز والوكالة كبيرة؛ أما نتائج الأمن السيبراني فكانت ناشئة ومنافسة بالفعل أو متصدّرة في معايير اكتشاف الثغرات.

بالنسبة للممارسين، الخلاصة العملية مباشرة: اختبروا النموذج على أعباء عملكم الفعلية، قيسوا الكلفة لكل نتيجة ناجحة بدلاً من موقع لوحة الصدارة الخام، وحافظوا على مرونة التكامل. منصّات مثل CometAPI تُبسّط ذلك عبر مفتاح واحد، واجهة متوافقة مع OpenAI، وسهولة التبديل عبر سلسلة GLM والنماذج المنافسة بينما تقررون مدى تبنّي القدرات الجديدة بقوة.

تابع التعلّم

اربط هذه المقالة بالقرار التالي.

عرض جميع الموضوعات
نُشر في Aug 15, 2026
آخر تحديث Aug 17, 2026
13 مشاهدات
تمت المراجعة للوضوح ودقة المصدر ومصطلحات API الحالية.

هل أنت مستعد لخفض تكاليف تطوير الذكاء الاصطناعي بنسبة 20%؟

ابدأ مجاناً في دقائق. رصيد تجريبي مجاني مدرج. لا حاجة لبطاقة ائتمانية.

اقرأ المزيد