الخلاصة في 28 يونيو 2026، أعلن Elon Musk أن Grok 4.5 — المبني على نموذج الأساس V9 الجديد من xAI بعدد 1.5 تريليون معلمة، مع بيانات تدريب تكميلية من منصة البرمجة Cursor AI — دخل مرحلة تجريبية خاصة داخل SpaceX وTesla. تزعم التقييمات الداخلية أداءً "قريبًا من، وربما يتجاوز" Claude Opus من Anthropic، مع استمرار تحسينات RLHF وGrok Build.
بالنسبة للمطورين والشركات التي تدمج نماذج متقدمة اليوم، تقدم CometAPI وصولًا فوريًا وفعال التكلفة إلى Grok 4.3 (ونماذج xAI الأخرى) عبر نقطة نهاية متوافقة مع OpenAI إلى جانب 500+ نموذج من Anthropic وOpenAI وGoogle وغيرها — غالبًا مع توفير يتجاوز 20% مقارنة بالتسعير المباشر، وبدون تسجيل للمحفزات من أجل تدفقات عمل تركز على الخصوصية.
أبرز ما يجب معرفته
- سطر مقتبس منسوب إلى Elon Musk يقول إن Grok 4.5 في تجريب خاص داخل SpaceX وTesla، متداول بواسطة AshutoshShrivastava.
- تفيد TestingCatalog بأن Grok 4.5 مبني على نموذج أساس V9 بعدد 1.5T مع إضافة بيانات Cursor في التدريب التكميلي.
- الإشارة الوحيدة الموسومة كدليل هي لقطة شاشة لـ Mark Kretschmann بتاريخ 28 يونيو تُظهر إزالة رقم إصدار Grok / Cursor Composer 3 من قوائم xAI.
- لا توجد درجات معيارية، أو تسعير، أو نافذة سياق، أو توقيت API مُعلن ضمن هذه المجموعة من الإشارات.
- قصة بيانات تدريب Cursor تتصاعد منذ 16 يونيو عبر ما لا يقل عن ثلاثة حسابات، مع Mark Kretschmann يربط Grok 5 بزوج 6T و10T من المعلمات ضمن فئة أوزان Fable 5.
تاريخ إصدار Grok 4.5
دخل Grok 4.5 التجريب الخاص في 28 يونيو 2026، ومن المقرر طرحه علنًا في 9 يوليو 2026 (غدًا، اعتبارًا من 8 يوليو).
يبني على إصدارات سابقة مثل Grok 4 (الصادر حوالي يوليو 2025) وGrok 4.3. وينبغي أن يصبح متاحًا للمستخدمين المؤهلين (مثل مشتركي SuperGrok/Premium+) بعد الإعلان بفترة وجيزة. بالنسبة إلى API، سيتم دمج CometAPI مع grok 4.5 API مباشرة بعد إصداره، وستقدم سعر اقتناء أقل.
الطرح العام: اليوم (8 يوليو 2026)، نشر Musk أن، بناءً على تعليقات إيجابية من التجريب، ستجعل SpaceXAI / xAI نموذج Grok 4.5 متاحًا للجمهور غدًا (9 يوليو). وُصف بأنه نموذج "من فئة Opus" أسرع وأكثر كفاءة في الرموز وأقل تكلفة من النماذج المماثلة.

إشارات من بنية grok 4.5: ما رأيناه
المصدر الأساسي هو منشور Elon Musk على X بتاريخ 28 يونيو 2026:
"Grok 4.5، المبني على نموذج الأساس V9 بعدد 1.5T، مع إضافة بيانات Cursor في التدريب التكميلي، هو الآن في تجريب خاص داخل SpaceX وTesla. تشير التقييمات المبكرة إلى أداء قريب من، وربما يتجاوز Opus. يستمر التعلم المعزز في تحسين النموذج بشكل كبير، كما يتحسن نظام Grok Build يوميًا..."
تم تضخيم ذلك بواسطة حسابات مثل @testingcatalog و@ai_for_success، مع تفاصيل معمارية حول 1.5T V9 ودمج Cursor: "Grok 4.5 مبني على نموذج أساس 1.5T V9، مع إضافة بيانات Cursor في التدريب التكميلي."
إشارة Cursor: إن توجه xAI/SpaceX نحو الاستحواذ على Cursor (Anysphere) أو الشراكة العميقة معها مقابل ~60 مليار دولار يوفر مصدرًا غنيًا لآثار IDE حقيقية للمطورين، وتدفقات عمل وكيليّة، وبيانات تحرير متعددة الملفات. يُميز هذا التدريب التكميلي (بعد مرحلة ما قبل التدريب) Grok 4.5 في مهام البرمجة، رغم أن خبراء يشيرون إلى أن الدمج ضمن ما قبل التدريب سيكون أقوى.
المصدر: @mark_k
إشارة حالة القائمة أضيق لكنها أكثر شبهًا بالأدلة. وفق منشور Mark Kretschmann بتاريخ 28 يونيو، تمت إزالة رقم إصدار نموذج Grok 1.5T / Cursor Composer 3 من قوائم xAI صباح 28 يونيو. يصف ذلك كنمط يسبق عادة إصدارات xAI. هذا ليس إطلاقًا رسميًا، لكنه أكثر ملموسية من ادعاء أداء معاد نشره لأنه مرتبط بلقطة شاشة.
دفعت إشارة الكناري اللاحقة القصة قدمًا. رصدت TestingCatalog سلسلة في واجهة Grok على الويب تقول "Unlock the full power of Chat with Grok 4.5." غالبًا ما تظهر مثل هذه الآثار قبل تغيير المنتج، لكنها قد تُهمل أو تُؤجَّل أو تُخفى خلف طرح محدود.
ما يمكن توقعه بشكل معقول من Grok 4.5
- تعزيز الأداء في البرمجة والعمل الوكيلي: ينبغي لبيانات Cursor التكميلية تحسين مهام شبيهة بـ SWE-Bench، والاستدلال متعدد الملفات، وتدفقات عمل المطورين الواقعية. توقَّع قوة في الاستدلال التقني وتصحيح الأخطاء والهندسة على نطاق الإنتاج — وهي مجالات متماشية مع حالات استخدام SpaceX/Tesla.
- الحجم والكفاءة: عند 1.5T معلمات على V9 محسَّن (وحدات Blackwell عبر Colossus)، يوازن بين القوة الخام وإمكانات الاستدلال. قد تُقلِّص تحسينات RL بعد التجريب فجوات الاستدلال.
- وتيرة تكرار سريعة: ذكر Musk نماذج جديدة شهريًا من الصفر. يُعد Grok 4.5 خطوة انتقالية، مع تشغيل أكبر 2T+ يدمج بيانات Cursor منذ ما قبل التدريب.
- تعددية الوسائط واستخدام الأدوات: بالاستناد إلى قدرات Grok السابقة (الرؤية، البحث، Grok Build)، توقَّع ميزات وكيليّة موسَّعة.
- جدول طرح عام: تُشير آثار الواجهة إلى أيام أو أسابيع للوصول الأوسع. تشير الأنماط التاريخية إلى 1–2 أسبوع من التشويق إلى المعاينة.
للإنتاج اليوم: أثناء الانتظار، ادمج عبر نقاط Grok في CometAPI. تدعم واجهتها المتوافقة مع OpenAI التبديل السلس وتقدم وفورات بالتكلفة (مثل Grok 4 بأسعار مخفضة)، وهي مثالية لبناء تطبيقات ستُرقّى بسهولة إلى Grok 4.5. اطّلع على عروض CometAPI الخاصة بـ Grok للتفاصيل.
تأتي الحقائق الصلبة من الوثائق الرسمية، وهذه الوثائق صامتة حتى الآن بشأن Grok 4.5. تسرد صفحة نماذج xAI (grok-build-0.1) كنموذج برمجة مُدرّب خصيصًا لتدفقات عمل وكيليّة في البرمجة، بنافذة سياق 256k وسعر $1.00 / $2.00 لكل 1M من رموز الإدخال/الإخراج في مستندات تسعير xAI. وتُدرج grok-4.3 للاستخدام العام، بنافذة سياق 1M ورسم $1.25 / $2.50 لكل 1M من رموز الإدخال/الإخراج. تتضمن صفحة حدود المعدل لدى xAI Grok 4.3 وGrok Build 0.1، وتوضح مستندات استدعاء الدوال لدى xAI سطح استخدام الأدوات الحالي، لكن لا تُدرج أيًّا من هذه الصفحات Grok 4.5.
هذا الغياب مهم. قد يكون النموذج موجودًا داخليًا ومع ذلك غير قابل للاستخدام عبر API العامة. ينبغي للفرق الفصل بين "قد تختبر xAI هذا" و"يمكن للمطورين نشر هذا".
لا يزال النقاش العام مفيدًا لغرض أضيق: يُخبرنا بما ينبغي على البنّائين اختباره أولًا.
الأسئلة اللاحقة أكثر فائدة من الضجيج:
- هل تُقلل بيانات Cursor نمط المحاولات الفاشلة لتطبيق الرقع؟
- هل يتنقل Grok 4.5 داخل المستودعات أفضل من Grok 4.3 أو Grok Build؟
- هل يتفوّق على Claude Opus 4.8 في مهام متعددة الملفات حقيقية؟
- هل يحتاج محاولات أقل، أو استدعاءات أدوات أقل، أو مراجعة بشرية أقل؟
- هل يظل تنافسيًا عند قياس الكمون وطول المخرجات؟
- هل يعمم خارج تدفقات عمل شبيهة بـ Cursor؟
عامِلوا سلاسل X كإشارات، لا كمواصفات. تبدأ المواصفات عندما تُحدّث xAI وثائق نموذجها أو ملاحظات الإصدارات.
Grok 4.5 مقابل Claude Opus: الأداء المتوقع
سؤال التوجيه الحقيقي ليس "هل Grok 4.5 مُثير؟" بل: هل ينبغي لعمل برمجي أو وكيل استخدام Grok 4.5 بدلًا من Claude Opus 4.8 عند توفر Grok 4.5؟
Claude Opus 4.8 هو خط الأساس الواضح لأن لدى Anthropic وثائق عامة وبيانات معيارية. تسرد نظرة عامة على النماذج نموذج Claude Opus 4.8 بنافذة سياق 1M و128k حد مخرجات أقصى. تضع إعلان Opus 4.8 النموذج في إطار العمل الوكيلي المعقّد والبرمجة وحالات الاستخدام المؤسسية، بينما تقدم صفحة التسعير أساس السعر الرسمي لـ API.
تعطي بطاقة نظام Opus 4.8 أرقامًا فعلية. في ملخص التقييم، يُبلغ Opus 4.8 عن 88.6 على SWE-bench Verified، و69.2 على SWE-bench Pro، و74.6 على Terminal-Bench 2.1، و83.4 على OSWorld-Verified، و1890 على GDPval-AA.
نقاط القوة المتوقعة لـ Grok 4.5:
- تخصّص في البرمجة: توفر بيانات Cursor ميزة فريدة في آثار المطورين الواقعية التي لا تُقيِّمها المقاييس الاصطناعية كما يجب. كانت نماذج Grok السابقة تنافسية بالفعل في البرمجة؛ وقد يدفع هذا بها قدمًا في المهام الوكيليّة.
- الحجم والسرعة: قد يحقق 1.5T معلمات + بنية Colossus قدرة مرور قوية وتعاملًا جيدًا مع السياق الطويل.
- التكلفة/الإتاحة: غالبًا ما تُسعِّر xAI نماذجها بشكل تنافسي؛ وتضيف CometAPI وفورات إضافية (مثل سلسلة Grok 4 بتخفيضات ملحوظة).
نقاط قوة Claude Opus (الرائد الحالي):
- معايير مثبتة: SWE-Bench مرتفع (~80%+ في الإصدارات الأخيرة)، استدلال قوي (GPQA، ARC-AGI)، اتباع تعليمات ممتاز وسلامة عالية.
- منظومة ناضجة: استخدام أدوات قوي، وعناصر مرئية، وميزات مؤسسية.
جدول المقارنة (متوقع/مُستنتج بناءً على البيانات المتاحة)
| الجانب | Grok 4.5 (متوقع) | Claude Opus (حالي) |
|---|---|---|
| عدد المعلمات | 1.5T (V9) | غير مُفصح عنه (مزيج كثيف/خبراء) |
| البرمجة (تقدير SWE-Bench) | تنافسي/متقدم (دفعة من Cursor) | ~80%+ Verified |
| الاستدلال العام (GPQA/MMLU) | قريب من/أعلى من Opus | رائد |
| نافذة السياق | كبيرة (متوقعة 200k+) | 200k+ |
| السعر (عبر API) | تنافسي (أرخص عبر CometAPI) | Premium |
| تخصّص البيانات | آثار IDE من Cursor | شاملة + منسّقة |
| الإتاحة | تجريب خاص → قريبًا؟ | API عامة |
| وتيرة التدريب | نماذج شهرية من الصفر | تكرارية |
الجدول مُركّب من تسريبات ومعايير سابقة وتحليلات. النتائج الفعلية رهن توفر تقييمات عامة.
عامِلوا مقارنة Opus كهدف معياري، لا كخلاصة نهائية. إن كان Grok 4.5 حقًا قريبًا من أو أعلى من Opus، فيجب أن يظهر ذلك في معدل المهام المحلولة، ومحاولات أقل، وتعديلات مراجعين أقل، وتعافٍ أفضل من حلقات الأدوات. إن كان يفوز فقط في العروض، فذلك غير كافٍ للتوجيه الإنتاجي.
ثلاث زوايا هندسية معتمة
مخاطر الانتقال لا تتعلق فقط بجودة النموذج. ثلاثة تفاصيل أقل وضوحًا قد تجعل طرح Grok 4.5 مكلفًا أو هشًا.
1. المكاسب المُشكّلة على نمط Cursor قد لا تنتقل إلى مكدس برمجتك
إذا جاء دليل التدريب من تدفقات عمل Cursor، فقد يكون النموذج أقوى في أنماط تحرير شبيهة بـ Cursor. قد يختلف نظامك الإنتاجي: وكلاء جانب الخادم، روبوتات إصلاح CI، تصنيف مشكلات GitHub، ترحيل مستودعات داخلية، أو مساعدين محليين للمطورين.
قائمة تحقق للتقييم:
- اشمل مستودعات حقيقية، لا مطالبات تجريبية تافهة.
- اشمل مهام تتطلب القراءة قبل التحرير.
- اشمل مهام التعافي بعد فشل الاختبارات.
- سجّل صحة الرقعة النهائية، لا جودة الإجابة فقط.
- قارن وضع الدردشة العادي مقابل وضع الوكيل.
- قِس ما إذا كان Grok 4.5 يُقلل المحاولات مقارنة بـ Opus 4.8 وGrok 4.3.
2. أداء التجريب الخاص قد يعتمد على هياكل داخلية
قد يستفيد النموذج المُختبَر داخل SpaceX أو Tesla من أدوات داخلية ومحفزات منسّقة ومهام تقييم خاصة أو استرجاع متخصص. قد يتصرف إصدار API العام بشكل مختلف.
قائمة تحقق للتقييم:
- سجّل مُعرّف النموذج وتاريخ الإصدار بدقة.
- سجّل توافر الأدوات لكل تشغيل.
- افصل جودة النموذج عن جودة البنية المحيطة.
- تتبّع كمون p50 وp95.
- تتبّع أعطال الأدوات واستدعاءات الأدوات غير الصالحة.
- تجنب مقارنة عرض وكيل داخلي مع اتصال API خام.
3. التسعير وحدود السياق قد تمحو مكاسب المعايير
حتى لو كان Grok 4.5 أقوى، فقد لا يكون أرخص. سعر الرمز، نافذة السياق، حد المخرجات، التخزين المؤقت للمحفزات، حدود المعدل، وتكلفة استدعاء الأدوات كلها مهمة.
استخدم مقياس التوجيه هذا:
التكلفة الفعالة لكل مهمة محلولة = (تكلفة النموذج الأساسية + تكلفة المحاولات + تكلفة التراجع + تكلفة المراجعة البشرية) / المهام الناجحة
إذا حلّ Grok 4.5 مهام أكثر بمحاولات أقل، فقد يستحق سعر رموز أعلى. إذا استخدم رموزًا أكثر، أو دار في حلقات أطول، أو تطلب مراجعة أكثر، فلن يترجم ضجيج الإطلاق إلى تكلفة عبء عمل أقل.
كيف تُقيّم Grok 4.5 بنفسك
استفد من نافذة التسريب لإعداد التقييم قبل ظهور النموذج.
1. ابنِ مجموعة من 20 مهمة لوكيل برمجي
اشمل مهامًا حقيقية:
- إصلاح علة في مستودعك
- إعادة هيكلة متعددة الملفات
- ترحيل تبعيات
- إصلاح اختبار فاشل
- مراجعة كود مع تراجع طفيف
- تحديث توثيق مرتبط بالكود
- عيب واجهة مستخدم من لقطة شاشة مع المصدر
- مشكلة SQL أو خط أنابيب بيانات
- تدفق عمل باستدعاء أدوات
- سؤال مستودع سياقه طويل
2. شغّل المهام نفسها على خطوط أساس متاحة
لا تنتظر Grok 4.5 لبدء القياس. شغّل المجموعة نفسها على:
- Grok 4.3 للاستدلال العام الحالي من xAI
- Grok Build 0.1 لخط الأساس الرسمي من xAI في البرمجة حيثما يتوفر
- Claude Opus 4.8 لقدرات برمجة وعمل وكيلي عالية
- Claude Sonnet 5 للتوجيه الإنتاجي الأقل تكلفة
- نموذجك الإنتاجي الحالي
3. قِس تكلفة المهمة المحلولة
تتبّع:
- رموز الإدخال
- رموز الإخراج
- استدعاءات الأدوات
- المحاولات
- الرقع الفاشلة
- معدل اجتياز الاختبارات
- الكمون
- تعديلات المراجعين
- الدرجة النهائية نجاح/فشل
- التكلفة لكل رقعة مُعتمدة
لا تقارن مخرجات لمرة واحدة. قارن المهام نفسها، والتعليمات نفسها، والأدوات نفسها، ومعيار الدرجات نفسه.
4. أضف Grok 4.5 فقط بعد توفره علنًا
عندما تُظهر xAI أو CometAPI مُعرّف نموذج Grok 4.5 مستقرًا، أضِفه إلى التقييم نفسه. لا تُعد كتابة التقييم حول النموذج الجديد. الفكرة كلها أن يبقى المعيار مستقرًا بما يكفي ليعني القياس شيئًا.
5. قرّر وفق فئة عبء العمل
استخدم النموذج الفائز حسب نوع المهمة، لا حسب العلامة:
- استخدم النموذج الأرخص عندما يكون نجاح المهمة مشابهًا.
- استخدم Opus 4.8 عندما تكون الإخفاقات مكلفة ولم يثبت Grok 4.5 التكافؤ.
- استخدم Grok 4.5 فقط حيث يتفوق على الخطوط الأساسية الحالية في مهامك الخاصة.
- احتفظ بمسار تراجعي حتى تستقر معدلات الخطأ والكمون والتكلفة.
ما نعرفه مقابل ما لا يمكن التحقق منه بعد
مؤكد/مشير بقوة:
- أساس 1.5T V9 + تدريب تكميلي من Cursor.
- تجريب خاص داخل SpaceX/Tesla (28 يونيو 2026).
- ادعاء Musk المنسوب "قريب من/يتجاوز Opus".
- خارطة طريق نماذج شهرية جديدة.
- آثار كنارية في الواجهة.
غير مُتحقق/أسئلة مفتوحة:
- معايير دقيقة (لا بطاقة نظام).
- تاريخ الإصدار العام وتسعير API.
- نافذة السياق الكاملة والقدرات متعددة الوسائط.
- حجم بيانات Cursor الدقيق، والترخيص، ونسبة المزج.
- الأداء مقابل إصدار Opus محدد أو جبهات أخرى (مثل GPT-5.5، Gemini 3.x).
- Grok 4.5 مقابل نسخ Grok 5 الأكبر المشاعة.
عامِلوا الادعاءات كاتجاهات بائع. يُظهر التاريخ أن التقييمات الداخلية قد تختلف عن العامة؛ التحقق المستقل ضروري.
ما الذي يجب مراقبته لاحقًا
راقب خمسة أمور خلال الأسابيع المقبلة:
- تحديث وثائق نماذج xAI بإضافة مُعرّف نموذج Grok 4.5.
- ملاحظات إصدار xAI تؤكد الإتاحة العامة أو التجريبية.
- مقاييس مستقلة لوكلاء البرمجة، خصوصًا SWE-bench، وTerminal-Bench، ومهام وكيلة شبيهة بـ Cursor.
- تقارير مطورين حقيقية عن تدفقات عمل برمجية شبيهة بـ Cursor.
- تحديثات كتالوج أو لوحة تحكم CometAPI بشأن توفر Grok 4.5.
أول إشارة شراء موثوقة لن تكون منشور X فيروسيًا. ستكون مُعرّف نموذج بالإضافة إلى نتائج تقييم قابلة للتكرار.
نظرة مستقبلية: نماذج شهرية وما بعد ذلك
وتيرة xAI — نماذج أساس جديدة شهريًا — قد تعيد تعريف سرعة التكرار. Grok 4.5 قفزة تدريجية؛ وتَعِد نسخ Grok 5 بالمزيد. توقَّع استمرار التركيز على البحث عن الحقيقة، وروح الدعابة، والمنفعة الواقعية المتماشية مع رؤية Musk.
دعوة لاتخاذ إجراء: سجّل في CometAPI اليوم للوصول إلى نماذج Grok القوية بتكلفة معقولة والبقاء في الصدارة. تابع x.ai وX للحصول على تحديثات رسمية عن Grok 4.5. ثورة برمجة الذكاء الاصطناعي تتسارع — جهّز تدفقات عملك الآن.
