الخلاصة Claude Fable 5.1 هو في الأساس ترقية في التنفيذ القائم على الوكلاء. تظهر أكبر المكاسب المبلغ عنها في البحث العلمي، وأتمتة الأعمال، والبرمجة عبر الطرفية، وغيرها من سلاسل العمل التي تتطلب التخطيط، واستخدام الأدوات، والتحقق، والتعافي عبر العديد من الخطوات. التحسينات أصغر في الاستدلال المغلق النهاية ومهام البرمجة الأقصر بأسلوب IDE، لذا يعتمد أفضل قرار للنشر على عبء العمل بدلاً من الاعتماد على نتيجة عنوانية واحدة.
أهم النقاط
- يسجل Fable 5.1 نسبة 52.6% على Terminal-Bench-Science 0.1، أي أكثر من ضعفي 24.7% الخاصة بـ Fable 5 في تقييم Anthropic.
- يرتفع AutomationBench من 17.1% إلى 31.4%، ما يُظهر تحسناً كبيراً في سلاسل عمل الأعمال من طرف إلى طرف.
- المكاسب أكثر تواضعاً على CursorBench وHumanity’s Last Exam مع الأدوات، ما يشير إلى أن الإصدار يُحسّن التنفيذ المستمر أكثر مما يُحسّن جميع أشكال الاستدلال بدرجة متساوية.
- يحافظ Fable 5.1 على نفس أسعار الرموز القياسية مثل Fable 5، بينما يمكن لتسعير قراءة الذاكرة المؤقتة الأقل أن يخفض التكلفة الفعلية لسير عمل الوكلاء كثيف السياق.
- GPT-6 Astra هو الآن مقارنة OpenAI الأحدث، لكنه لم يُدرج في جدول معايير Anthropic بتاريخ 1 سبتمبر. أي ادعاء مباشر بالأداء يتطلب تقييماً مضبوطاً ضمن نفس الحاضنة.
أطلقت Anthropic نموذج Claude Fable 5.1 في 1 سبتمبر 2026 للمهام التي تتطلب استدلالاً صعباً، ووكلاء بعيدَي المدى، والهندسة البرمجية، والبحث، والعمل الاحترافي المعرفي. يتوفر Claude Fable 5.1 أيضاً عبر CometAPI للمطورين الذين يرغبون في تقييمه جنباً إلى جنب مع نماذج متقدمة أخرى عبر نقطة نهاية موحّدة.
النتائج العنوانية قوية، لكن توزيع التحسين أكثر إفادة من المتوسط. يحقق Fable 5.1 أكبر المكاسب عندما يتعين على الوكيل الحفاظ على الهدف، والتفاعل مع الأدوات، والتعافي من الأخطاء، والتحقق من الحالة النهائية. يركّز هذا المقال على ما تعنيه نتائج المعايير، وأين لا يزال النموذج ينقصه الأداء، وكيفية تقييمه مقابل البدائل الأحدث.
نظرة سريعة على Claude Fable 5.1
يحدد توثيق نموذج Anthropic نافذة سياق بسعة مليون رمز، وحداً أقصى للإخراج يبلغ 128 ألف رمز، وإدخالاً نصياً وصوراً، وتفكيراً تكيّفياً مُفعّلاً دائماً، وحد قطع للمعرفة في يونيو 2026. معرّف النموذج في Claude API هو claude-fable-5-1.
| المواصفات الرسمية | Claude Fable 5.1 |
|---|---|
| المزوّد | Anthropic |
| تاريخ الإصبار | September 1, 2026 |
| معرّف النموذج | claude-fable-5-1 |
| نافذة السياق | 1,000,000 tokens |
| الحد الأقصى للإخراج | 128,000 tokens |
| الإدخال / الإخراج | Text and images → text |
| التفكير | Adaptive, always on |
| مستوى الجهد الافتراضي | High |
| حد قطع المعرفة | June 2026 |
| سعر إدخال Anthropic | $10 / MTok |
| سعر إخراج Anthropic | $50 / MTok |
| قراءة الذاكرة المؤقتة | $0.25 / MTok |
| زمن الاستجابة المقارن | Slower |
| التموضع الأساسي | Demanding reasoning and long-horizon agentic work |
تظل أسعار الإدخال والإخراج القياسية كما هي في Fable 5، بينما انخفضت تكلفة قراءات الذاكرة المؤقتة إلى $0.25 لكل مليون رمز. لا يمتلك Fable 5.1 أسعار رموز إدخال/إخراج أقل عنوانياً. تأتي تكلفته الفعلية الأقل بشكل أساسي من خفض بنسبة 75% في تسعير قراءة الذاكرة المؤقتة. تقدّر Anthropic انخفاض التكلفة بنحو 25% لأعباء العمل النموذجية، وحتى نحو 45% لأعباء العمل الوكيلية العالية.
هذا مهم لأن الوكيل طويل التشغيل يعيد استخدام سياق المستودع والتعليمات وتعريفات الأدوات والحالة السابقة بشكل متكرر. يمكن أن تتحسن تكلفة المهمة المكتملة حتى لو لم تتغير أسعار رموز الإدخال والإخراج العنوانية.
تشير Anthropic أيضاً إلى نسبة 60.9% لـ Claude Mythos 5.1 على Terminal-Bench 4.0. يعد Mythos 5.1 إصداراً منشوراً بشكل منفصل مع ضوابط مختلفة ولا ينبغي اعتباره النتيجة المتاحة عموماً لـ Fable 5.1.
ماذا تُظهر معايير Claude Fable 5.1؟
تستند القيم التالية إلى تقييم Anthropic في سبتمبر 2026. وهي تصف إعداداً يجمع بين النموذج والحاضنة، وليست خاصية ثابتة للنموذج.
| المعيار | ما الذي يقيسه | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | بحث علمي وكيلّي | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | برمجة طرفية وكيليّة | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | عمل معرفة مهني، Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, partial | استخدام الكمبيوتر بعيد المدى (جزئي) | 77.9% | 72.9% | 75.4% | — |
| OSWorld 2.0, strict | مهام كمبيوتر مكتملة تماماً | 41.7% | 36.1% | 39.6% | — |
| Humanity’s Last Exam, no tools | استدلال متعدد التخصصات دون أدوات | 60.9% | 57.8% | 56.6% | — |
| Humanity’s Last Exam, with tools | استدلال خبير مع أدوات | 65.0% | 63.8% | 63.6% | — |
| AutomationBench | سير عمل أعمال من طرف إلى طرف | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | برمجة وكيليّة بأسلوب IDE | 73.4% | 70.5% | 70.0% | 67.2% |
يتفوّق Fable 5.1 على Fable 5 وOpus 5 عبر الصفوف التسعة المبلغ عنها. تظهر أكبر مكاسبه الجيلية في البحث العلمي، وأتمتة سير عمل الأعمال، وبرمجة الطرفية. كما أن الفروقات الأصغر في Humanity’s Last Exam وCursorBench مهمة لأنها تُظهر أن التحسين ليس موحّداً عبر كل عبء عمل.
أين يتحسن Claude Fable 5.1 أكثر؟
Terminal-Bench-Science 0.1: النتيجة الأبرز
يسجل Fable 5.1 نسبة 52.6%، مقارنة بـ 24.7% لـ Claude Fable 5، و29.0% لـ Claude Opus 5، و22.4% لـ GPT-5.6 Sol في تنفيذ Anthropic. الفجوة الجيلية الكبيرة البالغة 27.9 نقطة أكبر بكثير من الخطأ المعياري المبلغ عنه لكل نموذج، في حين يجب تفسير الفجوات الأصغر—مثل 3.5 نقاط بين Fable 5.1 وOpus 5 على Terminal-Bench 4.0—بحذر أكبر.
يقيم Terminal-Bench-Science سلاسل عمل بحثية كاملة عبر مجالات علمية وهندسية. يجب على الوكلاء إنتاج شيفرات وتحليلات وبراهين ومحاكاة أو منتجات بيانات بدلاً من مجرد الإجابة عن أسئلة معزولة. تبلغ Anthropic عن خطأ معياري بنحو ±3.5–4.5 نقاط لكل نموذج، لذا لا ينبغي تفسير الفجوات الصغيرة تلقائياً كفروقات ذات دلالة في القدرات.
Terminal-Bench 4.0: برمجة ذاتية أقوى
يصل Fable 5.1 إلى 55.8%، متقدماً على Fable 5 عند 42.0%، وOpus 5 عند 52.3%، وGPT-5.6 Sol عند 37.3%. التحسن بمقدار 13.8 نقطة فوق Fable 5 كبير، بينما التقدم بمقدار 3.5 نقاط على Opus 5 ضيق نسبياً.
يضع هذا المعيار الوكلاء في بيئة تنفيذ، لذا يعتمد النجاح على التنقل في البيئة، وتعديل الشيفرة، والتحقق من النتائج. وبما أن Terminal-Bench 4.0 يستخدم مجموعة مهام مختلفة عن الإصدارات السابقة، ينبغي إجراء المقارنات ضمن نفس إصدار المعيار فقط.
AutomationBench: مكسب كبير مع هامش تحسين ملحوظ
يرتفع AutomationBench من 17.1% على Fable 5 إلى 31.4% على Fable 5.1. هذا ارتفاع بمقدار 14.3 نقطة مطلقة، أو نحو 84% مكسب نسبي.
يقيم المعيار سلاسل العمل عبر المبيعات والتسويق والعمليات والدعم والمالية والموارد البشرية من خلال التحقق من الحالة النهائية للبيئة. هذا يجعله اختباراً مفيداً لمعرفة ما إذا كان الوكيل قد أكمل سلسلة العمل فعلياً بدلاً من مجرد اقتراح الإجراءات الصحيحة. كما تكشف النتيجة عن القيد المتبقي: نحو ثلثي المهام لم تُنجز بالكامل وفق إعداد Anthropic المبلغ عنه.
CursorBench 3.2.0: مكسب برمجي أصغر
يبلغ Fable 5.1 نسبة 73.4%، مقابل 70.5% لـ Fable 5، و70.0% لـ Opus 5، و67.2% لـ GPT-5.6 Sol. المكسب فوق Fable 5 يبلغ 2.9 نقطة فقط.
وعليه يبدو الإصدار أقل تحويلاً في مهام البرمجة الأقصر بأسلوب IDE مقارنة بسلاسل العمل الأطول التي تتضمن التخطيط والتنفيذ والتحقق والتعافي. ينبغي أن تتضمن مجموعات التقييم تغييرات على مستوى المستودع واسترجاع الفحوصات الفاشلة بدلاً من التركيز فقط على جودة توليد الشيفرة.
OSWorld 2.0: يظل استخدام الكمبيوتر صعباً
يسجل Fable 5.1 نسبة 77.9% مع رصيد جزئي و41.7% تحت شرط الإكمال الصارم. يصل Opus 5 إلى 75.4% و39.6%، بينما يصل Fable 5 إلى 72.9% و36.1%.
النتيجة الصارمة أكثر دلالة على الإنتاج. أقل من نصف المهام اكتملت بالكامل، ما يُظهر أن التقدم في استخدام الكمبيوتر لا يلغي الحاجة إلى نقاط فحص وأذونات ومراقبة ومنطق تعافٍ.
CursorBench وHumanity’s Last Exam: مكاسب أصغر
يبلغ Fable 5.1 نسبة 73.4% على CursorBench 3.2.0، أي أعلى بـ 2.9 نقطة فقط من Fable 5. في Humanity’s Last Exam، يزيد 3.1 نقاط دون أدوات و1.2 نقطة مع الأدوات.
تدعم هذه الفجوات الأضيق التفسير المركزي: Fable 5.1 أكثر تحويلاً في سلاسل العمل الطويلة التي تتضمن التخطيط والتنفيذ والتحقق والتعافي مقارنة بمهام IDE الأقصر أو الاستدلال الأكاديمي المغلق النهاية.
Claude Fable 5.1 مقابل Fable 5 مقابل GPT-6 Astra مقابل Opus 5
الإجابة الموجزة: Fable 5.1 هو الخيار الأقوى في جدول معايير المهام بعيدة المدى المنشور من Anthropic؛ Opus 5 هو نقطة البداية الأكثر اقتصادية عندما يكون فارق الأداء الصغير مقبولاً؛ Fable 5 يبقى خط الأساس القديم؛ GPT-6 Astra يتطلب اختباراً ضمن نفس الحاضنة قبل إجراء أي ترتيب مباشر.
يعد Fable 5.1 ترقية جيلية واضحة على Fable 5 وفق معايير الوكلاء بعيدي المدى التي أبلغت عنها Anthropic. يعد GPT-6 Astra مقارنة OpenAI الأحدث، لكنه صدر بعد تقييم Anthropic بتاريخ 1 سبتمبر ولم يُدرج ضمن نفس الحاضنة.
| البُعد | Claude Fable 5.1 | Claude Fable 5 | GPT-6 Astra |
|---|---|---|---|
| نافذة السياق | 1M tokens | 1M tokens | 1.05M tokens |
| الحد الأقصى للإخراج | 128K | 128K | 128K |
| سعر الإدخال / الإخراج القياسي | $10 / $50 per MTok | $10 / $50 per MTok | $10 / $50 per MTok |
| قراءة الذاكرة المؤقتة | $0.25 / MTok | $1 / MTok | تحقق من شروط المزوّد الحالية |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | غير مدرج في جدول الإطلاق لدى Anthropic |
| Terminal-Bench 4.0 | 55.8% | 42.0% | غير مدرج في جدول الإطلاق لدى Anthropic |
| AutomationBench | 31.4% | 17.1% | غير مدرج في جدول الإطلاق لدى Anthropic |
| التموضع الأساسي | استدلال صعب ووكلاء بعيدو المدى | خط أساس فئة Fable السابق | عمل احترافي صعب من طرف إلى طرف |
مقارنةً بـ Fable 5، يُظهر Fable 5.1 أكبر مكاسبه المقاسة في البحث العلمي، وأتمتة الأعمال، وبرمجة الطرفية مع الحفاظ على نفس أسعار الرموز القياسية. كما تحسّن الأسعار الأدنى لقراءة الذاكرة المؤقتة اقتصاديات الوكلاء الذين يعيدون استخدام السياق كثيراً.
قاعدة الاختيار: ابدأ بـ Opus 5 عندما تكون التكلفة أولوية، وتصعّد إلى Fable 5.1 عندما يكون الإكمال بعيد المدى والتعافي الأكثر أهمية، واحتفظ بـ Fable 5 فقط لأعباء العمل الحساسة للتوافق، وقيّم GPT-6 Astra ضمن اختبار مضبوط بنفس الحاضنة قبل الاعتماد الإنتاجي.
كيف تبدو نتائج المعايير حسب عبء العمل؟
| القدرة | نتيجة Fable 5.1 | التغير مقابل Fable 5 | التفسير |
|---|---|---|---|
| بحث علمي وكيلّي | 52.6% | +27.9 نقطة | مكسب كبير جداً |
| أتمتة سير عمل الأعمال | 31.4% | +14.3 نقطة | مكسب كبير جداً |
| برمجة طرفية | 55.8% | +13.8 نقطة | مكسب كبير |
| استخدام الكمبيوتر، صارم | 41.7% | +5.6 نقاط | مكسب متوسط |
| استخدام الكمبيوتر، جزئي | 77.9% | +5.0 نقاط | مكسب متوسط |
| استدلال خبير، دون أدوات | 60.9% | +3.1 نقاط | مكسب صغير |
| برمجة وكيليّة بأسلوب IDE | 73.4% | +2.9 نقاط | مكسب صغير |
| استدلال خبير، مع أدوات | 65.0% | +1.2 نقطة | مكسب صغير |
| عمل معرفة مهني | 1853 Elo | +130 Elo | قوي، حساس لتهيئة التشغيل |
النمط متسق: تظهر أكبر التحسينات عندما يعتمد النجاح على المثابرة والتخطيط والتفاعل مع البيئة واستخدام الأدوات والتعافي بمرور الوقت.
ما الذي لا تخبرك به المعايير؟
تضغط جداول المعايير السلوك في أرقام مفردة. إنها لا تثبت أن الوكلاء المستقلين قد تم حلهم، ولا تتنبأ بكل عبء عمل إنتاجي.
- الجدول الرئيسي للمقارنة مُدار من البائع.
- تؤثر إعدادات الجهد على الجودة والزمن والتكلفة.
- تقيس معايير الوكلاء المزيج بين النموذج والحاضنة والأدوات والأذونات.
- كانت ضوابط الإنتاج مفعّلة لـ Fable 5.1 وأثرت على بعض النتائج.
- تتغير إصدارات المعايير، لذا قد لا تكون القيم من إصدارات مهام مختلفة قابلة للمقارنة.
- يبقى AutomationBench عند 31.4%، بينما يبقى الإكمال الصارم لـ OSWorld عند 41.7%؛ ما تزال معدلات الإخفاق كبيرة.
يجب أن يستخدم التقييم العملي النتائج العامة لإعداد قائمة مختصرة من المرشحين، وإعادة إنتاج مقارنة صغيرة بإعدادات متطابقة، ثم اختبار سير العمل الإنتاجي الفعلي.
هل Claude Fable 5.1 هو أفضل نموذج Claude؟
لأقصى قدرة على العمل الصعب طويل الأمد، تقدم أدلة المعايير حجة قوية لصالح Claude Fable 5.1. أما لجميع أعباء العمل، فلا.
تسعّر Anthropic استخدامه عند $10 لكل مليون رمز إدخال و$50 لكل مليون رمز إخراج، مقابل $5 و$25 لـ Opus 5. لا يبرر القسط إلا عندما يحقق Fable 5.1 معدل نجاح أعلى، وعدداً أقل من المحاولات، وعدداً أقل من الرموز لكل مهمة مقبولة، أو تقليصاً كافياً لوقت المراجعة البشرية.
يمكن لتسعير قراءة الذاكرة المؤقتة المنخفض تضييق فجوة التكلفة الفعلية للوكلاء. ولذلك فإن تكلفة كل نتيجة مقبولة أكثر فائدة من سعر الرمز وحده.
كيف ينبغي لك قياس أداء Claude Fable 5.1؟
ينبغي أن يشبه تقييمك عبء العمل الإنتاجي المقصود.
- البرمجة: اختبر قضايا مكتملة وسجّل قبول الرقع، والاختبارات المجتازة، والمحاولات، واستدعاءات الأدوات، والوقت المنقضي، ووقت التصحيح البشري.
- البحث: قيّم جودة المصادر، والدقة الواقعية، وتغطية الأدلة، وإكمال المهام الفرعية، والحفاظ على الهدف عبر الجلسات الطويلة.
- وكلاء الأعمال: قيّم الحالة النهائية للبيئة بدلاً من عدّ الإجراءات الصحيحة فردياً.
- استخدام الكمبيوتر: قِس التعافي من النوافذ المنبثقة، والصفحات البطيئة، والجلسات المنقطعة، وحالات التطبيق غير المتسقة.
- مقارنة النماذج: حافظ على ثبات المطالبات والحاضنات والأدوات والأذونات وإعدادات الجهد وقواعد التقييم.
- الاقتصاديات: قِس التكلفة لكل مهمة مقبولة، لا تكلفة الرمز فقط.
الخلاصة
تشير أدلة المعايير إلى أن Fable 5.1 ذو قيمة أكبر عندما تتطلب المهمة تنفيذاً مستداماً بدلاً من استجابة واحدة. تشمل أقوى حالات الاستخدام البحث العلمي، والبرمجة الذاتية، وأتمتة الأعمال المعقدة، وسلاسل العمل التي تتضمن التحقق والتعافي المتكرر.
لا تدعم الأدلة تفوقاً شاملاً. الفجوات الأصغر على عدة معايير، ومعدلات الإخفاق الملحوظة في مهام استخدام الكمبيوتر الصارمة، وغياب GPT-6 Astra عن جدول إطلاق Anthropic كلها تعزز الحاجة إلى اختبارات خاصة بعبء العمل.
لمستخدمي CometAPI، تتمثل قاعدة نشر عملية في اختبار Fable 5.1 حيث يمكن أن يبرر النجاح بعيد المدى تكلفة الاستدلال المتميزة، ثم مقارنته مع Opus 5 وGPT-5.6 Sol وGPT-6 Astra على نفس المهام التمثيلية قبل اختيار مسار الإنتاج.
الأسئلة الشائعة
ما أعلى نتيجة معيارية لـ Claude Fable 5.1؟
من بين مقاييس النسب المئوية التي أبلغت عنها Anthropic، يصل Fable 5.1 إلى 77.9% رصيداً جزئياً على OSWorld 2.0 و73.4% على CursorBench 3.2.0. أكبر تحسّن جيلي له هو Terminal-Bench-Science، عند 52.6% مقابل 24.7% لـ Fable 5.
إلى أي مدى يتفوق Claude Fable 5.1 على Fable 5؟
يختلف المكسب بشدة حسب عبء العمل: 27.9 نقطة على Terminal-Bench-Science، و14.3 على AutomationBench، و13.8 على Terminal-Bench 4.0، ولكن 2.9 فقط على CursorBench و1.2 على Humanity’s Last Exam مع الأدوات.
هل Claude Fable 5.1 أفضل من Claude Opus 5؟
يسجل أعلى عبر الجدول الذي أبلغت عنه Anthropic، لكن العديد من الفجوات صغيرة. توصي Anthropic بالبدء بـ Opus 5 والتصعيد عندما تكون القدرات الإضافية بعيدة المدى مطلوبة.
هل يتفوق Claude Fable 5.1 على GPT-5.6 Sol؟
تفيد Anthropic بنتائج أعلى لـ Fable 5.1 في خمسة مقاييس مشتركة. وبما أن هذه تقييمات منافسين تُدار من البائع وتختلف الإعدادات، فالاستنتاج الآمن هو أن Fable 5.1 منافس جداً وليس متفوقاً عالمياً.
هل تم التحقق من النتائج بشكل مستقل؟
جزئياً فقط. لدى عدة معايير لوائح ترتيب عامة، لكن يجب توحيد الجهد والحاضنة وسلوك التراجع وإصدارات المهام قبل أن يمكن مقارنة قيمها مباشرة مع تشغيل إطلاق Anthropic.
ما أفضل استخدامات Claude Fable 5.1؟
تكون بصمته المعيارية الأقوى في البحث العلمي طويل الأمد، والبرمجة الذاتية، وسلاسل عمل الوكلاء المعقدة، وأتمتة الأعمال، والمهام التي تتطلب التخطيط والأدوات والتحقق والتعافي.
كيف يمكنني الوصول إلى Claude Fable 5.1؟
Claude Fable 5.1 مُدرج على CometAPI بمعرّف نموذج claude-fable-5-1. تتيح نقطة نهاية موحدة تشغيل نفس عبء التقييم عبر عدة نماذج قبل اختيار مسار الإنتاج.
