على مدى السنوات القليلة الماضية، كانت أهم التطورات في الذكاء الاصطناعي مدفوعة بتقنية واحدة قبل غيرها:
نماذج اللغة الضخمة، أو ما يُعرف بـ LLMs.
من GPT وClaude إلى Gemini وQwen وDeepSeek وGrok، حسّنت النماذج الحدودية بسرعة قدرتها على الاستدلال وكتابة الشيفرة وتحليل المعلومات وتوليد المحتوى والتفاعل مع البرمجيات.
لكن سؤالًا أكثر أهمية يطفو الآن على السطح: هل يمكن للذكاء الاصطناعي فعليًا إتمام مهام معقدة بشكل مستقل، بدلًا من مجرد الإجابة عن الأسئلة؟ هذا السؤال يغيّر اتجاه صناعة الذكاء الاصطناعي بأكملها.
تتشكّل المرحلة التالية من الذكاء الاصطناعي بشكل متزايد وفق اتجاهين تقنيين رئيسيين:
- وكلاء LLM ونماذج العالم.
- تركّز وكلاء LLM على الاستدلال والتخطيط واستخدام الأدوات والتنفيذ.
تركّز نماذج العالم على فهم البيئات، وتنبؤ النتائج، ومحاكاة ما قد يحدث لاحقًا.
هذه ليست بالضرورة مقاربات متنافسة.
في الواقع، قد تصبح مكوّنين تكميليين لنظام ذكي واحد: LLM + وكيل + نموذج عالم + ذاكرة + أدوات + بيئة. هذا التطور يخلق أيضًا فرصة مهمة لمنصات بنية الذكاء الاصطناعي التحتية مثل CometAPI.
يمكن لـ CometAPI أن تتجاوز كونها طبقة واجهات برمجة تطبيقات موحّدة لنماذج الذكاء الاصطناعي، وتصبح تدريجيًا طبقة بنية تحتية تربط أشكالًا مختلفة من الذكاء الآلي.
من LLM إلى الوكلاء: الذكاء الاصطناعي ينتقل من الإجابات إلى الأفعال
كانت تطبيقات LLM المبكرة بسيطة نسبيًا:
User
↓
Prompt
↓
LLM
↓
Answer
يطرح المستخدم سؤالًا ويولّد النموذج استجابة.
هذا يعمل على نحو ممتاز للعديد من مهام المعرفة.
لكن مشاكل العالم الحقيقي نادرًا ما تكون أسئلة من خطوة واحدة.
انظر إلى طلب مثل:
“حلّل سوق واجهات برمجة تطبيقات الذكاء الاصطناعي في الولايات المتحدة وأنشئ استراتيجية دخول إلى السوق.”
هذا ليس سؤالًا بالمعنى الدقيق.
إنها مهمة.
قد يتطلب إتمامها:
Understand the objective
↓
Search the web
↓
Collect competitors
↓
Analyze market data
↓
Organize information
↓
Develop hypotheses
↓
Create a strategy
↓
Evaluate the result
↓
Revise the strategy
هذا يغيّر نموذج التفاعل الأساسي من:
Prompt → Answer
إلى:
Goal → Reason → Plan → Act → Observe → Evaluate → Repeat
هذا هو أساس وكيل LLM.
يبقى LLM محرّك الاستدلال، لكنه لم يعد مسؤولًا فقط عن توليد النص.
بل يصبح مسؤولًا عن:
- فهم الأهداف
- تفكيك المهام المعقدة
- التخطيط
- اختيار الأدوات
- استدعاء واجهات برمجة التطبيقات
- تصفح الويب
- كتابة الشيفرة وتنفيذها
- تقييم النتائج
- تعديل الخطط
- إتمام سير عمل طويلة الأمد
بهذا المعنى، يمثّل الوكيل انتقالًا:
من LLM كمولّد لغة إلى LLM كمنفّذ مهام عام.
جوهر الوكيل حلقة مغلقة
الوكيل الحقيقي أكثر بكثير من مجرد نموذج بقدرة استدعاء أدوات.
تبدو حلقة الوكيل الكاملة أقرب إلى:
Goal
↓
Reasoning
↓
Planning
↓
Tool Selection
↓
Action
↓
Observation
↓
Evaluation
↓
Re-planning
↓
Action
↓
...
تأمّل وكيل برمجة.
يقول المستخدم:
“أصلح مشكلة الدفع في هذا المشروع.”
قد يقوم الوكيل بـ:
Analyze the codebase
↓
Locate the bug
↓
Read logs
↓
Modify code
↓
Run tests
↓
Discover another issue
↓
Modify code again
↓
Run tests
↓
Commit the changes
الاختراق المهم ليس مجرد أن النموذج أصبح أفضل في الإجابة عن الأسئلة.
بل إن:
الذكاء الاصطناعي يكتسب بُعد الزمن.
قد يستغرق تفاعل LLM التقليدي ثواني أو دقائق.
بينما يمكن أن يستغرق سير عمل الوكيل:
- 30 دقيقة
- عدة ساعات
- عدة أيام
- وفي النهاية، ربما أسابيع أو أكثر
هذا يغيّر طريقة تقييمنا لأنظمة الذكاء الاصطناعي.
ستظل المعايير التقليدية مثل درجات الاستدلال والبرمجة مفيدة.
لكن المقاييس الأكثر أهمية قد تصبح:
معدل إتمام المهام × أفق المهمة
بعبارة أخرى:
كم مرة ينجح النظام، وكم من الوقت يمكنه الاستمرار في العمل بنجاح؟
قد يصبح هذا مقياسًا أكثر معنى للتقدم نحو AGI من الاعتماد على درجات المعايير وحدها.
لكن هناك مشكلة جوهرية: هل يفهم الوكيل العالم فعليًا؟
هنا تكتسب نماذج العالم أهميتها.
تخيّل إعطاء روبوت التعليمات التالية:
“ضع الكوب الموجود على الطاولة داخل الخزانة.”
يمكن لوكيل LLM توليد خطة معقولة:
1. Locate the cup
2. Move toward the cup
3. Grasp the cup
4. Locate the cabinet
5. Move toward the cabinet
6. Place the cup inside
من منظور اللغة وتخطيط المهام، يبدو هذا منطقيًا.
لكن العالم الفيزيائي أكثر تعقيدًا بكثير.
يحتاج الروبوت إلى فهم:
- الموضع ثلاثي الأبعاد للكوب
- اتجاهه
- وزنه
- مسار الروبوت
- الاحتكاك
- قيود الاصطدام
- هندسة الطاولة
- موقع الخزانة
- نقطة الإمساك المثلى
- عواقب الأفعال المختلفة
إذا نفّذ الروبوت ببساطة أول إجراء يبدو معقولًا، فقد يفشل بسهولة.
يحتاج إلى تمثيل داخلي للبيئة وديناميكيتها.
يحتاج إلى الإجابة عن:
“إذا نفّذت هذا الإجراء، ماذا سيحدث لاحقًا؟”
هذا هو جوهر مشكلة نموذج العالم.
نماذج العالم: من فهم العالم إلى التنبؤ به
يمكن فهم نموذج العالم تقريبًا على أنه:
نموذج يتنبّأ بكيفية تغيّر العالم بناءً على الحالة الحالية وإجراء ما.
مفهوميًا:
Current State + Action
↓
World Model
↓
Future State
على سبيل المثال:
Robot grasps cup
↓
World Model
↓
Prediction:
The cup may fall
جرّب إمساكًا آخر:
Robot approaches from the right
↓
World Model
↓
Prediction:
Higher probability of success
لم يعد النظام ببساطة:
فكّر → تصرّف → انظر ما يحدث.
بل يمكن أن يصبح:
فكّر → حاكي → قارن المستقبلات الممكنة → اختر → تصرّف.
هذا تحول كبير.
Without a World Model
Think
↓
Act
↓
Observe
↓
Correct
With a World Model
Think
↓
Imagine
↓
Simulate
↓
Compare futures
↓
Choose
↓
Act
↓
Observe
↓
Update
هذه القدرة مهمة بشكل خاص لـ:
- الروبوتات
- المركبات ذاتية القيادة
- الألعاب
- توليد الفيديو
- الذكاء الفيزيائي
- المحاكاة
- الوكلاء في العالم الحقيقي
وكلاء LLM ونماذج العالم متكاملون
من المغري النظر إلى وكلاء LLM ونماذج العالم كمقاربات متنافسة.
الإطار الأكثر فائدة هو:
الوكيل يقرّر ماذا يفعل. نموذج العالم يتنبّأ بما سيحدث إن فعل ذلك.
تبدو مقارنة مبسّطة على النحو التالي:
| القدرة | وكيل LLM | نموذج عالم |
|---|---|---|
| فهم الأهداف | قوي | مساند |
| اللغة | قوي | غير محوري |
| الاستدلال | قوي | جزئي |
| تخطيط المهام | قوي | مساند |
| استخدام الأدوات | قوي | غير محوري |
| فهم البيئة | محدود | قوي |
| ديناميكيات العالم | محدود | قوي |
| تنبؤ المستقبل | محدود | قدرة جوهرية |
| المحاكاة الفيزيائية | محدود | قدرة جوهرية |
| اتخاذ القرار | قوي | يوفّر تنبؤات |
| التعلم طويل الأمد | بحاجة إلى تحسين | أساس مهم |
قد يبدو نظام أكثر اكتمالًا للذكاء كما يلي:
Goal
↓
LLM Agent
↓
Planning
↓
┌────────┴────────┐
↓ ↓
Action World Model
↓ ↓
Environment ← Prediction
↓
Observation
↓
Memory
↓
Agent
هذا أقرب بكثير إلى حلقة ذكاء مكتملة.
يمكن للوكلاء ونماذج العالم تحسين بعضهم البعض أيضًا
هناك علاقة مهمة أخرى.
يمكن للوكلاء توليد الخبرة، بينما تستطيع نماذج العالم التعلم من تلك الخبرة.
على سبيل المثال:
State₁
↓
Action₁
↓
State₂
↓
Action₂
↓
State₃
هذا ينتج مسارًا:
حالة → فعل → الحالة التالية
يمكن لكميات كبيرة من هذه المسارات أن تساعد نموذج العالم على تعلم:
“كيف تتغيّر البيئة عند اتخاذ أفعال مختلفة؟”
يمكن حينها لنموذج العالم مساعدة الوكيل في الإجابة عن:
“أي فعل هو الأرجح لإنتاج النتيجة المرغوبة؟”
هذا يخلق حلقة تغذية راجعة إيجابية:
Agent
↓
Action
↓
Environment
↓
Experience
↓
World Model
↓
Prediction
↓
Better Planning
↓
Better Agent
↺
على المدى الطويل، قد لا تبقى الوكلاء ونماذج العالم أنظمة منفصلة.
قد تصبح أجزاء من بنية ذكاء تتحسن باستمرار.
لماذا قد تصبح نماذج الفيديو مسارًا مهمًا نحو نماذج العالم
أحد أكثر التطورات إثارة هو التقدم السريع في توليد الفيديو وتنبؤ الفيديو.
يسأل توليد الفيديو التقليدي:
“بالنظر إلى هذا التوجيه، هل يمكن للنموذج توليد فيديو واقعي؟”
لكن النموذج الأقوى يحتاج إلى تعلم أكثر من المظهر البصري.
يحتاج إلى فهم:
Objects
↓
Movement
↓
Interaction
↓
Physics
↓
Future State
تأمّل كرة تتدحرج عن حافة طاولة.
ينبغي للنموذج الذي يفهم الحدث حقًا ألا يكتفي بتوليد تسلسل بصري مقنع.
بل يجب أن يفهم:
- لماذا تتحرك الكرة
- كيف يؤثر انحدار الطاولة عليها
- كيف تتغير السرعة
- ماذا يحدث بعد الاصطدام
- أين ستكون الكرة لاحقًا
هذا يوحي بتطور محتمل:
توليد الفيديو → تنبؤ الفيديو → نموذج العالم
لهذا أحد الأسباب التي تجعل مستقبل سباق الذكاء الاصطناعي قد يمتد إلى ما هو أبعد بكثير من LLMs النصية.
يضم السباق بشكل متزايد:
- الفيديو
- الثلاثي الأبعاد
- الروبوتات
- المحاكاة
- الفيزياء
- الذكاء المكاني
أين يقع دور CometAPI؟
إذا نُظر إلى CometAPI ببساطة على أنه:
“منصة توفّر الوصول إلى العديد من واجهات برمجة تطبيقات LLM.”
فهذا التعريف ضيق للغاية.
الفرصة الأوسع هي:
CometAPI كبنية تحتية لنماذج الذكاء الاصطناعي.
اليوم، قد يحتاج المطورون إلى دمج:
GPT API
Claude API
Gemini API
Qwen API
DeepSeek API
Grok API
Image API
Video API
Audio API
يمكن أن يمتلك كل مزوّد عناصر مختلفة:
- واجهات برمجة التطبيقات
- حزم SDK
- المصادقة
- التسعير
- حدود السياق
- معرّفات النماذج
- حدود المعدّل
- صيغ الاستجابة
- أنظمة الفوترة
هذا يخلق عبئًا كبيرًا على البنية التحتية.
يمكن لـ CometAPI تجريد ذلك التعقيد:
AI Application
↓
CometAPI
↓
┌─────────────────┼─────────────────┐
↓ ↓ ↓
LLM Agent World Model
↓ ↓ ↓
GPT / Claude Coding Agent Video Model
Gemini / Qwen Research Agent 3D Model
DeepSeek / Grok Browser Agent Robotics
عند هذه النقطة، تتطور CometAPI من مجمّع واجهات برمجة تطبيقات إلى بوابة نماذج ذكاء اصطناعي، وفي نهاية المطاف إلى بنية تحتية للذكاء الاصطناعي.
في عصر الوكلاء، يصبح توجيه النماذج أكثر قيمة بكثير
قد تحتاج التطبيق التقليدي إلى نموذج واحد فقط.
الوكيل مختلف.
قد يحتاج وكيل واحد إلى نماذج متعددة.
تأمّل وكيل بحث:
User Task
↓
Planner
↓
Reasoning Model
↓
Search
↓
Vision Model
↓
Coding Model
↓
Summarization Model
↓
Final Answer
إذا جاء كل نموذج من مزود مختلف، فعلى المطورين إدارة كمية كبيرة من البنية التحتية.
هذا يخلق فرصة كبيرة لـ:
توجيه النماذج.
على سبيل المثال، يمكن للمطور إرسال:
{
"task": "research",
"budget": 1.5,
"latency": "fast",
"quality": "high"
}
يمكن لـ CometAPI اختيار النموذج المناسب بناءً على:
- نوع المهمة
- التكلفة
- زمن الاستجابة
- الجودة
- متطلبات السياق
- التوافر
- قدرات النموذج
تصبح البنية على النحو التالي:
Agent
↓
CometAPI Router
↓
┌────────────┼────────────┐
↓ ↓ ↓
GPT Claude Gemini
↓ ↓ ↓
Qwen DeepSeek Grok
هذا خطوة تتجاوز توحيد واجهات برمجة التطبيقات.
تجيب المنصة عن سؤال أكثر قيمة بكثير:
أي ذكاء يجب أن يستخدمه الوكيل لهذه المهمة؟
قد تصبح واجهات نماذج العالم طبقة التوسع التالية
بينما تتوسع نماذج الذكاء الاصطناعي من LLMs نحو نماذج العالم، سيتغيّر النظام البيئي للنماذج ذاته.
اليوم، قد يبدو فهرس النماذج كما يلي:
Models
├── Chat
├── Image
├── Video
└── Audio
وغدًا قد يصبح:
Models
├── Language
│ ├── Reasoning
│ ├── Coding
│ └── Agent
│
├── Perception
│ ├── Vision
│ ├── Audio
│ └── Multimodal
│
├── World Model
│ ├── Video World Model
│ ├── 3D World Model
│ ├── Physics Model
│ └── Robotics Model
│
└── Generation
├── Image
├── Video
├── Audio
└── 3D
عند تلك المرحلة، لن تكون CometAPI ببساطة:
“سوق واجهات برمجة تطبيقات LLM.”
بل تصبح:
طبقة بنية تحتية موحدة للوصول إلى أشكال مختلفة من الذكاء الاصطناعي.
بنية مستقبل وكيل + نموذج عالم + CometAPI
قد يبدو تطبيق ذكاء اصطناعي مستقبلي على النحو التالي:
AI Application
│
↓
Agent Runtime
│
↓
┌───────────┐
│ CometAPI │
└─────┬─────┘
│
┌──────────────────┼──────────────────┐
↓ ↓ ↓
Reasoning Perception World Model
│ │ │
GPT / Claude Vision / Audio Video / 3D
Gemini / Qwen Multimodal Robotics
│ │ │
└──────────────────┼──────────────────┘
↓
Action
↓
Environment
↓
Observation
↓
Memory
↓
Agent Runtime
لا تحتاج CometAPI إلى تدريب كل نموذج بنفسها.
مسؤوليتها الأساسية هي حل مشكلة مختلفة:
كيف يمكن للمطورين الوصول إلى النظام البيئي بأكمله لنماذج الذكاء الاصطناعي من خلال واجهة بسيطة وموثوقة؟
هذا يغيّر تموضع منتج CometAPI
يتنافس العديد من منصات واجهات الذكاء الاصطناعي أساسًا على:
“كم عدد النماذج التي ندعمها؟”
هذا مفيد، لكنه أيضًا سهل التقليد نسبيًا.
السؤال الأكثر قيمة هو:
هل يمكننا مساعدة وكيل ما على الوصول إلى الذكاء المناسب للمهمة التي يحتاج لإتمامها؟
هذا يوحي بتطور أوسع.
Phase 1
Unified AI API
One API for multiple models.
↓
Phase 2
AI Model Gateway
Unified:
- Models
- Billing
- Authentication
- Monitoring
- Routing
↓
Phase 3
AI Agent Infrastructure
Unified access to:
- LLMs
- Vision
- Coding
- Search
- Tools
- Memory
- Routing
- Evaluation
↓
Phase 4
AI Intelligence Infrastructure
Unified access to:
- LLMs
- Agent Models
- World Models
- Video Models
- Robotics Models
- Simulation Models
يمكن تلخيص الرؤية المنتجية طويلة الأمد على النحو التالي:
واجهة برمجة واحدة. كل ذكاء.
ذكاء النماذج، والتوجيه، والتقييم تصبح الحواجز التنافسية الحقيقية
لا تحتاج CometAPI بالضرورة إلى التركيز فقط على إضافة المزيد من النماذج.
قد تصبح ثلاث قدرات أكثر قيمة بكثير.
ذكاء النماذج
معرفة: أي نموذج هو الأفضل لأي مهمة؟
على سبيل المثال:
Coding → Claude / GPT / Qwen
Reasoning → GPT / Gemini / DeepSeek
Image → Model A
Video → Model B
Voice → Model C
World Simulation → Model D
يمكن تنظيم هذه المعلومات في طبقة ذكاء النماذج.
توجيه النماذج
معرفة: أي نموذج يجب استدعاؤه الآن؟
ينبغي أن يأخذ الموجّه في الاعتبار أكثر من درجات المعايير:
- التكلفة
- زمن الاستجابة
- معدل النجاح
- الموثوقية
- السياق
- قدرة استخدام الأدوات
- التوافر الحالي
هذا يصبح توجيهًا ذكيًا للنماذج.
تقييم النماذج
معرفة: هل هذا النموذج مناسب بالفعل لمهمتي؟
يمكن لـ CometAPI بناء طبقة تقييم:
Model
↓
Benchmark
↓
Real-world Task
↓
Agent Evaluation
↓
Latency
↓
Cost
↓
Reliability
↓
Recommendation
تصبح المنصة أكثر من مجرد دليل نماذج.
تصبح:
نظام قرار للنماذج.
هذا يخلق أيضًا فرصة كبرى في SEO وGEO
يخلق الإصدار المستمر لنماذج جديدة دورة اكتشاف دائمة.
يمكن أن يشمل الطلب عبر البحث:
- GPT API
- Claude API
- Gemini API
- أفضل نموذج للبرمجة
- أفضل وكيل
- أفضل نموذج للاستدلال
- أفضل نموذج مفتوح المصدر
- أفضل نموذج للفيديو
- أفضل نموذج للعالم
- GPT vs Claude
- Claude vs Gemini
- DeepSeek vs Qwen
يمكن أن تتطور كل صفحة نموذج من:
النموذج + التسعير + وثائق API
إلى:
Model Overview
↓
Capabilities
↓
Benchmarks
↓
Agent Performance
↓
World Model Capability
↓
Latency
↓
Pricing
↓
Use Cases
↓
Alternatives
↓
Comparison
↓
API
هذا يخلق رسمًا بيانيًا معرفيًا واسعًا لنماذج الذكاء الاصطناعي.
والأهم، أن كل إطلاق نموذج يخلق دورة محتوى:
ما قبل الإطلاق → الإطلاق → المعايير → المقارنة → الاعتماد
يمكن أن يصبح هذا دولاب نمو قويًا.
2026–2028: قد يتحول التنافس في الذكاء الاصطناعي من ذكاء النماذج إلى ذكاء الأنظمة
قد تغيّر السنوات القادمة معنى “أفضل نموذج”.
قد يتحول السؤال تدريجيًا من: “أي نموذج لديه أعلى درجات معيارية؟” إلى: “أي نظام ذكاء اصطناعي يمكنه إتمام مهام العالم الحقيقي بشكل موثوق لأطول فترة زمنية؟”
قد يبدو تطور ممكن كما يلي:
2024–2025
LLM
↓
Reasoning
2025–2026
LLM
↓
Agent
↓
Tool Use
↓
Computer Use
2026–2027
Agent
+
Memory
+
Multimodal
+
World Model
2027–2028+
World Model
+
Agent
+
Planning
+
Long-term Memory
+
Real-world Action
هنا يبدأ الذكاء الاصطناعي بالاقتراب أكثر مما نسمّيه تقليديًا بالذكاء العام.
قد لا يكون AGI نموذجًا. قد يكون حلقة مغلقة.
قد تكون هذه واحدة من أهم الأفكار لفهم مستقبل الذكاء الاصطناعي.
قد لا يعني AGI ببساطة: “تدريب LLM ضخم للغاية.”
بل قد يعني بناء حلقة ذكاء مكتملة:
Goal
↓
Intelligence
↓
World Model
↓
Planning
↓
Action
↓
World
↓
Observation
↓
Memory
↓
Learning
↓
Intelligence
↺
في مثل هذا النظام:
- يوفّر LLM اللغة والمعرفة والتجريد والاستدلال.
- يوفّر الوكيل التخطيط المدفوع بالأهداف والفعل.
- يوفّر نموذج العالم محاكاة داخلية للبيئة.
- توفّر الذاكرة الخبرة المتراكمة.
- توفّر الأدوات وواجهات برمجة التطبيقات والروبوتات القدرة على الفعل.
ويمكن لـ CometAPI أن تصبح البنية التحتية التي تربط نماذج الذكاء المختلفة.
الفرصة الأكبر: من بوابة API إلى بوابة الذكاء
ربما تكون هذه أهم فرصة استراتيجية لـ CometAPI.
اليوم: “امنحني الوصول إلى GPT وClaude وGemini ومئات نماذج الذكاء الاصطناعي.”
غدًا: “امنح وكيلي أي ذكاء يحتاجه لإتمام المهمة.”
قد تبدو العبارتان متشابهتين، لكنهما تمثلان عملين مختلفين للغاية.
الأولى تبيع:
- الوصول إلى واجهة برمجة التطبيقات.
- والثانية تبيع:
- بنية تحتية للذكاء.
لذا يتطور المشهد التنافسي:
Model Count
↓
Model Availability
↓
Unified API
↓
Routing
↓
Evaluation
↓
Agent Infrastructure
↓
World Model Infrastructure
↓
AI Intelligence Infrastructure
الخلاصة
ليس وكلاء LLM ونماذج العالم مقاربتين متنافستين بالضرورة.
قد يصبحان مكوّنين أساسيين في بنية ذكاء عام واحدة.
تحدد وكلاء LLM ما ينبغي التفكير فيه، وما ينبغي التخطيط له، وما ينبغي فعله.
تساعد نماذج العالم في التنبؤ بما سيحدث عند اتخاذ تلك الأفعال.
معًا، يمكّنان حلقة أقوى بكثير:
فهم الهدف → محاكاة المستقبلات الممكنة → إنشاء خطة → اتخاذ فعل → ملاحظة النتيجة → التعلم → الفعل مجددًا.
هذا شكل مختلف جذريًا من الذكاء الاصطناعي مقارنة بمجرد توليد إجابة لتوجيه.
وهنا تكمن فرصة تطور CometAPI.
اليوم، يمكن لـ CometAPI مساعدة المطورين على الوصول إلى عدة LLM عبر API واحدة.
وغدًا، يمكنها مساعدة الوكلاء على اختيار نموذج الاستدلال المناسب، ونموذج البرمجة، ونموذج الرؤية، ونموذج الفيديو، وفي نهاية المطاف نموذج العالم لكل مهمة.
وفي المستقبل الأبعد، قد تصبح طبقة بنية تحتية تربط:
LLMs + الوكلاء + نماذج العالم + النماذج متعددة الوسائط + الروبوتات + المحاكاة.
قد لا تُعرّف الجيل التالي من بنية الذكاء الاصطناعي من خلال سؤال: “أين يمكنني الوصول إلى LLM؟”
بل قد يصبح السؤال: “أين يمكن لوكيلي الحصول على الذكاء الذي يحتاجه ليفهم ويتصرف في العالم؟”
هناك حيث تتقاطع في النهاية وكلاء LLM ونماذج العالم وCometAPI. واجهة واحدة. كل ذكاء.
