المواصفات التقنية لـ Gemini 4 Argon
| المواصفة | Gemini 4 Argon |
|---|---|
| المزوّد | Google DeepMind |
| عائلة النموذج | Gemini 4 |
| معرّف النموذج | gemini-4-argon |
| نوع النموذج | نموذج استدلال متعدد الوسائط متقدم |
| التركيز الأساسي | تدفقات عمل معقدة، الترميز المعتمد على الوكلاء، أعمال المعرفة المؤسسية، الأمن السيبراني |
| القدرة متعددة الوسائط | تصف Google فهماً متعدد الوسائط؛ صفحة النموذج العامة لا توفر بعد مخططاً كاملاً لأنماط واجهة برمجة التطبيقات (API) |
| الحد الأقصى للمخرجات | حتى 1,000,000 رمز، وفقاً لقوائم واجهات برمجة التطبيقات الحالية لأطراف ثالثة؛ لا ينبغي الخلط بين ذلك وبين نافذة سياق الإدخال |
| نافذة سياق الإدخال | غير منشور بوضوح من قبل Google على صفحة النموذج العامة الحالية |
| إتاحة واجهة برمجة التطبيقات العامة | وصول محدود/قبل الإصدار؛ لم تعلن Google عن تاريخ إصدار عام |
ما هو Gemini 4 Argon؟
Gemini 4 Argon هو النموذج الرائد الذي يرتكز عليه جيل Google من Gemini 4. تصف Google أنه مصمم لأداء رائد على أعباء العمل المعقدة، بما في ذلك هندسة البرمجيات، وأعمال المعرفة المؤسسية، والدفاع في مجال الأمن السيبراني. تغطي مجموعة التقييمات المنشورة أعمال المعرفة، والترميز المعتمد على الوكلاء، والعلوم والرياضيات، واستخدام الحاسوب، والفهم متعدد الوسائط، والمهام ذات السياق الطويل، والأمن السيبراني.
إن تموضع Argon موجّه بشكل ملحوظ نحو تدفقات العمل بدلاً من الاقتصار على أسئلة وأجوبة محادثية. تسلّط Google الضوء على القدرة على الحفاظ على مهام طويلة متعددة الخطوات والعمل عبر تدفقات عمل معقدة في هندسة البرمجيات والمؤسسات.
الميزات الرئيسية لـ Gemini 4 Argon
- الاستدلال عبر تدفقات عمل معقدة: مصمم لمهام طويلة ومتعددة الخطوات تتطلب استدلالاً مستداماً بدلاً من استجابة قصيرة واحدة.
- الترميز المعتمد على الوكلاء: تشير تقارير Google إلى نتائج قوية على DeepSWE v1.1 وVibe Code Bench وتقييمات ترميز أخرى.
- أعمال المعرفة المؤسسية: تشمل التقييمات المنشورة مهاماً في التمويل والوكيل القانوني بالإضافة إلى أتمتة الأعمال من البداية إلى النهاية.
- فهم متعدد الوسائط: تشير تقارير Google إلى نتائج قوية على Chartography وLVBench، تغطي الفهم متعدد الوسائط وفهم الفيديو الطويل.
- أداء في السياق الطويل: تم الإبلاغ عن نتائج GraphWalks لكل من حتى 128K ومن 256K إلى 1M من الرموز.
- الدفاع في مجال الأمن السيبراني: تضع Google Argon تحديداً للدفاع السيبراني، وتبلغ عن نتائج CWE-bench v1 لمعالجة الثغرات.
أداء Gemini 4 Argon على المعايير القياسية
تبلغ Google DeepMind عن النتائج التالية على صفحة تقييم Gemini 4 Argon الحالية. هذه نتائج منشورة من البائع ويجب مقارنتها فقط ضمن منهجية المعيار المعلنة. [1]
| المعيار | الفئة | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | أعمال المعرفة | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | أعمال المعرفة | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | أعمال المعرفة | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark | أعمال المعرفة | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | الترميز المعتمد على الوكلاء | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | الترميز المعتمد على الوكلاء | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench | الترميز المعتمد على الوكلاء | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 | الترميز المعتمد على الوكلاء | 57.4% | 58.2% | 57.9% | 66.4% |
| Terminal-Bench Science 0.1 | العلوم والرياضيات | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench | العلوم والرياضيات | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench | العلوم والرياضيات | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks, up to 128K | سياق طويل | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks, 256K–1M | سياق طويل | 84.2% | 71.8% | 65.0% | 66.8% |
| Chartography | فهم متعدد الوسائط | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | فهم متعدد الوسائط | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | الأمن السيبراني | 68.0% | 68.0% | 58.0% | 67.0% |
تُظهر النتائج أن أداء Argon يختلف باختلاف المهمة: يتصدر المقارنة المذكورة في عدة تقييمات لأعمال المعرفة والترميز والعلوم والسياق الطويل والفهم متعدد الوسائط، بينما تسجل نماذج أخرى درجات أعلى في معايير معينة للترميز أو العلوم أو استخدام الحاسوب. لا ينبغي اختزال هذه النتائج في ترتيب شامل واحد.
مقارنة بين Gemini 4 Argon و GPT-6 Astra و Claude Fable 5.1
| المجال | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|
| أعمال المعرفة | نتائج منشورة قوية عبر Vals وAutomationBench والتمويل وتقييمات الوكلاء القانونيين | قوي على نفس مجموعة التقييم | قوي في عدة تقييمات لأعمال المعرفة |
| الترميز المعتمد على الوكلاء | 77.9% على DeepSWE v1.1؛ 91.9% على Vibe Code Bench | 74.1% على DeepSWE v1.1؛ 89.6% على Vibe Code Bench | 67.4% على DeepSWE v1.1؛ 90.3% على Vibe Code Bench |
| السياق الطويل | 99.7% على GraphWalks حتى 128K؛ 84.2% من 256K–1M | 98.7% و71.8% على التوالي | 91.4% و65.0% على التوالي |
| الفهم متعدد الوسائط | 71.6% على Chartography؛ 91.7% على LVBench | 71.0%; 87.5% | 46.2%; 79.7% |
| الأمن السيبراني | 68.0% على CWE-bench v1 | 68.0% | 58.0% |
المقارنة خاصة بالمعايير القياسية. على سبيل المثال، يسجل GPT-6 Astra درجات أعلى من Argon على FrontierSWE v2 وTerminal-Bench Science 0.1، بينما يسجل Argon درجات أعلى على DeepSWE v1.1 وVibe Code Bench وGraphWalks 256K–1M وLVBench.
حالات استخدام نموذجية
- هندسة برمجيات على مستوى المستودعات — ترميز طويل الأفق، وإعادة هيكلة، وتصحيح أخطاء، وتطوير قائم على الوكلاء.
- تدفقات عمل المعرفة المؤسسية — بحث قانوني، تحليل مالي، وأتمتة عمليات الأعمال.
- الدفاع في مجال الأمن السيبراني — اكتشاف الثغرات والتحقق منها ومعالجتها في بيئات محكومة.
- تدفقات عمل علمية ورياضية — مهام تنعكس في LABBench وRiemannBench وتقييمات موجهة للعلوم.
- تحليل متعدد الوسائط وفيديو طويل — أعباء عمل تتطلب تفسيراً عبر معلومات بصرية وزمنية.
- وكلاء بسياق طويل — تطبيقات تحتاج إلى الحفاظ على المعلومات عبر مسارات مهام كبيرة جداً.