أصدرت Google DeepMind برنامج Gemini Ultra 2، وكانت النتائج المعيارية لا لبس فيها: لأول مرة منذ إطلاق GPT-4 في عام 2023، يحتل نموذج غير OpenAI المركز الأول في كل مجموعة تقييم رئيسية. يمثل الإصدار نقطة انعطاف حقيقية في سباق الذكاء الاصطناعي، وله آثار كبيرة على المؤسسات والمطورين وأي شخص يعتمد على نماذج لغوية كبيرة في عمله اليومي.
الاجتياح المعياري
في MMLU (فهم لغة المهام المتعددة الهائل)، حصل Gemini Ultra 2 على 92.1%، مقارنة بـ 90.8% في GPT-5. أما في الرياضيات، فإن الفجوة أوسع: 87.4% مقابل 84.2%. والأهم من ذلك، في معيار GPQA Diamond الجديد - المصمم لاختبار التفكير العلمي على مستوى الدراسات العليا في الفيزياء والكيمياء والأحياء - حقق Gemini Ultra 2 71.3%، أي بفارق 4 نقاط كاملة عن أقرب منافسيه.
هذه ليست تحسينات هامشية. ويُنظر إلى GPQA Diamond على نطاق واسع على أنه المعيار الأكثر صرامة المتاح للعامة للاستدلال العلمي، ويمثل التقدم بأربع نقاط فجوة كبيرة في القدرات. أكد الباحثون المستقلون في CRFM (مركز أبحاث نماذج الأساس) بجامعة ستانفورد، الذين أجروا تقييماتهم الخاصة، النتائج، مشيرين إلى أن Gemini Ultra 2 أظهر قوة خاصة في مهام التفكير متعددة الخطوات التي تتطلب دمج المعلومات عبر سياقات طويلة.
الهيمنة المتعددة الوسائط
حيث يفصل Gemini Ultra 2 نفسه حقًا في المهام متعددة الوسائط. يمكن للنموذج معالجة الفيديو والصوت والصور والنص في وقت واحد باستخدام نافذة سياق مكونة من 2 مليون رمز — وهي الأكبر من أي نموذج متاح للجمهور. وفي الاختبارات الداخلية المنشورة في تقرير Google الفني، أجاب بشكل صحيح على الأسئلة التفصيلية حول فيلم وثائقي مدته 3 ساعات بعد مشاهدته في الوقت الفعلي، مع الحفاظ على فهم متماسك للقوس السردي وتطوير الشخصية والادعاءات الواقعية طوال الوقت.
بالنسبة للتطبيقات العملية، يعني هذا أن Gemini Ultra 2 يمكنه تحليل قاعدة التعليمات البرمجية بأكملها، أو مراجعة مستند قانوني كامل، أو معالجة التقارير المالية لمدة عام في نافذة سياق واحدة. إن الآثار المترتبة على حالات الاستخدام المؤسسي - العناية الواجبة، ومراجعة الامتثال، وتوليف البحوث - كبيرة.
العمارة
لم تكشف جوجل عن التفاصيل المعمارية الكاملة، لكنها أكدت أن Gemini Ultra 2 يستخدم نهج مزيج من الخبراء (MoE) مع 1.8 تريليون معلمة إجمالية، منها ما يقرب من 280 مليار نشطة على أي استنتاج معين. تسمح هذه البنية - المشابهة من حيث المبدأ لما يُعتقد على نطاق واسع أنه يستخدمه GPT-4 - للنموذج بتحقيق جودة عالية بتكلفة استدلال أقل بكثير من النموذج الكثيف ذي القدرة المكافئة.
ويتيح نهج وزارة التربية والتعليم أيضًا تخصصًا أكثر كفاءة. يبدو أن شبكات الخبراء المختلفة داخل النموذج تنشط لأنواع مختلفة من المهام - التفكير العلمي، وتوليد التعليمات البرمجية، والكتابة الإبداعية - مما يسمح للنموذج بتطبيق القدرات المتخصصة حيث تشتد الحاجة إليها بدلاً من المتوسط في جميع المهام.
التسعير والتوافر
يتوفر Gemini Ultra 2 من خلال Google AI Studio وGemini API. تم تحديد السعر عند 0.0125 دولارًا أمريكيًا لكل 1000 رمز مميز للإدخال و0.0375 دولارًا أمريكيًا لكل 1000 رمزًا مميزًا للمخرجات للنموذج الكامل - وهو ما يمكن مقارنته تقريبًا بـ GPT-5 Turbo ولكن مع تضمين نافذة سياق أكبر بكثير دون أي تكلفة إضافية. يبلغ سعر متغير Gemini Ultra 2 Flash، المُحسّن للسرعة والتكلفة، 0.00375 دولارًا لكل 1000 رمز إدخال.
بالنسبة للمطورين الموجودين بالفعل في نظام Google البيئي - باستخدام Vertex AI أو Google Cloud أو Workspace - يعد التكامل أمرًا مباشرًا. بالنسبة لأولئك الذين يستخدمون منصة OpenAI، يتطلب الترحيل تغييرات في واجهة برمجة التطبيقات (API) ولكن مكاسب الأداء قد تبرر التحول إلى التطبيقات الحساسة لزمن الاستجابة أو الحساسة للتكلفة.
ماذا يعني هذا بالنسبة لسباق الذكاء الاصطناعي؟
لقد هيمنت رواية OpenAI على مشهد الذكاء الاصطناعي لمدة ثلاث سنوات. حددت GPT-4 المعيار في عام 2023؛ قام GPT-4o بتحسينه في عام 2024؛ قام GPT-5 بتوسيع نطاقه في عام 2025. ولا يتحدى Gemini Ultra 2 هذه الرواية فحسب، بل يعكسها أيضًا. ولأول مرة، أصبح نموذج Google هو القائد الواضح عبر المعايير الأكثر أهمية للمشترين من المؤسسات.
وتمتد الآثار التنافسية إلى ما هو أبعد من المعايير. إن مزايا التوزيع التي تقدمها Google - التكامل مع البحث ومساحة العمل وAndroid وYouTube - تمنح Gemini Ultra 2 سطح نشر لا يمكن لـ OpenAI مطابقته من خلال الوصول إلى واجهة برمجة التطبيقات (API) وحدها. إذا استمرت ميزة جودة النموذج، فإن Google في وضع يمكنها من تحويل نطاق التوزيع الخاص بها إلى حصة سوقية للذكاء الاصطناعي بطريقة لم تكن ممكنة مع أجيال جيميني السابقة.
بالنسبة للمؤسسات التي تقوم بتقييم البنية التحتية للذكاء الاصطناعي، تغيرت الحسابات بشكل جذري. لم يعد السؤال هو ما إذا كان سيتم استخدام OpenAI أم لا، بل ما إذا كانت مزايا النظام البيئي لـ OpenAI تفوق قدرة Gemini Ultra 2 ومزايا التكلفة. هذا سؤال أصعب بكثير مما كان عليه قبل ستة أشهر.
المصادر ومزيد من القراءة
- Google DeepMind — نظرة عامة فنية رسمية على Gemini Ultra 2 ووثائق القدرات
- arXiv — برج الجوزاء: عائلة من النماذج متعددة الوسائط ذات القدرة العالية (التقرير الفني الأصلي)
- Stanford CRFM HELM — تقييم شامل مستقل لنماذج اللغة بما في ذلك Gemini
- Papers With Code - لوحة صدارة MMLU المباشرة مع جميع نتائج النماذج
- Google AI Studio — تسعير Gemini API الحالي وحدود الأسعار