قبل ثمانية عشر شهرًا، كانت الفجوة بين نماذج الذكاء الاصطناعي مفتوحة المصدر والنماذج المغلقة من OpenAI وAnthropic واسعة جدًا. كان GPT-4 في فئة خاصة به. كانت البدائل مفتوحة المصدر مفيدة لمهام محددة ولكن من الواضح أنها أقل شأنا بالنسبة للتفكير المعقد والترميز واتباع التعليمات. وقد تم إغلاق هذه الفجوة بسرعة ملحوظة، وكانت الآثار المترتبة على صناعة الذكاء الاصطناعي كبيرة.
حالة الذكاء الاصطناعي مفتوح المصدر في منتصف عام 2026
لقد تغير مشهد الذكاء الاصطناعي مفتوح المصدر من خلال سلسلة من الإصدارات من Meta وMistral ومجتمع الأبحاث الأوسع. تتضمن عائلة Meta's Llama 4، التي تم إصدارها في أبريل 2026، نماذج تتراوح من 8 مليار إلى 405 مليار معلمة، مع تحقيق أكبر نموذج أداء تنافسي مع GPT-4o في معظم المعايير القياسية. لقد أثبتت ميسترال ميسترال لارج 2 ونماذج ميكسترال التي طورها المجتمع أن معماريات مزيج الخبراء يمكن أن تحقق أداءً قويًا بتكاليف استدلال أقل بكثير من النماذج الكثيفة.
إن لوحة المتصدرين Hugging Face Open LLM، التي تتتبع الأداء عبر مجموعة موحدة من المعايير، تحكي القصة بوضوح. في يناير 2025، سجل أفضل نموذج مفتوح المصدر ما يقرب من 75% من أداء GPT-4 على النتيجة المركبة للوحة المتصدرين. بحلول يونيو 2026، ستسجل أفضل النماذج مفتوحة المصدر ما يزيد عن 90% من أداء GPT-4o، وفي بعض المجالات المحددة، ستتجاوزه.
نتائجنا المعيارية
أجرينا تقييمًا شاملاً لمقارنة أفضل النماذج مفتوحة المصدر مع النماذج المغلقة الرائدة عبر خمس فئات: البرمجة، والاستدلال، واتباع التعليمات، والمعرفة الواقعية، والكتابة الإبداعية.
الترميز:تم تنفيذ كل من Meta's Llama 4 405B وMistral Large 2 في نطاق 5% من GPT-4o على HumanEval وSWE-bench. بالنسبة للمهمة المحددة المتمثلة في كتابة وظائف بايثون من سلاسل المستندات، تفوقت Llama 4 405B في الواقع على GPT-4o بهامش صغير. يتم إغلاق الفجوة بشكل أساسي لمهام الترميز القياسية.
المنطق:ويظل هذا هو المجال الذي تحافظ فيه النماذج المغلقة على الميزة الأوضح. في MATH وGPQA (أسئلة وأجوبة على مستوى الدراسات العليا في Google)، سجلت GPT-4o وClaude 3.5 Sonnet أعلى بنسبة 15% تقريبًا من أفضل البدائل مفتوحة المصدر. ويظل التفكير المعقد متعدد الخطوات، وخاصة في الرياضيات والمنطق الرسمي، بمثابة قدرة حدودية.
التعليمات التالية:لقد تحسنت النماذج مفتوحة المصدر بشكل كبير في قدرتها على اتباع التعليمات المعقدة والمتعددة الأجزاء. حصل كل من Llama 4 وMistral Large 2 على نسبة أعلى من 85% في IFEval، مقارنة بـ 88% في GPT-4o. الفرق العملي في معظم حالات الاستخدام لا يكاد يذكر.
المعرفة الواقعية:تحتفظ النماذج المغلقة بميزة متواضعة في معايير المعرفة الواقعية، والتي من المحتمل أن تعكس مجموعات بيانات التدريب الأكبر حجمًا وضبط RLHF الأكثر شمولاً. تبلغ الفجوة حوالي 8-10% في MMLU.
الكتابة الإبداعية:هذه هي الفئة الأكثر ذاتية، وأظهر المقيِّمون البشريون أقل قدر من الاتفاق. ينتج كلا النموذجين المفتوح والمغلق كتابة إبداعية عالية الجودة؛ الاختلافات أسلوبية وليست نوعية.
لماذا تغلق الفجوة
هناك عدة عوامل تفسر التقارب السريع. أولاً، أصبح مجتمع البحث أفضل بشكل ملحوظ في تدريب النماذج الفعالة. لقد تم اعتماد وتحسين تقنيات مثل تحسين التفضيل المباشر (DPO)، الذي يوفر بديلاً أبسط وأكثر استقرارًا لـ RLHF لمواءمة سلوك النموذج، على نطاق واسع. والنتيجة هي أنه يمكن الآن ضبط النماذج مفتوحة المصدر بدقة لاتباع التعليمات وتجنب المخرجات الضارة بحسابات أقل بكثير مما كان مطلوبًا في السابق.
ثانياً، أصبحت قوانين القياس التي كانت تشير في السابق إلى أن النماذج الأكبر ستتفوق دائماً على النماذج الأصغر حجماً، أصبحت معقدة بسبب ظهور تصميمات أكثر كفاءة. يمكن لنماذج خليط الخبراء، التي تنشط فقط مجموعة فرعية من معلماتها لأي مدخلات معينة، أن تحقق الأداء الفعال لنماذج كثيفة أكبر بكثير بجزء صغير من تكلفة الاستدلال. وقد سمح هذا للنماذج مفتوحة المصدر بالتفوق على فئة وزنها.
ثالثا، نما مجتمع الباحثين والمطورين الذين يعملون على نماذج مفتوحة المصدر بشكل هائل. يتضمن نظام Hugging Face البيئي الآن الآلاف من النماذج ومجموعات البيانات وأدوات التقييم المضبوطة بدقة، مما يؤدي إلى إنشاء بنية تحتية تعاونية تعمل على تسريع التقدم بطرق لا يمكن أن يضاهيها تطوير المصادر المغلقة.
ماذا يعني هذا بالنسبة للشركات
بالنسبة للشركات التي تقوم بتقييم نماذج الذكاء الاصطناعي، فإن سد الفجوة بين النماذج المفتوحة والمغلقة يغير حسابات التفاضل والتكامل بشكل كبير. توفر النماذج مفتوحة المصدر العديد من المزايا التي لا تستطيع النماذج المغلقة تقديمها: التحكم الكامل في خصوصية البيانات (لا يتم إرسال البيانات إلى واجهات برمجة التطبيقات التابعة لجهات خارجية)، والقدرة على ضبط البيانات الخاصة، وخفض تكاليف الاستدلال على نطاق واسع، والتحرر من تقييد البائع.
لم يعد السؤال "هل النموذج مفتوح المصدر جيد بما فيه الكفاية؟" بالنسبة لمعظم حالات الاستخدام، فهو كذلك. والسؤال هو ما إذا كانت القدرات المحددة التي تتمتع بها نماذج الحدود المغلقة (وخاصة في الاستدلال المعقد) تبرر المقايضات في الخصوصية، والتكلفة، والسيطرة.
بالنسبة للعديد من حالات الاستخدام المؤسسي - خدمة العملاء، ومعالجة المستندات، والمساعدة البرمجية، وإنشاء المحتوى - فإن الإجابة بشكل متزايد هي أن النماذج مفتوحة المصدر ليست جيدة بما فيه الكفاية فحسب، بل إنها مفضلة. بالنسبة لحالات الاستخدام التي تتطلب الحدود المطلقة للقدرة على الاستدلال، لا تزال النماذج المغلقة تتمتع بميزة.
الديناميكيات التنافسية
يؤدي التحسين السريع للنماذج مفتوحة المصدر إلى خلق ديناميكية تنافسية صعبة لـ OpenAI وAnthropic. تعتمد نماذج أعمالهم على الحفاظ على ميزة الأداء التي تبرر تكلفة واجهات برمجة التطبيقات الخاصة بهم. ومع تضييق هذه الميزة، يزداد الضغط على التسعير.
وقد استجابت شركة OpenAI من خلال التركيز على القدرات التي يصعب تكرارها في النماذج مفتوحة المصدر: التفكير متعدد الوسائط، والتفاعل الصوتي في الوقت الحقيقي، وتكامل الأدوات والوكلاء. لقد ركزت الأنثروبيك على السلامة والموثوقية كمميزين. وتستثمر الشركتان بكثافة في الجيل القادم من النماذج الرائدة، وتراهنان على أن الفجوة سوف تتسع مرة أخرى مع القفزة التالية في القدرات.
إن نجاح هذا الرهان سيعتمد على ما إذا كان مجتمع المصادر المفتوحة قادراً على الاستمرار في سد الفجوة بالسرعة نفسها التي فعلها خلال الأشهر الثمانية عشر الماضية. بناءً على المسار، ليس هناك سبب لافتراض أنه لا يمكن ذلك.