Habr AI→ المصدر

Kaggle تحت Google DeepMind تطلق Benchmarks SDK لمقارنة نماذج الذكاء الاصطناعي الكبيرة

لم تعد Kaggle مجرد منصة لمسابقات البيانات. في عام 2026، بعد انتقالها تحت مظلة Google DeepMind، أطلقت المنصة قسم Benchmarks وحزمة SDK مفتوحة لإنشاء مجموعات اختبار لأي نماذج AI. مجموعات البيانات الخاصة، لوحات المتصدرين، مقاييس JSON – أصبحت هذه الميزات متاحة الآن ليس فقط للمختبرات الكبيرة. تتيح هذه البنية التحتية الجديدة للباحثين والفرق الصغيرة إنشاء معاييرهم الخاصة، مما يضمن تقييمًا عادلًا وشفافًا لقدرات نماذج الذكاء الاصطناعي، بعيدًا عن مشكلات تسرب البيانات التي تعاني منها المعايير العامة الحالية.

معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
Kaggle تحت Google DeepMind تطلق Benchmarks SDK لمقارنة نماذج الذكاء الاصطناعي الكبيرة
المصدر: Habr AI. كولاج: Hamidun News.
◐ استمع للمقال

Kaggle، المنصة التي يعرفها ملايين المتخصصين في البيانات كساحة رئيسية لمسابقات التعلم الآلي، تغير هويتها. لقد حل شعار "Your Home for Data Science" محل "The World's AI Proving Ground" – وهذا ليس مجرد تغيير في العلامة التجارية التسويقية. في عام 2026، انتقلت Kaggle رسميًا تحت إدارة AI Frontier – قسم جديد في Google DeepMind. يعني تغيير المشرف تغييرًا في التركيز الاستراتيجي. لم تعد Kaggle مجرد مكان لمسابقات التنبؤ أو تصنيف الصور. أصبحت مهمة المنصة الآن هي التقييم المنهجي للنماذج اللغوية الكبيرة والمتعددة الوسائط في ظروف موحدة.

التحديث التقني الرئيسي هو قسم Benchmarks الجديد على الموقع وحزمة Kaggle Benchmarks SDK المفتوحة على GitHub. هذا إطار عمل كامل لإنشاء مجموعات الاختبار وإدارتها وتشغيلها. الآلية بسيطة: يصف الباحث الاختبار – بيانات الإدخال، النتيجة المتوقعة، مقياس الجودة – يجمع عدة اختبارات في مجموعة، وتصبح هذه المجموعة معيارًا.

تتولى حزمة SDK تشغيل النماذج في ظروف متساوية وتشكيل النتيجة: السجلات، JSON، الجداول المقارنة، لوحات المتصدرين. تسمح مرونة النظام بتنفيذ أي آلية اختبار تقريبًا – من الدقة الكلاسيكية (accuracy) إلى المهام المعقدة متعددة الخطوات مع تقييم الاستدلال. وفي الوقت نفسه، يمكن الاحتفاظ ببيانات ورموز المعايير في مجموعات بيانات خاصة، مغلقة أمام الوصول العام.

يمكن للشركات إنشاء معايير داخلية لتقييم النماذج دون الكشف عن المنهجية وحالات الاختبار للمنافسين. إذا رغبوا، يمكنهم جعل المعيار عامًا، وسيصبح معيارًا مشتركًا في المجتمع.

لماذا هذا مهم الآن بالذات؟

مشكلة التقييم العادل لنماذج AI حادة للغاية. تتعرض المعايير العامة الشائعة – MMLU، HumanEval، GPQA وغيرها – للانتقاد بانتظام: تتسرب البيانات منها إلى مجموعات التدريب، وتجتاز النماذج الاختبار فعليًا باستخدام ورقة غش، بدلاً من إظهار قدرات حقيقية. تنشئ المختبرات الكبيرة اختبارات داخلية مغلقة – ولكن الفرق الصغيرة والمجموعات الأكاديمية لا تملك مثل هذه البنية التحتية. تجعل Kaggle Benchmarks SDK هذه الأدوات متاحة.

تحصل Google DeepMind على مزايا واضحة من تحول المنصة. تصبح Kaggle، بمجتمعها الذي يضم ملايين الأعضاء، منصة لعرض إمكانيات نماذجها الخاصة مقارنة بالمنافسين – في ظروف تعتبر محايدة. بالنسبة للمجتمع، الفائدة واضحة أيضًا: في السابق، كان إنشاء معيار عادل قابل للتكرار يتطلب عملًا هندسيًا جادًا، والآن أصبح متاحًا من خلال حزمة SDK قياسية.

الحنين إلى Kaggle القديمة أمر مفهوم. لقد ولت الأيام التي كان فيها فوز XGBoost مضبوطًا بشكل صحيح على شبكة عصبية على البيانات الجدولية بمثابة إحساس. لقد تحولت مهمة الصناعة: من "من سيتنبأ بدقة أكبر" – إلى "كيف نقيس بموضوعية ما يفعله النموذج الكبير". تتكيف Kaggle مع هذا التحول، وبالنظر إلى حجم التغييرات، فإنها تعتزم أن تصبح معيارًا لهذا القياس.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…