Hugging Face Blog→ المصدر

ألين إيه آي تطلق olmo-eval — منصة لتقييم LLM أثناء التدريب

أطلقت ألين إيه آي olmo-eval — منصة تقييم لنماذج اللغة مدمجة مباشرة في عملية التدريب. بدلاً من الاختبار النهائي — تقييم في كل نقطة تفتيش: يمكنك ملاحظة كيف تؤثر التغييرات في مجموعة البيانات أو تعديلات معاملات التحكم على المعايير في الوقت الفعلي. تم نشر الأداة على Hugging Face وهي موجهة للباحثين الذين يريدون أن يكون التقييم جزءاً من التطوير، وليس ملحقاً له.

معالج بواسطة الذكاء الاصطناعي من Hugging Face Blog؛ بتحرير Hamidun News
ألين إيه آي تطلق olmo-eval — منصة لتقييم LLM أثناء التدريب
المصدر: Hugging Face Blog. كولاج: Hamidun News.
◐ استمع للمقال

أطلقت مجموعة البحث من معهد آلن للذكاء الاصطناعي (AllenAI) أداة olmo-eval — وهي مجموعة أدوات مفتوحة المصدر لتقييم نماذج اللغة مصممة خصيصاً للتكامل في دورة التدريب. المشروع متاح على Hugging Face ويستهدف الباحثين الذين يرغبون في رؤية كيف يتغير النموذج أثناء التدريب، وليس فقط في النهاية.

مشكلة التقييم النهائي

تعمل خط أنابيب تطوير نموذج اللغة الكبير القياسي بهذه الطريقة: يتم تدريب النموذج لعدة أيام أو أسابيع، وبعد ذلك يتم تشغيله من خلال مجموعة من المعايير — ARC و HellaSwag و MMLU وغيرها. يتم تسجيل النتائج في جدول وتُدرج في ورقة بحثية أو بيان صحفي. المشكلة هي أنه في هذه النقطة يكون الوقت قد فات لتغيير أي شيء. إذا تبين أن الأداء على مهام الحس السليم تدهور بسبب تغيير مجموعة البيانات في منتصف التدريب، فإن هذا الاكتشاف عديم الفائدة: كل شيء قد حدث بالفعل. إما أن يتخلى الباحثون عن التشغيل أو ينشروا ما حصلوا عليه.

تقترح olmo-eval منطقاً مختلفاً: تشغيل التقييم ليس مرة واحدة فقط في النهاية، بل في كل نقطة تفتيش محفوظة أثناء التدريب. عندها لا يرى المطور نقطة نهاية، بل منحنى التغييرات — ويمكنه التدخل في الوقت المناسب.

ما الذي يمكن لـ olmo-eval القيام به

تم تصميم مجموعة الأدوات من أجل المرونة: فهي تقبل أي نموذج من Hugging Face Hub أو نقطة تفتيش محلية وتشغله من خلال مجموعة مختارة من المهام. تتم مقارنة النتائج تلقائياً مع التشغيلات السابقة.

  • دعم المعايير الأكاديمية القياسية: ARC و HellaSwag و MMLU و WinoGrande وغيرها
  • التنفيذ عبر واجهة سطر الأوامر (CLI) أو واجهة برمجية بلغة Python دون إعداد معقد
  • التكامل مع أنظمة تسجيل التجارب
  • القدرة على إضافة مهام تقييم مخصصة
  • الكود مفتوح المصدر تماماً

تكمن القيمة الخاصة في السرعة. تم تحسين olmo-eval للتشغيلات المتكررة: يوفر التقييم الانتقائي على مجموعة فرعية من أمثلة الاختبار صورة تقريبية في دقائق وليس ساعات.

دوره في نظام OLMo البيئي

تطور AllenAI عائلة نماذج اللغة المفتوحة OLMo (نموذج اللغة المفتوح)، والتي تختلف بشكل أساسي عن مشاريع المصدر المفتوح الأخرى: تنشر المنظمة ليس فقط الأوزان، بل أيضاً بيانات التدريب وكود التدريب و — الآن — نظام التقييم. أصبحت olmo-eval جزءاً من هذه المكدسة. استخدمتها الفريق عند تدريب الإصدارات الحديثة من OLMo: تم تشغيل التقييمات تلقائياً في كل نقطة تفتيش وتم تسجيل النتائج جنباً إلى جنب مع مقاييس الخسارة.

« يجب أن يكون التقييم جزءاً من دورة التطوير وليس نقطة نهاية » — هذا المبدأ يضعه

AllenAI في أساس olmo-eval.

يعكس النهج اتجاهاً أوسع: تستخدم المختبرات الرائدة التقييم المستمر بشكل داخلي منذ فترة طويلة، لكنها نادراً ما تكشف التفاصيل. تجعل AllenAI هذه البنية التحتية متاحة للجميع.

ماذا يعني هذا

بالنسبة للمجموعات الأكاديمية والباحثين المستقلين، تمثل olmo-eval بنية تحتية لتقييم على مستوى المؤسسات بدون قيود ملكية. أصبح دمج التقييم المستمر في دورة التدريب أسهل بكثير. بالنسبة للسوق ككل، هذا إشارة: ثقافة الانفتاح لدى AllenAI تمتد ليس فقط إلى البيانات والنماذج، بل إلى مجموعة الأدوات البحثية بأكملها.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…