ألين إيه آي تطلق olmo-eval — منصة لتقييم LLM أثناء التدريب
أطلقت ألين إيه آي olmo-eval — منصة تقييم لنماذج اللغة مدمجة مباشرة في عملية التدريب. بدلاً من الاختبار النهائي — تقييم في كل نقطة تفتيش: يمكنك ملاحظة كيف تؤثر التغييرات في مجموعة البيانات أو تعديلات معاملات التحكم على المعايير في الوقت الفعلي. تم نشر الأداة على Hugging Face وهي موجهة للباحثين الذين يريدون أن يكون التقييم جزءاً من التطوير، وليس ملحقاً له.
معالج بواسطة الذكاء الاصطناعي من Hugging Face Blog؛ بتحرير Hamidun News
أطلقت مجموعة البحث من معهد آلن للذكاء الاصطناعي (AllenAI) أداة olmo-eval — وهي مجموعة أدوات مفتوحة المصدر لتقييم نماذج اللغة مصممة خصيصاً للتكامل في دورة التدريب. المشروع متاح على Hugging Face ويستهدف الباحثين الذين يرغبون في رؤية كيف يتغير النموذج أثناء التدريب، وليس فقط في النهاية.
مشكلة التقييم النهائي
تعمل خط أنابيب تطوير نموذج اللغة الكبير القياسي بهذه الطريقة: يتم تدريب النموذج لعدة أيام أو أسابيع، وبعد ذلك يتم تشغيله من خلال مجموعة من المعايير — ARC و HellaSwag و MMLU وغيرها. يتم تسجيل النتائج في جدول وتُدرج في ورقة بحثية أو بيان صحفي. المشكلة هي أنه في هذه النقطة يكون الوقت قد فات لتغيير أي شيء. إذا تبين أن الأداء على مهام الحس السليم تدهور بسبب تغيير مجموعة البيانات في منتصف التدريب، فإن هذا الاكتشاف عديم الفائدة: كل شيء قد حدث بالفعل. إما أن يتخلى الباحثون عن التشغيل أو ينشروا ما حصلوا عليه.
تقترح olmo-eval منطقاً مختلفاً: تشغيل التقييم ليس مرة واحدة فقط في النهاية، بل في كل نقطة تفتيش محفوظة أثناء التدريب. عندها لا يرى المطور نقطة نهاية، بل منحنى التغييرات — ويمكنه التدخل في الوقت المناسب.
ما الذي يمكن لـ olmo-eval القيام به
تم تصميم مجموعة الأدوات من أجل المرونة: فهي تقبل أي نموذج من Hugging Face Hub أو نقطة تفتيش محلية وتشغله من خلال مجموعة مختارة من المهام. تتم مقارنة النتائج تلقائياً مع التشغيلات السابقة.
- دعم المعايير الأكاديمية القياسية: ARC و HellaSwag و MMLU و WinoGrande وغيرها
- التنفيذ عبر واجهة سطر الأوامر (CLI) أو واجهة برمجية بلغة Python دون إعداد معقد
- التكامل مع أنظمة تسجيل التجارب
- القدرة على إضافة مهام تقييم مخصصة
- الكود مفتوح المصدر تماماً
تكمن القيمة الخاصة في السرعة. تم تحسين olmo-eval للتشغيلات المتكررة: يوفر التقييم الانتقائي على مجموعة فرعية من أمثلة الاختبار صورة تقريبية في دقائق وليس ساعات.
دوره في نظام OLMo البيئي
تطور AllenAI عائلة نماذج اللغة المفتوحة OLMo (نموذج اللغة المفتوح)، والتي تختلف بشكل أساسي عن مشاريع المصدر المفتوح الأخرى: تنشر المنظمة ليس فقط الأوزان، بل أيضاً بيانات التدريب وكود التدريب و — الآن — نظام التقييم. أصبحت olmo-eval جزءاً من هذه المكدسة. استخدمتها الفريق عند تدريب الإصدارات الحديثة من OLMo: تم تشغيل التقييمات تلقائياً في كل نقطة تفتيش وتم تسجيل النتائج جنباً إلى جنب مع مقاييس الخسارة.
« يجب أن يكون التقييم جزءاً من دورة التطوير وليس نقطة نهاية » — هذا المبدأ يضعه
AllenAI في أساس olmo-eval.
يعكس النهج اتجاهاً أوسع: تستخدم المختبرات الرائدة التقييم المستمر بشكل داخلي منذ فترة طويلة، لكنها نادراً ما تكشف التفاصيل. تجعل AllenAI هذه البنية التحتية متاحة للجميع.
ماذا يعني هذا
بالنسبة للمجموعات الأكاديمية والباحثين المستقلين، تمثل olmo-eval بنية تحتية لتقييم على مستوى المؤسسات بدون قيود ملكية. أصبح دمج التقييم المستمر في دورة التدريب أسهل بكثير. بالنسبة للسوق ككل، هذا إشارة: ثقافة الانفتاح لدى AllenAI تمتد ليس فقط إلى البيانات والنماذج، بل إلى مجموعة الأدوات البحثية بأكملها.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.