LAARA против LoRA: адаптивный ранг по слоям для эффективного файнтюнинга
Исследователи представили LAARA — фреймворк для экономного дообучения нейросетей, который раздаёт разным слоям трансформера разный ранг адаптера. В отличие от LoRA с единым рангом, LAARA оценивает важность слоёв через диагональные оценки Фишера прямо во время обучения. На бенчмарках GLUE и MathInstruct он не уступает LoRA, AdaLoRA, DyLoRA и Bitfit, используя заметно меньше обучаемых параметров.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.LG؛ بتحرير Hamidun News
في 23 يوليو 2026، نشر باحثون على arXiv إطار عمل يُدعى LAARA (Layer-Aware Adaptive Rank Allocation) من أجل الضبط الدقيق الفعال من حيث المعاملات: يمنح هذا الإطار كل طبقة من طبقات المحوّل (transformer) رتبة محوّل خاصة بها، وعلى معياري GLUE وMathInstruct لا يقلّ أداؤه عن طرق LoRA وAdaLoRA وDyLoRA وBitfit مع عدد أقل بشكل ملحوظ من المعاملات القابلة للتدريب.
ما الخلل في LoRA التقليدي
يمنح LoRA جميع طبقات المحوّل رتبة محوّل واحدة، رغم أن الطبقات المختلفة تتطلب درجات مختلفة من التكيّف — ويثبت مؤلفو LAARA نظريًا وتجريبيًا أن هذا التوزيع الموحّد غير أمثل من حيث الأساس. الرتبة هي بُعد الإضافة منخفضة الرتبة التي تُدرجها طريقة الضبط الدقيق بدلًا من تعديل جميع أوزان النموذج. وعندما تكون الرتبة موحّدة في كل مكان، تحصل بعض الطبقات على سعة زائدة، بينما تحصل طبقات أخرى على سعة غير كافية. وعلى هذه الملاحظة بالتحديد بُني نهج LAARA بالكامل.
كيف يعمل LAARA
يوزّع LAARA الرتب بشكل ديناميكي ودون البحث بين الخيارات (search-free)، معتمدًا على تقديرات فيشر القطرية الخفيفة (diagonal Fisher) التي تُحسب مباشرة أثناء التدريب. يوضّح تقدير فيشر مدى أهمية كل معامل للمهمة، وبناءً عليه يقرر الإطار أي طبقة تحصل على رتبة أعلى وأيها تحصل على رتبة أقل.
*المشكلة: رتبة محوّل واحدة موحّدة لجميع الطبقات في LoRA غير مثلى
*الطريقة: تقديرات فيشر القطرية (diagonal Fisher) لتحديد أهمية الطبقات أثناء التدريب
*أربع آليات: التسوية القائمة على الإسقاط (projection-wise)، الضغط اللوغاريتمي، التقييم المختلط لأهمية المحوّلات، مثبّت vote-to-change
*المعياران: GLUE (فهم اللغة) وMathInstruct (التعليمات الرياضية)
*الطرق المرجعية للمقارنة: LoRA وAdaLoRA وDyLoRA وBitfit
تعمل آلية vote-to-change على تنعيم قرارات تغيير الرتبة كي يبقى التوزيع مستقرًا ولا يتذبذب في كل خطوة من خطوات التدريب.
ماذا يقدّم هذا للمطورين
يتيح LAARA ضبط النماذج الكبيرة بتكلفة أقل: وفقًا لبيانات arXiv، يحقق الإطار باستمرار جودة تضاهي أو تتفوق على أربع طرق شائعة، لكنه يستهلك عددًا أقل بكثير من المعاملات القابلة للتدريب. وقلة المعاملات تعني ذاكرة أقل للمحوّلات وتكرارات أسرع عند تخصيص النموذج لمهمة محددة. وقد أُتيح كود LAARA للوصول المفتوح، ما يسمح باختبار هذا النهج على بيانات خاصة بك.
«يوفر توزيع الرتبة القائم على فيشر أساسًا مبدئيًا وفعالًا للضبط الدقيق
التكيّفي الفعال من حيث المعاملات»، بحسب ملخص المقالة على arXiv.
ما الذي يعنيه هذا
يُعد التوزيع التكيّفي للرتبة عبر الطبقات وسيلة عملية لاستخلاص جودة أكبر من الطرق الشبيهة بـLoRA بتكلفة أقل. وبالنسبة للفرق التي تضبط النماذج على نطاق واسع، يمثّل هذا توفيرًا مباشرًا في الذاكرة والحوسبة دون فقدان الدقة.
الأسئلة الشائعة
بماذا يختلف LAARA عن LoRA؟
يمنح LoRA جميع الطبقات رتبة محوّل واحدة، بينما يحسب LAARA رتبة كل طبقة على حدة بناءً على تقديرات فيشر القطرية أثناء التدريب. وبفضل ذلك، يحافظ LAARA على نفس مستوى الجودة أو أفضل على معياري GLUE وMathInstruct مع عدد أقل من المعاملات القابلة للتدريب.
أين يمكن الحصول على كود LAARA؟
أتاح المؤلفون تنفيذ LAARA للوصول المفتوح (الرابط مذكور في المقالة نفسها على arXiv). وهذا يتيح إعادة إنتاج التجارب ومقارنة الطريقة بـLoRA وAdaLoRA وDyLoRA وBitfit على مهام خاصة بك.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.