Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений
Новый препринт на arXiv (июль 2026 года) предлагает гибрид offline-online для обучения крупных vision-language-action (VLA) моделей. Онлайн-RL здесь регуляризуют offline-данными или offline-обученной эталонной политикой. Итог — та же устойчивость к ситуациям вне обучающего распределения, что и у чистого RL, но при вдвое меньшем бюджете обучения.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.LG؛ بتحرير Hamidun News
في يوليو 2026، ظهرت على arXiv ورقة بحثية أولية (arXiv:2607.19399) تقترح الجمع بين التعلم التعزيزي offline وonline لنماذج vision-language-action (VLA) الكبيرة، والحصول على جودة RL الأونلاين الخالص مقابل نحو نصف الميزانية الحسابية.
لماذا يُعد RL الأونلاين أغلى، لكنه أفضل
يقدّم التعلم التعزيزي عبر الإنترنت (online RL) باستمرار استراتيجيات أقوى من الأساليب offline — وهذه هي الملاحظة التي ينطلق منها المؤلفون. الفارق كبير بشكل خاص على البيانات الخارجة عن توزيع التدريب (out-of-distribution، OOD): ففي المشاهد غير المألوفة، يجب على النموذج أن يتصرف في مواقف لم تتوفر لها أمثلة مشابهة أثناء التدريب.
النماذج المدرَّبة فقط عبر imitation learning أو عبر supervised fine-tuning (SFT) غالبًا ما «تنحرف» في مثل هذه المشاهد OOD: فهي تعيد تكرار ما شاهدته بشكل جيد، لكنها تُعمِّم بشكل ضعيف على الجديد. تتنبأ نماذج VLA نفسها بالفعل انطلاقًا من صورة وتعليمة نصية — وهذا ما يميّزها عن نماذج اللغة العادية. في المقابل، يتعلم RL الأونلاين من أفعاله الخاصة ونتائجها، لذلك يحافظ على ثباته بثقة أكبر.
يستشهد المؤلفون بدراسة حديثة استحدثت معيار قياس (benchmark) موجّهًا نحو OOD وأظهرت أن سياسات VLA المدرَّبة عبر RL أفضل بشكل ملحوظ في OOD وأفضل قليلًا ضمن التوزيع (in-distribution) مقارنة بالنماذج نفسها بعد SFT. وثمن هذه الميزة هو تفاعل أونلاين مكلف وميزانية تدريب كبيرة.
ما الذي اقترحه المؤلفون بالضبط
يتحقق الباحثون مما إذا كان بالإمكان الجمع بين مزايا النهجين في مخطط هجين offline-online. الفكرة هي تنظيم RL الأونلاين عبر إشراف offline، بحيث لا تُفقد الاستقرارية، لكن أيضًا دون دفع الثمن الكامل للتدريب الأونلاين.
يُدخَل الإشراف بطريقتين: إما مباشرة عبر بيانات offline، أو عبر سياسة مرجعية (reference policy) مدرَّبة offline تمنع RL من الانحراف أثناء التدريب. تعمل السياسة المرجعية كمرساة لينة: يُحسِّن RL الاستراتيجية بحرية، لكن الإشراف offline يمنعها من الانزلاق نحو حلول غير مستقرة.
*الورقة البحثية الأولية: arXiv:2607.19399، نُشرت في يوليو 2026
*الموضوع — نماذج vision-language-action (VLA) واسعة النطاق تُترجم الرؤية واللغة إلى أفعال
*الطريقة — RL أونلاين منظَّم ببيانات offline أو بسياسة مرجعية مدرَّبة offline
*المقارنة — مع تدريب offline خالص ومع RL قياسي على معيار OOD
*النتيجة — جودة قريبة من RL القياسي، بنحو نصف ميزانية التدريب
اختُبرت جميع الصيغ على معيار OOD نفسه وقورنت بحالتين متطرفتين: التدريب offline فقط، وRL الأونلاين القياسي.
كم يوفّر النهج الهجين؟
يحقق النهج الهجين جودة قريبة من RL القياسي بإنفاق نحو نصف ميزانية التدريب فقط — وهذه هي النتيجة الرئيسية للعمل. من الناحية العملية، يعني هذا أنه يمكن بلوغ المستوى نفسه بتكلفة حاسوبية أقل بمقدار الضعف — أو تدريب نموذج أقوى بالميزانية نفسها. وفي الوقت نفسه، تُحافَظ متانة OOD القوية دون التضحية بها لصالح السرعة.
التدريب offline وحده، وفق بيانات المؤلفين، لا يوفر سوى جودة OOD محدودة. لكن بمجرد دمج الإشراف offline داخل RL، تبقى المتانة أمام المواقف غير المعتادة عالية، ويصبح التدريب أكثر كفاءة بنحو الضعف. والملاحظة المهمة هنا: هذه ليست مقايضة «أسرع لكن أسوأ» — فمكسب السرعة لا يأتي على حساب الجودة.
>«بدلًا من المقايضة بين السرعة وجودة OOD، يحافظ النهج الهجين على متانة قوية خارج التوزيع ويحقق في الوقت نفسه مكسبًا في الكفاءة»، بحسب ملخص الدراسة على arXiv.
ما الذي يعنيه هذا
يُعد تدريب نماذج VLA الكبيرة من أكثر الاتجاهات استهلاكًا للموارد في الذكاء الاصطناعي الروبوتي، والدقة نفسها بنصف الميزانية تعني توفيرًا ملموسًا للمختبرات والفرق التي تدرّب عملاء الفعل (action agents). ويتعلق الأمر بنماذج للروبوتات والعملاء الذين يتصرفون في بيئات مادية أو برمجية، حيث يستحيل جمع البيانات مسبقًا لكل الحالات — لذلك تكون متانة OOD ذات قيمة خاصة. يزيل هذا النهج المفاضلة بين الموثوقية في السيناريوهات غير المعتادة وسرعة التدريب — ما يجعل RL الأونلاين أكثر عملية للمهام الحقيقية.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.