AWS Machine Learning Blog→ المصدر

AWS عرضت البنية الأساسية لتدريب multi-turn RL لنموذج Amazon Nova

نشرت AWS Machine Learning Blog تعليمات لنشر بنية أساسية ثنائية المرحلة لتدريب multi-turn reinforcement learning لنموذج Amazon Nova على SageMaker HyperPod. يطلق خط الأنابيب تلقائياً التدريب عند تحميل البيانات إلى Amazon S3، وكمهمة توضيحية، يتم تدريب النموذج للعب لعبة الكلمات Wordle.

معالج بواسطة الذكاء الاصطناعي من AWS Machine Learning Blog؛ بتحرير Hamidun News
AWS عرضت البنية الأساسية لتدريب multi-turn RL لنموذج Amazon Nova
المصدر: AWS Machine Learning Blog. كولاج: Hamidun News.
◐ استمع للمقال

تعرض AWS البنية التحتية لتدريب RL متعدد الأدوار لنموذج Amazon Nova

نشرت مدونة AWS Machine Learning تعليمات لنشر بنية تحتية ثنائية المراحل لتعلم التعزيز متعدد الأدوار (RL) لنموذج Amazon Nova باستخدام Amazon Nova Forge على منصة Amazon SageMaker HyperPod.

كيف يعمل خط أنابيب التدريب

بعد النشر، تكون النتيجة خط أنابيب مدفوع بالأحداث: يتم بدء التدريب تلقائياً في اللحظة التي يقوم فيها المستخدم بتحميل البيانات إلى مجموعة Amazon S3. كمهمة توضيحية، يتم تدريب النموذج على لعب لعبة الكلمات Wordle — يسميها المؤلفون بصراحة "عنصراً نائباً" يمكن للقارئ استبداله بمهمة RL الخاصة به. يعتبر Wordle ملائماً كمثال تعليمي بالضبط لأنه لعبة بسيطة ذات نتائج واضحة وسهلة التحقق منها في كل حركة — تم تخمين الكلمة أم لا — مما يعني أنه من السهل بناء إشارة مكافأة واضحة للنموذج بناءً عليها.

  • تتكون البنية التحتية من مرحلتين وتبدأ تلقائياً حسب الحدث
  • المشغل هو تحميل البيانات إلى مجموعة Amazon S3
  • يتم نشر التدريب على Amazon SageMaker HyperPod باستخدام Amazon Nova Forge
  • المهمة التوضيحية هي تدريب النموذج على لعب Wordle، والذي يعمل فقط كمثال ويمكن استبداله بأي مهمة RL أخرى

لماذا يكون RL متعدد الأدوار ضرورياً

تعلم التعزيز متعدد الأدوار هو تدريب نموذج من خلال سلسلة من الحركات أو التبادلات المتسلسلة مع تعليقات راجعة، بدلاً من توليد رد واحد معزول. هذا النهج مهم بشكل خاص لأنظمة الذكاء الاصطناعي الوكيلة: النماذج التي يجب أن تخطط عدة خطوات للأمام، وتغير الإستراتيجية أثناء الحوار أو اللعبة، وتتعلم من نتيجة سلسلة كاملة من الإجراءات بدلاً من تبادل واحد — على سبيل المثال، مساعدو دعم العملاء، وكلاء التجارة أو الألعاب، والأدوات التي تستدعي واجهات برمجة تطبيقات خارجية.

Amazon Nova هي عائلة من النماذج الأساسية التي أدرجتها AWS كجزء من منصة Bedrock؛ Amazon Nova Forge في هذا السياق بمثابة أداة لتدريبهم الإضافي. Amazon SageMaker HyperPod، بدوره، هي البنية التحتية المُدارة من AWS للتدريب الموزع المرن على مجموعات GPU الكبيرة، مصممة للاسترجاع التلقائي من فشل العقد الفردية دون فقدان تقدم تشغيل التدريب بأكمله.

العمارة المدفوعة بالأحداث مهمة في حد ذاتها هنا: بدلاً من بدء التدريب يدويًا في كل مرة تظهر بيانات جديدة، يستجيب خط الأنابيب لحقيقة تحميل الملف إلى S3 ويبدأ التدريب تلقائياً. يبسط هذا تنظيم إعادة تدريب النموذج المستمر مع وصول بيانات جديدة ويقلل من عدد العمليات اليدوية المطلوبة للفريق لبدء دورة RL التالية. الاسترجاع التلقائي لمجموعة HyperPod بعد فشل العقد الفردية، بدوره، يقلل من خطر الاضطرار إلى إعادة تشغيل تشغيل تدريب لساعات أو أيام عديدة من الصفر بسبب فشل جهاز واحد.

ماذا يعني هذا

توضح المنشورة أن AWS تستمر في توسيع مجموعة أدوات الضبط الدقيق لنماذج Nova الخاصة بها من خلال تعلم التعزيز مباشرة على البنية التحتية المُدارة — وهو يتنافس مع عروض ضبط دقيق RL المماثلة لنماذج من OpenAI و Google و Anthropic ويسهل على العملاء إنشاء أنظمة الذكاء الاصطناعي الوكيلة الخاصة بهم فوق Nova. يوضح استخدام الألعاب المبسطة عن قصد مثل Wordle كمثال تدريب أيضاً أن AWS توجه المادة ليس فقط لفرق البحث بل للمهندسين الذين يحتاجون إلى مثال واضح للبدء لمشاريعهم الخاصة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…