MarkTechPost→ المصدر

NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода

NVIDIA NeMo выпустила Molt — PyTorch-нативный фреймворк для агентного обучения с подкреплением. Всего ~8600 строк RL-кода — в 7 раз компактнее verl (62 000 строк). Агент пишется на обычном Python и работает через стандартный SDK OpenAI или Anthropic. Производительность статистически сопоставима с Megatron-стеком. Требует кластер из 16 GPU H100.

معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода
المصدر: MarkTechPost. كولاج: Hamidun News.
◐ استمع للمقال

أصدرت NVIDIA في الأول من أغسطس 2026 إطار العمل Molt — إطار عمل للتعلم المعزز العاملي على PyTorch، طوّره فريق NeMo. الخاصية الرئيسية: نحو 8600 سطر من كود RL، أي أقل بسبع مرات من verl، مع أداء مماثل لمكدس Megatron.

لماذا يهم حجم الكود الباحثين؟

صُمِّم Molt بحيث يستطيع الباحث استيعاب قاعدة الكود كاملةً في ذهنه، ويستطيع مساعد AI قراءتها وفهمها بالكامل. في مشاريع RL الأكاديمية والمؤسسية، تتطلب كل تكرار للخوارزمية إجراء تعديلات في المُدرِّب والواجهة الخلفية الموزعة وأغلفة الـ rollout — وكل تغيير يستنزف وقتاً كبيراً. يحل Molt هذه المشكلة بالإيجاز: 8600 سطر مقابل 62000 في verl، و25000 في slime، و7200 في OpenRLHF.

  • حجم كود RL في Molt: ~8600 سطر (مقابل 62000 في verl، و25000 في slime، و7200 في OpenRLHF)
  • الترخيص: Apache 2.0، مع نصوص Slurm جاهزة وحاوية (container) مُسبقة البناء
  • متطلبات الأجهزة: 16 وحدة GPU من طراز NVIDIA H100 على عقدتين (8 للتدريب، و8 للـ rollout)
  • المكونات: Ray (التنسيق)، وvLLM (الـ rollout)، وNVIDIA AutoModel + FSDP2 (التدريب)
  • السيناريوهات المدعومة: وكلاء متعددو الأدوار مع استخدام الأدوات (tool-use)، وتنفيذ الكود (code-execution)، وبيئات الرؤية واللغة (vision-language)، وLLM-as-judge، والتقطير على السياسة (on-policy distillation) إلى نموذج أصغر

كيف يُبنى Molt داخلياً؟

يربط Molt ثلاثة مكونات دون تفريع (fork): يُدير Ray التوزيع وقوائم الانتظار غير المتزامنة، وينفّذ vLLM الـ rollout، ويتولى NVIDIA AutoModel مع FSDP2 عملية التدريب. تصل تحديثات المصدر الأصلي (upstream) عبر تغيير رقم الإصدار المثبَّت للحاوية — دون الحاجة إلى إعادة تأسيس (rebase).

«يجب أن تكون قاعدة الكود مدمجةً بما يكفي ليحتفظ بها الباحث في ذهنه، وليتمكن مساعد AI من قراءتها وفهمها كاملةً» — هذا ما تنص عليه الوثائق التقنية لـ

Molt من NVIDIA NeMo.

الوكيل في Molt هو برنامج Python عادي: يحدد الباحث الوحدة التي تحتوي على AgentRunner، وتُكتب دالة المكافأة بكود قياسي. يُدعم وضعان: Env (يُدير إطار العمل حلقة LLM على غرار Gymnasium) وChatAgent (يتحكم المطور عبر SDK القياسي لـ OpenAI أو Anthropic). يُشغّل إطار العمل خادم loopback يدعم كلا بروتوكولي الاتصال، ويُفكَّك كل طلب على جانب الخادم إلى تسلسل الرموز (tokens) الدقيق.

ثلاثة ثوابت للصحة تُنظّم التصميم: هوية الرموز — تحدد الرموز المُولَّدة المسار، لا نصاً مُعاد تحويله إلى رموز؛ دلالات إصدار السياسة — تُحفظ اللوغاريتمات الاحتمالية لسياسة السلوك على مستوى الرموز؛ الاتساق الأمامي — يجب أن يعمل الـ rollout والـ actor على النموذج ذاته. بالنسبة لسياسات MoE (mixture-of-experts)، يُطبّق Molt تقنية rollout routing replay: يُعيد vLLM معرّفات الخبراء لكل رمز، ويُعيد تمرير التدريب تشغيلها للقضاء على تباينات التوجيه.

من يمكنه الوصول إلى Molt الآن؟

Molt مُوجَّه لمجموعات البحث التي تمتلك إمكانية الوصول إلى مجموعات H100 أو H200. وفقاً لـ NVIDIA، يُماثل أداء إطار العمل إحصائياً مكدس Megatron — فالباحثون لا يتنازلون عن السرعة مقابل الإيجاز. الجمهور المستهدف: المختبرات الرائدة والشركات الناشئة في مجال AI الممولة العاملة على ما بعد تدريب النماذج؛ ومجموعات البحث المؤسسي في التمويل والرعاية الصحية والروبوتات التي تمتلك إمكانية الوصول إلى مجموعات GPU متعددة العقد؛ والمختبرات الأكاديمية المجهزة بـ H100/H200.

ماذا يعني هذا؟

يُخفِّض Molt تكلفة التكرار في أبحاث RL: تُسرّع 8600 سطر شفافة التجارب الخوارزمية، ويعني دعم SDK القياسية أن كود الوكيل الحالي يمكن تدريبه دون إعادة كتابة. تبني NVIDIA مكدساً مفتوحاً لتدريب الوكلاء، منافِسةً verl وOpenRLHF ليس فقط من حيث السرعة، بل أيضاً من حيث سهولة البحث.

الأسئلة الشائعة

كم عدد وحدات GPU المطلوبة لتشغيل Molt؟

تتطلب الوصفة القياسية 16 وحدة GPU من طراز NVIDIA H100 على عقدتين: 8 للتدريب و8 للتوليد (rollout).

كيف يختلف Molt عن verl وOpenRLHF؟

يحتوي Molt على نحو 8600 سطر من كود RL مقابل 62000 في verl و7200 في OpenRLHF. لا يُفرَّع (fork) أي من المكونات الثلاثة (Ray وvLLM وNVIDIA AutoModel): تصل التحديثات عبر تغيير رقم الإصدار المثبَّت لحاوية Docker.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…