وصفت NVIDIA التوازي الموتري غير المتساوي لتدريب نماذج اللغة الكبيرة على GPU
ناقشت NVIDIA في Developer Blog تقنية التوازي الموتري غير المتساوي لتدريب نماذج اللغة الكبيرة على مجموعات من آلاف وحدات معالجة الرسومات. تهدف الطريقة إلى زيادة goodput - نسبة العمل الحسابي المفيد - من خلال اختيار درجة التوازي بشكل فردي لأجزاء مختلفة من النموذج.
معالج بواسطة الذكاء الاصطناعي من NVIDIA Developer Blog؛ بتحرير Hamidun News
نشرت NVIDIA مقالة في مدونة Developer الخاصة بها حول التوازي غير المنتظم للموتر — وهو نهج مصمم لزيادة الإنتاجية الحقيقية (goodput)، أي جزء العمل الحسابي المفيد، عند تدريب نماذج اللغات الكبيرة على مجموعات من آلاف معالجات الرسوميات GPU.
ما هي الإنتاجية الحقيقية في تدريب نماذج LLM
يتم تدريب نماذج اللغات الكبيرة الحديثة بشكل متزايد على مجموعات من آلاف معالجات الرسوميات ويمتد على مدى أسابيع، وأحيانًا حتى أشهر من العملية المستمرة. مع هذه المدة، يرتفع سعر الأعطال بشكل حاد: فشل عقدة واحدة، تعليق معالج رسوميات "متأخر" أو الحاجة إلى إعادة التشغيل من نقطة تفتيش تستهلك جزءًا من إجمالي وقت الحساب. الإنتاجية الحقيقية هي مقياس يعكس ليس فقط الحمل الإجمالي لمعالج الرسوميات، بل كسر العمل المفيد والمنتج بحق المعدل لمثل هذه الخسائر. من بين الأسباب النموذجية لتقليلها: الازدحام على الشبكة بين العقد، الحمل غير المتساوي على معالجات الرسوميات الفردية، والوقت الذي يقضيه في حفظ واسترجاع نقاط التفتيش الوسيطة بعد حدوث عطل.
- تم نشر المقالة في مدونة Developer التابعة لـ NVIDIA ومخصصة تحديداً لزيادة الإنتاجية الحقيقية في تدريب نماذج LLM
- هذا يتعلق بالبنية الأساسية المصممة للمهام التي تشمل آلاف معالجات الرسوميات في وقت واحد
- يمكن لعمليات التدريب هذه أن تستمر لفترة طويلة دون توقف
- تسمى الطريقة المقترحة التوازي غير المنتظم للموتر — "التوازي غير المنتظم للموتر"
كيف يعمل التوازي غير المنتظم للموتر
التوازي الموتر هو أحد الأساليب الأساسية للتدريب الموزع: يتم تقسيم عمليات المصفوفات الفردية داخل طبقات النموذج إلى قطع وحسابها بشكل متزامن على معالجات رسوميات مختلفة، مما يسمح بتدريب النماذج التي لا تناسب فعليًا في ذاكرة بطاقة رسومية واحدة. يطبق النهج الكلاسيكي نفس درجة التقسيم على جميع طبقات النموذج دون تمييز. يختار المتغير غير المنتظم الموصوف من قبل NVIDIA درجة التوازي بشكل فردي لأجزاء مختلفة من النموذج — مع الأخذ في الاعتبار حمولتها الحسابية وحجم البيانات التي تحتاج إلى تبديلها بين معالجات الرسوميات.
الهدف هو تقليل وقت التوقف والنفقات العامة للاتصالات بين الأجهزة، مما يزيد من الإنتاجية الحقيقية الكلية دون شراء أجهزة إضافية. عادة ما يتم تنفيذ هذه التقنيات مع مكتبات التدريب الموزع مثل Megatron-LM ومنصة NeMo، التي تطورها NVIDIA تحديداً لتدريب النماذج الكبيرة على معالجات الرسوميات الخاصة بها.
التوازي الموتر ليس الطريقة الوحيدة لتوزيع التدريب بين معالجات الرسوميات: جنباً إلى جنب معها، يتم استخدام التوازي الخطوط الأنابيب، حيث يتم إرفاق طبقات مختلفة من النموذج بمعالجات رسوميات مختلفة ومعالجتها بطريقة مشابهة لخط أنابيب، والتوازي في البيانات، حيث تخزن كل معالج رسوميات نسخة كاملة من النموذج، ويتم مشاركة أمثلة التدريب نفسها فقط بين الأجهزة. في الممارسة العملية، تجمع مجموعات التدريب الكبيرة جميع الأساليب الثلاثة بشكل متزامن، وتحدد مدى جودة اختيار هذه المجموعة لبنية نموذج معينة الإنتاجية الحقيقية الكلية بشكل مباشر.
لماذا هذا مهم لبنية أساسية للذكاء الاصطناعي
حتى الحصول على كسب صغير في الكفاءة يترجم إلى توفيرات كبيرة عند عد آلاف معالجات الرسوميات وأسابيع من التدريب المستمر. يتطلب تدريب نموذج حقيقي كبير حديث موارد حسابية بتكاليف تبلغ عشرات ومئات الملايين من الدولارات، لذا فإن حتى كسب بنسبة واحد في المائة في الإنتاجية الحقيقية يترجم إلى توفيرات ملحوظة في الوقت والكهرباء والمال. NVIDIA، كأكبر موفر لمسرعات الذكاء الاصطناعي، تنشر بانتظام هذه التحليلات الهندسية بحيث يمكن لعملائها — الشركات التي تدرب نماذج LLM الخاصة بها على بنية أساسية NVIDIA — الضغط على كفاءة أكبر من المجموعات الموجودة بالفعل دون توسيع أسطولها من المعدات.
ماذا يعني هذا
مع نمو نطاق تدريب نماذج اللغات الكبيرة، لا تهم فقط كمية وقوة الرقاقات، بل أيضًا هندسة برنامج النظم — مدى كفاءة البنية الأساسية الموزعة لاستخدام معالجات الرسوميات المشتراة بالفعل.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.