العتاد

مجمع وحدات معالجة الرسومات (GPU Cluster)

مجمع وحدات معالجة الرسومات هو مجموعة من الخوادم، يحتوي كل منها على عدة وحدات معالجة رسومات، متصلة بشبكات عالية السرعة للعمل كمورد حساب متوازي واحد لتدريب أو خدمة نماذج الذكاء الاصطناعي التي تتجاوز سعة أي جهاز فردي.

يجمع مجمع وحدات معالجة الرسومات الحساب والذاكرة والتخزين من عدة خوادم بحيث يمكن توزيع أحمال عمل الذكاء الاصطناعي الكبيرة جداً على جميعها. يحتوي كل خادم (عقدة) عادة على 4-16 وحدات معالجة رسومات مرتبطة بموصلات عالية النطاق الترددي داخل العقدة مثل NVLink، بينما تتصل العقد ببعضها البعض والتخزين المشترك عبر InfiniBand أو إيثرنت عالي السرعة. يقوم جدولة المهام - Slurm أو Kubernetes أو ما يعادلها المملوك - بتخصيص موارد المجمع ومراقبة صحة الأجهزة وإعادة تشغيل المهام الفاشلة.

الحافز الأساسي للتجميع هو أن تدريب النموذج الحدودي يتطلب ذاكرة وحساب يتجاوز بكثير عقدة واحدة. تُقدّر دورات التدريب لنماذج بحجم GPT-4 باستخدام عشرات الآلاف من وحدات معالجة الرسومات المعادلة لـ A100 لعدة أشهر. تقسم أطر العمل الموزعة للتدريب - DeepSpeed و Megatron-LM و PyTorch FSDP - العمل عبر توازي البيانات (دفعات مختلفة على وحدات معالجة رسومات مختلفة) وتوازي الموتر (مصفوفات الأوزان المقسمة عبر وحدات معالجة الرسومات) وتوازي خطوط الأنابيب (طبقات نموذج مختلفة على وحدات معالجة رسومات مختلفة). استخدام FLOP النموذج (MFU) - جزء FLOPS الذروة النظري المستخدم فعلياً للحساب - هو مقياس الكفاءة الرئيسي؛ تعتبر القيم من 30-50٪ جيدة للمجموعات الكبيرة بسبب الحمل الزائد للاتصالات.

أصبحت مجموعات وحدات معالجة الرسومات الأصل الرأسمالي المركزي لتطوير الذكاء الاصطناعي. توفر مزودو الخدمات السحابية (AWS و Google Cloud و Azure) وصولاً حسب الطلب إلى مجموعات متعددة الآلاف من وحدات معالجة الرسومات؛ تشغل مختبرات الذكاء الاصطناعي الكبرى مجموعات مملوكة بنطاق أكبر. تتضمن الأمثلة البارزة Research SuperCluster من Meta (16000 A100، 2022) ومنشأة Memphis من xAI (مُبلغ عنها بحوالي 100000 H100، 2024). يمثل مجمع H100 يضم 10000 وحدة معالجة رسومات نفقات رأس مال أجهزة بقيمة تقريبية 300-500 مليون دولار قبل البنية التحتية للطاقة والتبريد والشبكات.

اعتباراً من 2026، تعمل مجموعات بـ 100000 وحدة معالجة رسومات أو أكثر أو في مرحلة البناء الفعلي في عدة مختبرات ذكاء اصطناعي ومزودي خدمات سحابية. تشمل التحديات الهندسية الرئيسية في هذا النطاق الازدحام الشبكي الكامل لتقليل التدرج أثناء مزامنة التدرج، وتحمل الأعطال (قد يؤدي فشل وحدة معالجة رسومات واحدة إلى توقف مهمة تدريب تمتد عبر آلاف العقد)، والتسليم الكهربائي المستدام. ظهرت الخدمة المفككة - حيث تعمل عملية الملء المسبق (معالجة الفورة) وفك التشفير (توليد الرمز) على مجموعات وحدات معالجة رسومات منفصلة بأحجام مستقلة - كنمط معماري رائد للاستدلال على نطاق واسع وفعال من حيث التكلفة.

مثال

يتطلب تدريب نموذج اللغة بـ 70 مليار معامل عادة مجمع من عدة آلاف من وحدات معالجة الرسومات H100 تعمل لعدة أسابيع، مع مجموعات متوازية الموتر من ثماني وحدات معالجة رسومات لكل عقدة تشارك الأوزان عبر NVLink وتوزيع مراحل خطوط الأنابيب عبر العقد عبر InfiniBand.

مصطلحات مرتبطة

← المسرد