العتاد

CUDA (معمارية الحوسبة الموحدة للأجهزة)

CUDA (معمارية الحوسبة الموحدة للأجهزة) هي منصة حوسبة متوازية واصطلاحية برمجية مملوكة لـ NVIDIA تسمح للمطورين بكتابة كود C/C++ يتم تنفيذه مباشرة على وحدات معالجة الرسومات NVIDIA، مما يحولها إلى معالجات متوازية ذات أغراض عامة لعمليات الذكاء الاصطناعي والعمل العلمي.

CUDA (معمارية الحوسبة الموحدة للأجهزة) هي منصة حوسبة متوازية وواجهة برمجة تطبيقات قدمتها NVIDIA في عام 2006. تمتد هذه المنصة على لغات البرمجة القياسية C/C++ بإضافة تعليقات توضيحية ومكتبات وقت التشغيل التي تسمح للمطورين بكتابة نوى - دوال تُنفذ بشكل متوازي عبر آلاف نوى وحدة معالجة الرسومات في نفس الوقت - دون الحاجة إلى معرفة بالبرمجة الرسومية. حولت CUDA وحدات معالجة الرسومات من NVIDIA من معجلات رسومات ذات وظيفة ثابتة إلى معالجات متوازية قابلة للبرمجة قابلة للاستخدام في المحاكاة العلمية ومعالجة الصور والتشفير وفي النهاية تعلم الآلة على نطاق واسع.

في نموذج برمجة CUDA، تقوم وحدة المعالجة المركزية (المضيف) بتنسيق التنفيذ بينما تطلق دوال النواة التي تعمل على وحدة معالجة الرسومات (الجهاز). يتم تنظيم النوى في شبكة من كتل الخيوط؛ تعمل كل كتلة على معالج متعدد البث (SM) وتشارك ذاكرة مشتركة سريعة على الشريحة بين خيوطها. تدير وقت تشغيل CUDA نقل الذاكرة بين ذاكرة الوصول العشوائي للمضيف وذاكرة HBM لوحدة معالجة الرسومات، وجدولة الخيوط، والمزامنة. تسمح المكتبات على مستوى أعلى المبنية على CUDA - cuBLAS للجبر الخطي الكثيف و cuDNN للعمليات الأولية للشبكات العصبية و cuSPARSE للعمليات المتفرقة و NCCL للاتصالات الجماعية متعددة وحدات معالجة الرسومات - للأطر مثل PyTorch و TensorFlow و JAX باستدعاء روتين وحدات معالجة الرسومات المحسنة دون أن يقوم المطورون بكتابة نوى CUDA الخام.

تكتسب CUDA أهمية لأنها معيار البرمجة الفعلي لتسريع وحدة معالجة الرسومات للذكاء الاصطناعي. يوفر PyTorch و TensorFlow و JAX وجميع أطر الذكاء الاصطناعي الرئيسية تقريباً محركات خلفية CUDA كمسار تنفيذ وحدة معالجة الرسومات الأساسي. الاستثمار الذي استمر لعقد من الزمن والذي قامت به المجتمع البحثي في كود محسن لـ CUDA - بما في ذلك نوى الانتباه المتوافقة مع FlashAttention من NVIDIA و Triton (لغة نوى مستندة إلى Python والتي تجمع إلى CUDA PTX) و cuDNN - ينشئ تكاليف تبديل كبيرة للانتقال إلى منصات الأجهزة البديلة. أدوات المقارنة والتصحيح والتحليل (NVIDIA Nsight و Compute Sanitizer) كلها أصلية CUDA.

اعتباراً من 2026، تظل هيمنة CUDA في تدريب الذكاء الاصطناعي كما هي إلى حد كبير، على الرغم من أنها تواجه ضغطاً من منصة ROCm من AMD، التي تدعم PyTorch بتغييرات كود قليلة جداً، وأيضاً من واجهات برمجة التطبيقات المحايدة للبائع مثل OpenCL و Vulkan Compute و SYCL. قدمت NVIDIA CUDA 12.x مع دعم معماريات Hopper (H100) و Blackwell (B200)، مضيفة دعم نوى موتر FP8 وأوليات ذاكرة موزعة محسنة. يبقى الفجوة في النضج بين نظام CUDA البيئي ومنافسيه واسعة لتدريب النماذج الحدودية، على الرغم من أن نشرات الاستدلال تستخدم بشكل متزايد وقت تشغيل أعلى مستوى - TensorRT و vLLM و ONNX Runtime - التي تجرد البرمجة المباشرة لـ CUDA.

مثال

يكتب باحث ينفذ آلية انتباه مخصصة نواة CUDA باستخدام أداة Triton من NVIDIA، مما يحقق ثلاثة أضعاف معدل الإنتاجية للنموذج الأساسي PyTorch الساذج من خلال استغلال تجزئة الذاكرة المشتركة وتقليل رحلات الذاكرة ذات النطاق الترددي العالي.

مصطلحات مرتبطة

آخر الأخبار حول الموضوع

← المسرد