وحدة معالجة الرسومات (GPU)
وحدة معالجة الرسومات هي معالج تم تصميمه في الأصل لتصيير الرسومات الحاسوبية، مبني حول آلاف نوى الحوسبة الصغيرة المتوازية. منذ أوائل عام 2010، أصبحت وحدات معالجة الرسومات الأجهزة السائدة لتدريب واستدلال نماذج الذكاء الاصطناعي لأن عمليات الشبكات العصبية ترسم بشكل طبيعي على هذه البنية المتوازية.
تحتوي وحدة معالجة الرسومات على آلاف إلى عشرات الآلاف من نوى الحوسبة الصغيرة — على سبيل المثال، معالج NVIDIA H100 SXM5 يحتوي على حوالي 16,896 نواة CUDA — مُحسَّنة لتنفيذ نفس العملية الحسابية على عناصر بيانات متعددة بشكل متزامن (تعليمة واحدة، بيانات متعددة، أو SIMD). يتناقض هذا مع وحدة المعالجة المركزية، التي تحتوي على عدد صغير من النوى القوية المُحسَّنة للمنطق التسلسلي المعقد. يتقلص تدريب الشبكة العصبية في الغالب إلى عمليات ضرب المصفوفات المتكررة والتحويلات غير الخطية عنصر تلو الآخر، وهي عمليات ترسم بشكل طبيعي على التوازي في وحدات معالجة الرسومات وتمنحها ميزة إنتاجية بنسبة 10-100 مرة عن وحدات المعالجة المركزية لهذه الأعباء.
أثناء تدريب الذكاء الاصطناعي، تخزن وحدة معالجة الرسومات أوزان النموذج ودفعات الإدخال في الذاكرة عالية النطاق الترددي على الشريحة (HBM — ذاكرة النطاق الترددي العالي) وتنفذ المسارات الأمامية والخلفية عبر النموذج بطريقة متوازية عالية الكفاءة. يتم توصيل وحدات معالجة رسومات متعددة عبر وصلات سريعة — NVLink داخل خادم واحد و InfiniBand أو RoCE عبر الخوادم — لتوزيع مهام التدريب التي تتجاوز سعة ذاكرة وحدة معالجة رسومات واحدة. إطار عمل CUDA من NVIDIA، المُصدرة في عام 2007، أصبحت الطبقة البرمجية الفعلية التي تمكّن باحثي الذكاء الاصطناعي من كتابة برامج متوازية لأغراض عامة لوحدات معالجة الرسومات دون الحاجة إلى خبرة في الرسومات، وتبقى الأساس السائد اعتباراً من عام 2026.
الوصول إلى حوسبة وحدات معالجة الرسومات هو الاختناق الأساسي لتطوير الذكاء الاصطناعي. يتطلب تدريب نموذج لغة حدودي أمامي تشغيل آلاف وحدات معالجة الرسومات بشكل متوازي لأسابيع إلى أشهر؛ الاستدلال على مستوى الإنتاج بالمثل يتطلب أساطيل كبيرة من وحدات معالجة الرسومات تعمل بشكل مستمر. ندرة وحدات معالجة الرسومات تحدد مباشرة الأنظمة التي يمكنها تدريب النماذج الحدودية الأمامية وعلى أي مدى زمني. يتم تحديد الإمدادات من أكثر رقائق الذكاء الاصطناعي تقدماً من NVIDIA من خلال سعة التصنيع الرائدة من TSMC، وكذلك من خلال ضوابط الصادرات التابعة لوزارة التجارة الأمريكية منذ أكتوبر 2022 التي تقيد شحنات معالجات الذكاء الاصطناعي المتقدمة إلى دول معينة — قواعد تم تشديدها بشكل أكبر في 2023 و 2024.
اعتباراً من عام 2026، تحتل NVIDIA على حصة السوق السائدة في معجلات الذكاء الاصطناعي، مع H100 (2022) و H200 (2024) ومعالجات Blackwell B100/B200 (2024-2025) كأساس للمنصات الرئيسية لتدريب النموذج الحدودي الأمامي. MI300X من AMD و Gaudi 3 من Intel هي بدائل تنافسية تُستخدم في بعض نشرات المشغلين الضخمين. لقد نشرت عدة شركات تكنولوجيا كبيرة — Google (TPU v5) و Amazon (Trainium 2) و Meta (MTIA) و Microsoft (Maia) — معجلات ذكاء اصطناعي مخصصة لتقليل الاعتماد على NVIDIA، لكن النظام البيئي CUDA من NVIDIA والنضج البرمجي يحافظان على موقعها كمنصة افتراضية لمعظم أبحاث وتطوير الذكاء الاصطناعي التجاري.