الربط البيني (NVLink و InfiniBand)
الربط البيني هو رابط اتصال عالي السرعة ينقل البيانات بين وحدات معالجة الرسوميات (GPU) داخل خادم واحد (ضمن العقدة، مثل NVLink) أو بين خوادم في مجموعة (بين العقد، مثل InfiniBand)؛ وعرض النطاق الترددي والكمون الخاص به يشكل اختناقات أساسية في التدريب والاستدلال الموزع للذكاء الاصطناعي.
في مجال الحوسبة بالذكاء الاصطناعي، يشير الربط البيني إلى الروابط الفيزيائية والبروتوكولات التي تنقل البيانات بين المعالجات. تعمل الروابط البينية ضمن العقدة مثل NVIDIA NVLink بين وحدات معالجة الرسوميات على نفس الخادم عبر نسيج تبديل (NVSwitch)؛ والروابط البينية بين العقد مثل InfiniBand و RoCE (RDMA فوق Ethernet المتقارب) تربط الخوادم داخل مركز البيانات. وبسبب أن الروابط ضمن العقدة أسرع عادة من الروابط بين العقد بمعامل 5-50 مرة، يتم هيكلة خوارزميات التدريب الموزعة للحفاظ على العمليات الأكثر كثافة في الاتصالات ضمن عقدة واحدة.
نشأ NVLink في عام 2016 وتطور عبر عدة أجيال. يوفر NVLink 4.0 في أنظمة H100 نطاقاً ترددياً ثنائي الاتجاه بقوة 900 غيغابايت/ثانية لكل معالج رسوميات عندما تتواصل جميع معالجات الرسوميات الثمانية في العقدة عبر NVSwitch في نفس الوقت — مقارنة بحوالي 128 غيغابايت/ثانية لـ PCIe 5.0. يوفر InfiniBand، الذي تم تطويره في الأصل لحوسبة الأداء العالي (HPC)، نطاقات ترددية لكل منفذ تبلغ 400 غيغابت/ثانية (NDR، 2022) و 800 غيغابت/ثانية (XDR، 2025) مع كمون تحت الميكروثانية، مما يمكّن عمليات all-reduce الجماعية التي تزامن التدرجات عبر آلاف العقد. تستخدم Google's TPU pods ربطاً بينياً بين الرقاقات ملكياً (ICI) مع تبديل الدوائر البصرية بين البودات لبنيتها التحتية للتدريب.
يحدد أداء الربط البيني مدى كفاءة توسع المجموعة مع إضافة عقد جديدة. إذا كان النطاق الترددي بين العقد أقل بكثير من النطاق الترددي ضمن العقدة، فيجب على استراتيجيات التوازي تقليل حركة البيانات بين العقد: مجموعات التوازي الموتري (التي تتبادل المجاميع الجزئية على كل طبقة) تقتصر على مجال NVLink للعقدة الواحدة، بينما التوازي الخطي (الذي يمرر التفعيلات فقط بين المراحل) يمتد عبر العقد عبر InfiniBand. نطاق ترددي all-reduce — الجماعية التي تجمع التدرجات عبر جميع معالجات الرسوميات المشاركة — يحدد مباشرة حداً أعلى لإنتاجية التدريب؛ إذا تجاوز وقت all-reduce وقت التمرير العكسي، فإن معالجات الرسوميات تخمل.
اعتباراً من عام 2026، تمثل InfiniBand بسرعة 800G من NVIDIA ومجال NVLink Switch — القادر على توصيل ما يصل إلى 576 معالج رسوميات بسرعات NVLink كاملة عبر عدة الهياكل — الحدود. تتضمن الأساليب المنافسة معايير Ultra Ethernet من Broadcom والفوتونيات السليكونية لروابط بصرية بين الأرفف تقلل من استهلاك الطاقة. يعتبر طوبولوجيا الشبكة للمجموعة (fat-tree، rail-optimized، أو dragonfly) عاملاً رئيسياً في التمييز بين البنية التحتية للذكاء الاصطناعي المصممة بشكل جيد والمصممة بشكل سيء، وهو مهم لإنتاجية التدريب الإجمالية مثل FLOPS الخام لمعالج الرسوميات.