UltraEP от Xiaohongshu: балансировка MoE-экспертов за 300 мкс, 94,3% от идеала
Xiaohongshu выложила UltraEP — рантайм для балансировки нагрузки экспертов в MoE-моделях при обучении и инференсе на rack-scale системах. Он перераспределяет экспертов на каждом микробатче примерно за 300 микросекунд, снижая перекос нагрузки между GPU с 4,01× до 1,04× и достигая 94,3% от идеального throughput — в 1,49 раза быстрее, чем без балансировки.
معالج بواسطة الذكاء الاصطناعي من Jiqizhixin (机器之心)؛ بتحرير Hamidun News
قدّم فريق dotsinfra في شركة Xiaohongshu (小红书، «Xiaohongshu») نظام التشغيل UltraEP، وهو بيئة تشغيل (runtime) توازن في الوقت الفعلي حِمل خبراء نماذج MoE على أنظمة rack-scale وتحقق 94.3% من إنتاجية (throughput) التدريب والاستدلال المثالية. نُشرت الورقة البحثية على arXiv في 2 يونيو 2026.
ما المشكلة التي يحلها UltraEP
يزيل UltraEP اختلال توازن الحِمل بين خبراء نماذج MoE، وهو ما يجعل أنظمة GPU الباهظة الثمن في الحوامل (racks) خاملة. في عُقد rack-scale مثل Huawei Atlas 900 A3 SuperPoD وNVIDIA NVL72، تُجمَّع عشرات وحدات GPU في نطاق ترابط عالي السرعة واحد، ويُوزَّع خبراء النموذج بينها (Expert Parallelism). تختار الرموز (tokens) الخبراء بشكل غير متساوٍ: تصبح بعض وحدات GPU محمّلة بشكل زائد وتتحول إلى «متأخرات حسابية» (compute stragglers)، ما يؤدي إلى اختناقات في اتصالات all-to-all وارتفاعات في ذاكرة التنشيط.
تعيد أدوات الموازنة الحالية ترتيب الخبراء بشكل دوري، اعتمادًا على الحِمل التاريخي. ووفقًا للباحثين، في عمليات النشر الإنتاجية الفعلية ذات نمط الحِمل غير المستقر، لا يكون هذا النهج موثوقًا — إذ يصل اختلال التوازن بين الرتب (ranks) إلى 4.01× مقارنة بالمتوسط، وتبقى بعض بطاقات الحامل خاملة بينما تُبطئ وحدات GPU المحمّلة بشكل زائد الخطوة بأكملها.
كيف تعمل الموازنة خلال 300 ميكروثانية
يعيد UltraEP الموازنة لكل microbatch ولكل طبقة مباشرة على المسار الحرج للحسابات، بدلًا من مرة واحدة كل N خطوة. يستجيب النظام للحِمل فور انتهاء عملية gating باستخدام جدولة (scheduler) قائمة على الحصص (quota-driven)، وينفّذ عمليات نقل غير منتظمة لحالات الخبراء عبر persistent tile streaming، وهي تقنية «أصيلة» في عُقد rack-scale، مع آلية relay لمنع تحميل fan-out الزائد. النفقات الإضافية تبلغ نحو 300 ميكروثانية لكل عملية موازنة.
- 94.3% من الإنتاجية المثالية (force-balanced)، بمعدل متوسط بين التدريب والاستدلال
- تسريع بمقدار 1.49× مقارنة بالتشغيل دون موازنة
- انخفاض اختلال الحِمل بين الرتب من 1.30–4.01 إلى 1.01–1.04
- النفقات الإضافية لإعادة الموازنة — نحو 300 ميكروثانية
- الاختبارات — نشر multi-RSN يصل إلى 256 وحدة GPU
- نماذج من 106 إلى 671 مليار معامل (parameter)؛ arXiv 2606.04101، قُدّمت في 2 يونيو 2026
«UltraEP هو أول موازِن يحتسب الحِمل بدقة في الوقت الفعلي لتدريب واستدلال prefill لنماذج
MoE الكبيرة على عُقد rack-scale»، جاء في ورقة فريق dotsinfra على arXiv.
لماذا يهم هذا تدريب MoE
ينقل UltraEP موازنة الخبراء من المستوى «الدوري» إلى الوقت الفعلي، مستعيدًا ما يصل إلى 1.49× من الإنتاجية على العتاد نفسه. بالنسبة للنماذج على مستوى 671 مليار معامل (بحجم DeepSeek-V3)، يعني هذا أن الحوامل المكوّنة من عشرات وحدات GPU تتوقف عن الخمول بسبب الخبراء «الساخنين» الذين يتلقون حصة غير متناسبة من الرموز (tokens). مفتاح السرعة هو بنية rack-scale نفسها: فالترابط الموسّع بين عشرات وحدات GPU داخل العقدة الواحدة يتيح تبديل الخبراء بين البطاقات أسرع مما تفعله أدوات الموازنة الدورية التقليدية. يُنفَّذ UltraEP كبيئة تشغيل مستقلة، ووفقًا للباحثين، يندمج في مكدّسات (stacks) التدريب والاستدلال الحالية دون الحاجة إلى إعادة كتابتها.
ما الذي يعنيه هذا
تصبح موازنة الحِمل الجبهة التالية في معركة كفاءة MoE — بعد النطاق الترددي وسرعة الاتصالات. يُظهر UltraEP أنه في ظل ترابط عُقد rack-scale، يمكن إعادة تبديل الخبراء حرفيًا في كل خطوة، لاستخراج استخدام شبه مثالي من عتاد تبلغ قيمته ملايين الدولارات.
الأسئلة الشائعة
على أي نماذج جرى اختبار UltraEP؟
جرى اختبار UltraEP على نماذج MoE المتقدمة التي تتراوح من 106 إلى 671 مليار معامل، في نشر multi-RSN يصل إلى 256 وحدة GPU، مع حساب متوسط النتائج عبر سيناريوهات التدريب واستدلال prefill.
إلى أي مدى يسرّع UltraEP نماذج MoE؟
وفقًا للورقة البحثية، يوفر UltraEP زيادة في الإنتاجية بمقدار 1.49× مقارنة بالتشغيل دون موازنة، ويصل إلى 94.3% من الحد الأقصى النظري عند توازن الحِمل بشكل مثالي.
ما هي أنظمة rack-scale؟
هي عُقد في حوامل (racks) مثل Huawei Atlas 900 A3 SuperPoD وNVIDIA NVL72، حيث تُجمَّع عشرات وحدات GPU في نطاق ترابط عالي السرعة واحد. وترابطها الموسّع هذا بالتحديد هو ما يتيح لـ UltraEP نقل حالات الخبراء بين البطاقات خلال ميكروثوانٍ معدودة.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.