UltraEP от Xiaohongshu: балансировка MoE-экспертов за 300 мкс, 94,3% от идеала
Xiaohongshu выложила UltraEP — рантайм для балансировки нагрузки экспертов в MoE-моделях при обучении и инференсе на rack-scale системах. Он перераспределяет экспертов на каждом микробатче примерно за 300 микросекунд, снижая перекос нагрузки между GPU с 4,01× до 1,04× и достигая 94,3% от идеального throughput — в 1,49 раза быстрее, чем без балансировки.
AI-обработка оригинала Jiqizhixin (机器之心); редакция Hamidun News
Команда dots infra компании Xiaohongshu (小红书, «Сяохуншу») представила UltraEP — рантайм, который в реальном времени выравнивает нагрузку экспертов MoE-моделей на rack-scale системах и достигает 94,3% от идеального throughput обучения и инференса. Статья опубликована на arXiv 2 июня 2026 года.
Какую проблему решает UltraEP
UltraEP устраняет перекос нагрузки между экспертами MoE-моделей, из-за которого дорогие стоечные GPU-системы простаивают. В rack-scale узлах вроде Huawei Atlas 900 A3 SuperPoD и NVIDIA NVL72 десятки GPU объединены в один высокоскоростной interconnect-домен, а эксперты модели распределены между ними (Expert Parallelism). Токены выбирают экспертов неравномерно: одни GPU перегружены и становятся «отстающими» (compute stragglers), появляются заторы в all-to-all-коммуникации и скачки памяти под активации.
Существующие балансировщики переставляют экспертов периодически, ориентируясь на историческую нагрузку. По данным авторов, в реальных продакшн-деплоях с нестационарным паттерном нагрузки такой подход ненадёжен — перекос между рангами доходит до 4,01× относительно среднего, и часть карт стойки простаивает, пока перегруженные GPU тормозят весь шаг.
Как устроена балансировка за 300 микросекунд
UltraEP ребалансирует каждый микробатч и каждый слой прямо на критическом пути вычислений, а не раз в N шагов. Система реагирует на нагрузку сразу после гейтинга с помощью quota-driven-планировщика и выполняет нерегулярные переносы состояний экспертов через persistent tile streaming, «родной» для rack-scale узлов, с relay-механизмом против перегрузки fan-out. Дополнительные накладные расходы — около 300 микросекунд на ребалансировку.
- 94,3% от идеального (force-balanced) throughput, усреднённо по обучению и инференсу
- 1,49× ускорение по сравнению с работой без балансировки
- Перекос нагрузки между рангами снижен с 1,30–4,01 до 1,01–1,04
- Overhead ребалансировки — около 300 микросекунд
- Тесты — multi-RSN-развёртывание до 256 GPU
- Модели от 106 до 671 млрд параметров; arXiv 2606.04101, подана 2 июня 2026 года
«UltraEP — первый балансировщик с точным учётом нагрузки в реальном времени для обучения и prefill-инференса больших
MoE-моделей на rack-scale узлах», — говорится в статье команды dots infra на arXiv.
Почему это важно для обучения MoE
UltraEP переносит балансировку экспертов из «периодической» плоскости в реальное время, отыгрывая до 1,49× throughput на том же железе. Для моделей уровня 671 млрд параметров (масштаб DeepSeek-V3) это значит, что стойки из десятков GPU перестают простаивать из-за «горячих» экспертов, на которые приходится непропорционально много токенов. Ключ к скорости — сама rack-scale-топология: расширенная связность десятков GPU внутри узла позволяет тасовать экспертов между картами быстрее, чем это делают классические периодические балансировщики. Реализован UltraEP как отдельный рантайм и, по заявлению авторов, встраивается в существующие стеки обучения и инференса без переписывания.
Что это значит
Балансировка нагрузки становится следующим фронтом борьбы за эффективность MoE — после пропускной способности и скорости коммуникаций. UltraEP показывает, что при связности rack-scale узлов экспертов можно перетасовывать буквально на каждом шаге, вытягивая из железа стоимостью в миллионы долларов почти идеальную загрузку.
Частые вопросы
На каких моделях тестировали UltraEP?
UltraEP проверяли на передовых MoE-моделях от 106 до 671 млрд параметров в multi-RSN-развёртывании до 256 GPU, усредняя результаты по сценариям обучения и prefill-инференса.
Насколько UltraEP ускоряет MoE?
По данным статьи, UltraEP даёт 1,49× прироста throughput относительно работы без балансировки и достигает 94,3% от теоретического максимума при идеально сбалансированной нагрузке.
Что такое rack-scale системы?
Это стоечные узлы вроде Huawei Atlas 900 A3 SuperPoD и NVIDIA NVL72, где десятки GPU объединены в один высокоскоростной interconnect-домен. Именно их расширенная связность позволяет UltraEP переносить состояния экспертов между картами за микросекунды.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.