Jiqizhixin (机器之心)→ original

UltraEP от Xiaohongshu: балансировка MoE-экспертов за 300 мкс, 94,3% от идеала

Xiaohongshu выложила UltraEP — рантайм для балансировки нагрузки экспертов в MoE-моделях при обучении и инференсе на rack-scale системах. Он перераспределяет экспертов на каждом микробатче примерно за 300 микросекунд, снижая перекос нагрузки между GPU с 4,01× до 1,04× и достигая 94,3% от идеального throughput — в 1,49 раза быстрее, чем без балансировки.

Traité par IA depuis Jiqizhixin (机器之心) ; édité par Hamidun News
UltraEP от Xiaohongshu: балансировка MoE-экспертов за 300 мкс, 94,3% от идеала
Source : Jiqizhixin (机器之心). Collage: Hamidun News.
◐ Écouter l'article

L'équipe dotsinfra de Xiaohongshu (小红书, «Xiaohongshu») a présenté UltraEP — un runtime qui équilibre en temps réel la charge des experts des modèles MoE sur des systèmes rack-scale et atteint 94,3% du throughput idéal en entraînement et en inférence. L'article a été publié sur arXiv le 2 juin 2026.

Quel problème résout UltraEP

UltraEP élimine le déséquilibre de charge entre les experts des modèles MoE, qui laisse inactifs de coûteux systèmes GPU en rack. Dans les nœuds rack-scale comme le Huawei Atlas 900 A3 SuperPoD et le NVIDIA NVL72, des dizaines de GPU sont réunis dans un seul domaine d'interconnexion à haut débit, et les experts du modèle sont répartis entre eux (Expert Parallelism). Les tokens sélectionnent les experts de manière inégale : certains GPU sont surchargés et deviennent des « retardataires de calcul » (compute stragglers), ce qui provoque des goulets d'étranglement dans les communications all-to-all et des pics de mémoire d'activation.

Les équilibreurs existants réorganisent les experts périodiquement, en se basant sur la charge historique. Selon les auteurs, dans les déploiements de production réels avec un schéma de charge non stationnaire, cette approche n'est pas fiable — le déséquilibre entre rangs atteint jusqu'à 4,01× par rapport à la moyenne, et une partie des cartes du rack reste inactive pendant que les GPU surchargés ralentissent toute l'étape.

Comment fonctionne l'équilibrage en 300 microsecondes

UltraEP rééquilibre chaque microbatch et chaque couche directement sur le chemin critique des calculs, plutôt qu'une fois tous les N pas. Le système réagit à la charge immédiatement après le gating grâce à un ordonnanceur quota-driven et effectue des transferts irréguliers des états des experts via un persistent tile streaming, « natif » des nœuds rack-scale, avec un mécanisme de relay contre la surcharge fan-out. Le surcoût supplémentaire est d'environ 300 microsecondes par rééquilibrage.

  • 94,3% du throughput idéal (force-balanced), en moyenne sur l'entraînement et l'inférence
  • Accélération de 1,49× par rapport à un fonctionnement sans équilibrage
  • Déséquilibre de charge entre rangs réduit de 1,30–4,01 à 1,01–1,04
  • Overhead du rééquilibrage — environ 300 microsecondes
  • Tests — déploiement multi-RSN jusqu'à 256 GPU
  • Modèles de 106 à 671 milliards de paramètres ; arXiv 2606.04101, soumis le 2 juin 2026
«

UltraEP est le premier équilibreur à comptabilisation précise de la charge en temps réel pour l'entraînement et l'inférence prefill de grands modèles MoE sur des nœuds rack-scale », indique l'article de l'équipe dotsinfra sur arXiv.

Pourquoi c'est important pour l'entraînement des MoE

UltraEP fait passer l'équilibrage des experts d'un plan « périodique » au temps réel, en récupérant jusqu'à 1,49× de throughput sur le même matériel. Pour des modèles de l'ordre de 671 milliards de paramètres (l'échelle de DeepSeek-V3), cela signifie que des racks de dizaines de GPU cessent d'être inactifs à cause d'experts « chauds » qui reçoivent une part disproportionnée de tokens. La clé de la vitesse réside dans la topologie rack-scale elle-même : la connectivité étendue de dizaines de GPU au sein d'un nœud permet de redistribuer les experts entre les cartes plus rapidement que ne le font les équilibreurs périodiques classiques.

UltraEP est mis en œuvre comme un runtime autonome et, selon les auteurs, s'intègre aux stacks d'entraînement et d'inférence existants sans réécriture.

Ce que cela signifie

L'équilibrage de charge devient le prochain front de la bataille pour l'efficacité des MoE — après la bande passante et la vitesse des communications. UltraEP montre qu'avec la connectivité des nœuds rack-scale, les experts peuvent être redistribués littéralement à chaque étape, tirant d'un matériel valant des millions de dollars une utilisation quasi idéale.

Questions fréquentes

Sur quels modèles UltraEP a-t-il été testé ?

UltraEP a été testé sur des modèles MoE de pointe allant de 106 à 671 milliards de paramètres, dans un déploiement multi-RSN allant jusqu'à 256 GPU, en moyennant les résultats sur les scénarios d'entraînement et d'inférence prefill.

De combien UltraEP accélère-t-il les MoE ?

Selon l'article, UltraEP offre un gain de throughput de 1,49× par rapport à un fonctionnement sans équilibrage et atteint 94,3% du maximum théorique avec une charge parfaitement équilibrée.

Que sont les systèmes rack-scale ?

Ce sont des nœuds en rack comme le Huawei Atlas 900 A3 SuperPoD et le NVIDIA NVL72, où des dizaines de GPU sont réunis dans un seul domaine d'interconnexion à haut débit. C'est précisément leur connectivité étendue qui permet à UltraEP de transférer les états des experts entre les cartes en quelques microsecondes.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…