Jiqizhixin (机器之心)→ original

UltraEP от Xiaohongshu: балансировка MoE-экспертов за 300 мкс, 94,3% от идеала

Xiaohongshu выложила UltraEP — рантайм для балансировки нагрузки экспертов в MoE-моделях при обучении и инференсе на rack-scale системах. Он перераспределяет экспертов на каждом микробатче примерно за 300 микросекунд, снижая перекос нагрузки между GPU с 4,01× до 1,04× и достигая 94,3% от идеального throughput — в 1,49 раза быстрее, чем без балансировки.

Procesado por IA desde Jiqizhixin (机器之心); editado por Hamidun News
UltraEP от Xiaohongshu: балансировка MoE-экспертов за 300 мкс, 94,3% от идеала
Fuente: Jiqizhixin (机器之心). Collage: Hamidun News.
◐ Escuchar artículo

El equipo de dotsinfra en Xiaohongshu (小红书, «Xiaohongshu») ha presentado UltraEP, un runtime que equilibra en tiempo real la carga de los expertos de los modelos MoE en sistemas rack-scale y alcanza el 94,3% del throughput ideal de entrenamiento e inferencia. El artículo se publicó en arXiv el 2 de junio de 2026.

Qué problema resuelve UltraEP

UltraEP elimina el desequilibrio de carga entre los expertos de los modelos MoE, que hace que los costosos sistemas GPU en rack permanezcan inactivos. En nodos rack-scale como el Huawei Atlas 900 A3 SuperPoD y el NVIDIA NVL72, decenas de GPU se unen en un único dominio de interconexión de alta velocidad, y los expertos del modelo se distribuyen entre ellas (Expert Parallelism). Los tokens seleccionan expertos de forma desigual: algunas GPU se sobrecargan y se convierten en «rezagadas de cómputo» (compute stragglers), lo que genera cuellos de botella en la comunicación all-to-all y picos de memoria de activación.

Los balanceadores existentes reordenan a los expertos periódicamente, basándose en la carga histórica. Según los autores, en despliegues de producción reales con un patrón de carga no estacionario este enfoque no es confiable: el desequilibrio entre rangos llega hasta 4,01× respecto a la media, y parte de las tarjetas del rack permanece inactiva mientras las GPU sobrecargadas ralentizan todo el paso.

Cómo funciona el balanceo en 300 microsegundos

UltraEP rebalancea cada microbatch y cada capa directamente en la ruta crítica de cómputo, en lugar de hacerlo cada N pasos. El sistema reacciona a la carga inmediatamente después del gating mediante un planificador quota-driven y realiza transferencias irregulares de los estados de los expertos a través de persistent tile streaming, «nativo» de los nodos rack-scale, con un mecanismo de relay contra la sobrecarga de fan-out. La sobrecarga adicional es de aproximadamente 300 microsegundos por rebalanceo.

  • 94,3% del throughput ideal (force-balanced), promediado entre entrenamiento e inferencia
  • Aceleración de 1,49× en comparación con el funcionamiento sin balanceo
  • El desequilibrio de carga entre rangos se redujo de 1,30–4,01 a 1,01–1,04
  • Overhead del rebalanceo: alrededor de 300 microsegundos
  • Pruebas: despliegue multi-RSN de hasta 256 GPU
  • Modelos de 106 a 671 mil millones de parámetros; arXiv 2606.04101, presentado el 2 de junio de 2026
«UltraEP es el primer balanceador con contabilización precisa de la carga en tiempo real para el entrenamiento y la inferencia prefill de grandes modelos

MoE en nodos rack-scale», señala el artículo del equipo de dotsinfra en arXiv.

Por qué esto importa para el entrenamiento de MoE

UltraEP traslada el balanceo de expertos del plano «periódico» al tiempo real, recuperando hasta 1,49× de throughput con el mismo hardware. Para modelos de la escala de 671 mil millones de parámetros (la escala de DeepSeek-V3), esto significa que los racks de decenas de GPU dejan de estar inactivos por culpa de los expertos «calientes», que reciben una proporción desproporcionada de tokens. La clave de la velocidad está en la propia topología rack-scale: la conectividad ampliada de decenas de GPU dentro de un nodo permite reorganizar a los expertos entre tarjetas más rápido de lo que logran los balanceadores periódicos clásicos.

UltraEP está implementado como un runtime independiente y, según los autores, se integra en los stacks existentes de entrenamiento e inferencia sin necesidad de reescribirlos.

Qué significa esto

El balanceo de carga se está convirtiendo en el siguiente frente de la lucha por la eficiencia de MoE, después del ancho de banda y la velocidad de las comunicaciones. UltraEP demuestra que, con la conectividad de los nodos rack-scale, los expertos pueden reorganizarse literalmente en cada paso, extrayendo de un hardware que cuesta millones de dólares una utilización casi ideal.

Preguntas frecuentes

¿Con qué modelos se probó UltraEP?

UltraEP se probó con modelos MoE de vanguardia de entre 106 y 671 mil millones de parámetros en un despliegue multi-RSN de hasta 256 GPU, promediando los resultados entre escenarios de entrenamiento e inferencia prefill.

¿Cuánto acelera UltraEP a MoE?

Según el artículo, UltraEP ofrece una mejora de throughput de 1,49× respecto al funcionamiento sin balanceo y alcanza el 94,3% del máximo teórico con una carga perfectamente equilibrada.

¿Qué son los sistemas rack-scale?

Son nodos en rack como el Huawei Atlas 900 A3 SuperPoD y el NVIDIA NVL72, donde decenas de GPU se unen en un único dominio de interconexión de alta velocidad. Es precisamente su conectividad ampliada la que permite a UltraEP transferir los estados de los expertos entre tarjetas en microsegundos.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…