UltraEP от Xiaohongshu: балансировка MoE-экспертов за 300 мкс, 94,3% от идеала
Xiaohongshu выложила UltraEP — рантайм для балансировки нагрузки экспертов в MoE-моделях при обучении и инференсе на rack-scale системах. Он перераспределяет экспертов на каждом микробатче примерно за 300 микросекунд, снижая перекос нагрузки между GPU с 4,01× до 1,04× и достигая 94,3% от идеального throughput — в 1,49 раза быстрее, чем без балансировки.
Processado por IA de Jiqizhixin (机器之心); editado por Hamidun News
A equipe da dotsinfra na Xiaohongshu (小红书, «Xiaohongshu») apresentou o UltraEP — um runtime que equilibra em tempo real a carga dos especialistas (experts) de modelos MoE em sistemas rack-scale e atinge 94,3% do throughput ideal de treinamento e inferência. O artigo foi publicado no arXiv em 2 de junho de 2026.
Qual problema o UltraEP resolve
O UltraEP elimina o desequilíbrio de carga entre os especialistas dos modelos MoE, que faz com que caros sistemas de GPU em rack fiquem ociosos. Em nós rack-scale como o Huawei Atlas 900 A3 SuperPoD e o NVIDIA NVL72, dezenas de GPUs são reunidas em um único domínio de interconexão de alta velocidade, e os especialistas do modelo são distribuídos entre elas (Expert Parallelism). Os tokens selecionam especialistas de forma desigual: algumas GPUs ficam sobrecarregadas e se tornam «retardatárias de computação» (compute stragglers), gerando gargalos na comunicação all-to-all e picos de memória de ativação.
Os balanceadores existentes reorganizam os especialistas periodicamente, com base na carga histórica. Segundo os autores, em implantações de produção reais com um padrão de carga não estacionário essa abordagem não é confiável — o desequilíbrio entre ranks chega a 4,01× em relação à média, e parte das placas do rack fica ociosa enquanto as GPUs sobrecarregadas atrasam toda a etapa.
Como funciona o balanceamento em 300 microssegundos
O UltraEP rebalanceia cada microbatch e cada camada diretamente no caminho crítico do cálculo, em vez de fazê-lo a cada N passos. O sistema reage à carga imediatamente após o gating por meio de um escalonador quota-driven e realiza transferências irregulares dos estados dos especialistas via persistent tile streaming, «nativo» dos nós rack-scale, com um mecanismo de relay contra a sobrecarga de fan-out. O overhead adicional é de cerca de 300 microssegundos por rebalanceamento.
- 94,3% do throughput ideal (force-balanced), em média entre treinamento e inferência
- Aceleração de 1,49× em comparação ao funcionamento sem balanceamento
- Desequilíbrio de carga entre ranks reduzido de 1,30–4,01 para 1,01–1,04
- Overhead do rebalanceamento — cerca de 300 microssegundos
- Testes — implantação multi-RSN com até 256 GPUs
- Modelos de 106 a 671 bilhões de parâmetros; arXiv 2606.04101, submetido em 2 de junho de 2026
«O
UltraEP é o primeiro balanceador com contabilização precisa da carga em tempo real para o treinamento e a inferência prefill de grandes modelos MoE em nós rack-scale», afirma o artigo da equipe da dotsinfra no arXiv.
Por que isso importa para o treinamento de MoE
O UltraEP transfere o balanceamento de especialistas do plano «periódico» para o tempo real, recuperando até 1,49× de throughput no mesmo hardware. Para modelos na escala de 671 bilhões de parâmetros (a escala do DeepSeek-V3), isso significa que racks com dezenas de GPUs param de ficar ociosos por causa de especialistas «quentes», que recebem uma parcela desproporcional de tokens. A chave para a velocidade está na própria topologia rack-scale: a conectividade ampliada de dezenas de GPUs dentro de um nó permite embaralhar especialistas entre as placas mais rápido do que fazem os balanceadores periódicos clássicos.
O UltraEP é implementado como um runtime independente e, segundo os autores, se integra às pilhas (stacks) existentes de treinamento e inferência sem necessidade de reescrita.
O que isso significa
O balanceamento de carga está se tornando a próxima frente na luta pela eficiência do MoE — depois da largura de banda e da velocidade de comunicação. O UltraEP mostra que, com a conectividade dos nós rack-scale, os especialistas podem ser reembaralhados literalmente a cada passo, extraindo de um hardware que custa milhões de dólares uma utilização quase ideal.
Perguntas frequentes
Em quais modelos o UltraEP foi testado?
O UltraEP foi testado em modelos MoE de ponta, de 106 a 671 bilhões de parâmetros, em uma implantação multi-RSN com até 256 GPUs, com resultados calculados em média entre os cenários de treinamento e inferência prefill.
Quanto o UltraEP acelera o MoE?
Segundo o artigo, o UltraEP proporciona um ganho de throughput de 1,49× em relação ao funcionamento sem balanceamento e atinge 94,3% do máximo teórico com carga perfeitamente balanceada.
O que são sistemas rack-scale?
São nós em rack como o Huawei Atlas 900 A3 SuperPoD e o NVIDIA NVL72, nos quais dezenas de GPUs são reunidas em um único domínio de interconexão de alta velocidade. É justamente essa conectividade ampliada que permite ao UltraEP transferir os estados dos especialistas entre as placas em microssegundos.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.