MarkTechPost→ original

Moonshot AI открыла код MoonEP — библиотеки для обучения MoE-модели Kimi K3

Moonshot AI 29 июля 2026 года открыла под лицензией MIT исходники MoonEP — библиотеки экспертного параллелизма для обучения MoE-моделей. Она гарантирует каждому GPU-рангу ровно S×K токенов независимо от перекоса роутинга и убирает главный тормоз распределённого обучения. По данным компании, MoonEP дала прирост масштабируемости Kimi K3 в 2,5 раза.

Processado por IA de MarkTechPost; editado por Hamidun News
Moonshot AI открыла код MoonEP — библиотеки для обучения MoE-модели Kimi K3
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

A MoonshotAI abriu o código-fonte do MoonEP em 29 de julho de 2026 — uma biblioteca de paralelismo de especialistas (Expert Parallelism) para o treinamento distribuído de modelos MoE — sob a licença MIT. O MoonEP entrega exatamente S×K tokens para cada rank de computação, independentemente do desequilíbrio do roteamento, e se tornou uma das tecnologias que aceleraram o escalonamento do modelo Kimi K3 em 2,5 vezes.

Por que o paralelismo de especialistas é necessário

Nos modelos MoE, o roteador envia cada token para vários dos melhores especialistas (top-K), que vivem fisicamente em ranks de GPU diferentes. O problema é que os roteadores quase nunca estão equilibrados: alguns especialistas recebem muito mais tokens do que outros. O repositório do MoonEP mede o desequilíbrio com a métrica max_vio = max_e(T_e/T̄) − 1, em que zero significa equilíbrio perfeito.

Os custos do desequilíbrio são estruturais, não aleatórios. A latência de uma operação coletiva é determinada pelo participante mais lento, então o rank "quente" define o tempo de toda a iteração. Pior ainda, o número de tokens por rank muda a cada passo — formas dinâmicas fragmentam a memória da GPU e forçam a sincronização com o host em cada camada.

Como o MoonEP funciona

O MoonEP introduz um invariante rígido: cada rank recebe exatamente S×K tokens, em que S são os tokens de entrada por rank e K é o número de especialistas top-K por token. A biblioteca consegue isso planejando online um pequeno número de especialistas redundantes (duplicados) diretamente a partir das saídas atuais do roteador; os duplicados são pré-buscados (prefetch) antes da computação principal, e no passo para trás seus gradientes são reduzidos de volta aos ranks "de origem". O design se apoia em três propriedades: equilíbrio perfeito, planejamento online com overhead quase nulo e zero-copy com formas de buffer estáticas.

"Cada rank recebe exatamente S×K tokens, não importa o quão desequilibrado esteja o roteamento", diz a descrição do repositório do

MoonEP.

Principais fatos do lançamento:

  • Data — 29 de julho de 2026, no âmbito do Kimi K3 Open Day
  • Licença — MIT
  • Junto com o MoonEP foram abertos o AgentEnv e (anteriormente) o FlashKDA — três bases de código de infraestrutura
  • Kimi K3 — modelo MoE com 2,8 trilhões de parâmetros, visão nativa, contexto de 1 milhão de tokens
  • O planejador foi escrito em CUTLASS CuTe DSL, o setup.py fixa nvidia-cutlass-dsl==4.4.2
  • Para o treinamento é definido B=E/R; para a inferência, o README recomenda B=3–4

Por que isso importa para engenheiros

O MoonEP elimina o principal gargalo do treinamento distribuído de MoE — a dessincronização de ranks causada pelo roteamento desigual. Graças a formas de buffer conhecidas estaticamente e a uma abordagem zero-copy (os tokens são escritos diretamente em posições agrupadas por especialista), a biblioteca se livra da sincronização passo a passo com o host em cada camada. Segundo a MoonshotAI, foi exatamente esse conjunto de técnicas que gerou o ganho de escalabilidade declarado de 2,5 vezes no modelo de 2,8 trilhões de parâmetros.

O que isso significa

Abrir a camada de infraestrutura, e não apenas os pesos do modelo, reduz a barreira de entrada para o treinamento de modelos MoE ultragrandes: equipes fora dos laboratórios de ponta ganham um mecanismo pronto de balanceamento de especialistas sob a licença livre MIT.

Perguntas frequentes

O que é o MoonEP?

O MoonEP é uma biblioteca de paralelismo de especialistas da MoonshotAI para o treinamento e a inferência distribuídos de modelos MoE. Sua principal garantia é exatamente S×K tokens por rank, independentemente do desequilíbrio do roteamento.

Sob qual licença o MoonEP foi aberto?

O MoonEP é distribuído sob a licença MIT — uma das mais livres, que permite o uso comercial e a modificação do código-fonte.

A qual lançamento a saída do MoonEP está ligada?

O MoonEP foi publicado no âmbito do Kimi K3 Open Day junto com os pesos do modelo Kimi K3, um relatório técnico e mais duas bases de código — AgentEnv e FlashKDA.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…