MarkTechPost→ оригинал

Moonshot AI открыла код MoonEP — библиотеки для обучения MoE-модели Kimi K3

Moonshot AI 29 июля 2026 года открыла под лицензией MIT исходники MoonEP — библиотеки экспертного параллелизма для обучения MoE-моделей. Она гарантирует каждому GPU-рангу ровно S×K токенов независимо от перекоса роутинга и убирает главный тормоз распределённого обучения. По данным компании, MoonEP дала прирост масштабируемости Kimi K3 в 2,5 раза.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
Moonshot AI открыла код MoonEP — библиотеки для обучения MoE-модели Kimi K3
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

Moonshot AI 29 июля 2026 года открыла исходный код MoonEP — библиотеки экспертного параллелизма (Expert Parallelism) для распределённого обучения MoE-моделей под лицензией MIT. MoonEP выдаёт каждому вычислительному рангу ровно S × K токенов независимо от перекоса роутинга и стала одной из технологий, ускоривших масштабирование модели Kimi K3 в 2,5 раза.

Зачем нужен экспертный параллелизм

В MoE-моделях роутер отправляет каждый токен нескольким лучшим экспертам (top-K), которые физически живут на разных GPU-рангах. Проблема в том, что роутеры почти никогда не сбалансированы: одни эксперты получают в разы больше токенов, чем другие. Репозиторий MoonEP измеряет перекос метрикой maxvio = max_e (T_e / T̄) − 1, где ноль означает идеальный баланс.

Издержки дисбаланса структурны, а не случайны. Задержка коллективной операции определяется самым медленным участником, поэтому «горячий» ранг задаёт время всей итерации. Хуже того, число токенов на ранге меняется на каждом шаге — динамические формы фрагментируют память GPU и вынуждают синхронизацию с хостом на каждом слое.

Как устроен MoonEP

MoonEP вводит жёсткий инвариант: каждый ранг получает ровно S × K токенов, где S — входные токены на ранг, K — число top-K экспертов на токен. Библиотека добивается этого, планируя онлайн небольшое число избыточных (дублирующих) экспертов прямо из текущих выходов роутера; дубли префетчатся до основного вычисления, а на обратном проходе их градиенты сводятся обратно на «домашние» ранги. Дизайн держится на трёх свойствах: идеальный баланс, онлайн-планирование с почти нулевым оверхедом и zero-copy со статическими формами буфера.

«Каждый ранг получает ровно S × K токенов, каким бы перекошенным ни был роутинг», — говорится в описании репозитория

MoonEP.

Ключевые факты релиза:

  • Дата — 29 июля 2026 года, в рамках Kimi K3 Open Day
  • Лицензия — MIT
  • Вместе с MoonEP открыты AgentEnv и (ранее) FlashKDA — три инфраструктурные кодовые базы
  • Kimi K3 — MoE-модель на 2,8 трлн параметров, нативное зрение, контекст 1 млн токенов
  • Планировщик написан на CUTLASS CuTe DSL, setup.py фиксирует nvidia-cutlass-dsl==4.4.2
  • Для обучения задаётся B = E/R, для инференса README рекомендует B = 3–4

Почему это важно инженерам

MoonEP убирает главный тормоз распределённого обучения MoE — рассинхронизацию рангов из-за неравномерного роутинга. За счёт статически известных форм буфера и подхода zero-copy (токены пишутся сразу в позиции, сгруппированные по экспертам) библиотека избавляется от пошаговой синхронизации с хостом на каждом слое. По данным Moonshot AI, именно этот набор приёмов дал заявленный прирост масштабируемости в 2,5 раза на 2,8-триллионной модели.

Что это значит

Открытие инфраструктурного слоя, а не только весов модели, снижает порог входа в обучение сверхбольших MoE-моделей: команды за пределами топовых лабораторий получают готовый механизм балансировки экспертов под свободной лицензией MIT.

Частые вопросы

Что такое MoonEP?

MoonEP — это библиотека экспертного параллелизма от Moonshot AI для распределённого обучения и инференса MoE-моделей. Её главная гарантия — ровно S × K токенов на каждый ранг независимо от перекоса роутинга.

Под какой лицензией открыт MoonEP?

MoonEP распространяется под лицензией MIT — одной из самых свободных, разрешающей коммерческое использование и модификацию исходного кода.

С каким релизом связан выход MoonEP?

MoonEP опубликован в рамках Kimi K3 Open Day вместе с весами модели Kimi K3, техническим отчётом и ещё двумя кодовыми базами — AgentEnv и FlashKDA.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…