NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода
NVIDIA NeMo выпустила Molt — PyTorch-нативный фреймворк для агентного обучения с подкреплением. Всего ~8600 строк RL-кода — в 7 раз компактнее verl (62 000 строк). Агент пишется на обычном Python и работает через стандартный SDK OpenAI или Anthropic. Производительность статистически сопоставима с Megatron-стеком. Требует кластер из 16 GPU H100.
AI-обработка оригинала MarkTechPost; редакция Hamidun News
NVIDIA 1 августа 2026 года выпустила Molt — фреймворк для агентного обучения с подкреплением на PyTorch, разработанный командой NeMo. Ключевая характеристика: около 8 600 строк RL-кода, что в 7 раз меньше, чем у verl, при производительности, сопоставимой с Megatron-стеком.
Почему размер кода важен исследователям?
Molt спроектирован так, чтобы исследователь мог держать всю кодовую базу в голове, а AI-ассистент — прочитать и осмыслить её целиком. В академических и корпоративных RL-проектах каждая итерация алгоритма требует правок в тренере, распределённом бэкенде и обвязке роллаута — и каждое изменение дорого обходится по времени. Molt решает эту проблему компактностью: 8 600 строк против 62 000 у verl, 25 000 у slime и 7 200 у OpenRLHF.
- Объём RL-кода Molt: ~8 600 строк (vs 62 000 у verl, 25 000 у slime, 7 200 у OpenRLHF)
- Лицензия: Apache 2.0, с готовыми скриптами Slurm и предсобранным контейнером
- Требования к железу: 16 GPU NVIDIA H100 на двух узлах (8 для тренировки, 8 для роллаута)
- Компоненты: Ray (оркестрация), vLLM (роллаут), NVIDIA AutoModel + FSDP2 (тренировка)
- Поддерживаемые сценарии: многоходовые tool-use агенты, code-execution, vision-language среды, LLM-as-judge, on-policy дистилляция на меньшую модель
Как устроен Molt внутри?
Molt соединяет три компонента без форков: Ray управляет размещением и асинхронными очередями, vLLM выполняет роллаут, NVIDIA AutoModel с FSDP2 отвечает за тренировку. Обновления апстрима приходят через смену пина контейнера — без ребейза.
«Кодовая база должна быть достаточно компактной, чтобы исследователь мог держать её в голове, а AI-помощник — прочитать и осмыслить её целиком», — говорится в технической документации
Molt от NVIDIA NeMo.
Агент в Molt — обычная Python-программа: исследователь указывает модуль с AgentRunner, а функция вознаграждения пишется стандартным кодом. Поддерживаются два режима: Env (фреймворк управляет LLM-циклом в стиле Gymnasium) и ChatAgent (разработчик управляет через стандартный SDK OpenAI или Anthropic). Фреймворк запускает loopback-сервер с поддержкой обоих wire-протоколов, и каждый запрос декодируется на стороне сервера в точную последовательность токенов.
Три инварианта корректности организуют дизайн: идентичность токенов — сгенерированные токены определяют траекторию, а не ретокенизированный транскрипт; семантика версии политики — log-вероятности behavior-политики сохраняются на уровне токенов; прямая согласованность — роллаут и актор должны работать с одной моделью. Для MoE-политик (mixture-of-experts) Molt применяет rollout routing replay: vLLM возвращает идентификаторы экспертов для каждого токена, тренировочный проход воспроизводит их и исключает расхождения в маршрутизации.
Кому доступен Molt сейчас?
Molt рассчитан на исследовательские группы с доступом к кластерам H100 или H200. По данным NVIDIA, производительность фреймворка статистически сопоставима с Megatron-стеком — исследователи не жертвуют скоростью ради компактности. Целевая аудитория: frontier-лаборатории и финансируемые AI-стартапы, занимающиеся постобучением моделей; корпоративные исследовательские группы в финансах, здравоохранении и робототехнике с доступом к многоузловым GPU-кластерам; академические лаборатории с H100/H200.
Что это значит
Molt снижает стоимость итерации в RL-исследованиях: 8 600 прозрачных строк ускоряют алгоритмические эксперименты, а поддержка стандартных SDK означает, что существующий агентный код обучается без переписывания. NVIDIA выстраивает открытый стек для обучения агентов, конкурируя с verl и OpenRLHF не только по скорости, но и по удобству исследования.
Частые вопросы
Сколько GPU нужно для запуска Molt?
Стандартный рецепт требует 16 GPU NVIDIA H100 на двух узлах: 8 отвечают за тренировку, 8 — за генерацию (роллаут).
Чем Molt отличается от verl и OpenRLHF?
Molt содержит около 8 600 строк RL-кода против 62 000 у verl и 7 200 у OpenRLHF. Ни один из трёх компонентов (Ray, vLLM, NVIDIA AutoModel) не форкается: обновления приходят через смену пина Docker-контейнера.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.