MarkTechPost→ оригинал

NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода

NVIDIA NeMo выпустила Molt — PyTorch-нативный фреймворк для агентного обучения с подкреплением. Всего ~8600 строк RL-кода — в 7 раз компактнее verl (62 000 строк). Агент пишется на обычном Python и работает через стандартный SDK OpenAI или Anthropic. Производительность статистически сопоставима с Megatron-стеком. Требует кластер из 16 GPU H100.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

NVIDIA 1 августа 2026 года выпустила Molt — фреймворк для агентного обучения с подкреплением на PyTorch, разработанный командой NeMo. Ключевая характеристика: около 8 600 строк RL-кода, что в 7 раз меньше, чем у verl, при производительности, сопоставимой с Megatron-стеком.

Почему размер кода важен исследователям?

Molt спроектирован так, чтобы исследователь мог держать всю кодовую базу в голове, а AI-ассистент — прочитать и осмыслить её целиком. В академических и корпоративных RL-проектах каждая итерация алгоритма требует правок в тренере, распределённом бэкенде и обвязке роллаута — и каждое изменение дорого обходится по времени. Molt решает эту проблему компактностью: 8 600 строк против 62 000 у verl, 25 000 у slime и 7 200 у OpenRLHF.

  • Объём RL-кода Molt: ~8 600 строк (vs 62 000 у verl, 25 000 у slime, 7 200 у OpenRLHF)
  • Лицензия: Apache 2.0, с готовыми скриптами Slurm и предсобранным контейнером
  • Требования к железу: 16 GPU NVIDIA H100 на двух узлах (8 для тренировки, 8 для роллаута)
  • Компоненты: Ray (оркестрация), vLLM (роллаут), NVIDIA AutoModel + FSDP2 (тренировка)
  • Поддерживаемые сценарии: многоходовые tool-use агенты, code-execution, vision-language среды, LLM-as-judge, on-policy дистилляция на меньшую модель

Как устроен Molt внутри?

Molt соединяет три компонента без форков: Ray управляет размещением и асинхронными очередями, vLLM выполняет роллаут, NVIDIA AutoModel с FSDP2 отвечает за тренировку. Обновления апстрима приходят через смену пина контейнера — без ребейза.

«Кодовая база должна быть достаточно компактной, чтобы исследователь мог держать её в голове, а AI-помощник — прочитать и осмыслить её целиком», — говорится в технической документации

Molt от NVIDIA NeMo.

Агент в Molt — обычная Python-программа: исследователь указывает модуль с AgentRunner, а функция вознаграждения пишется стандартным кодом. Поддерживаются два режима: Env (фреймворк управляет LLM-циклом в стиле Gymnasium) и ChatAgent (разработчик управляет через стандартный SDK OpenAI или Anthropic). Фреймворк запускает loopback-сервер с поддержкой обоих wire-протоколов, и каждый запрос декодируется на стороне сервера в точную последовательность токенов.

Три инварианта корректности организуют дизайн: идентичность токенов — сгенерированные токены определяют траекторию, а не ретокенизированный транскрипт; семантика версии политики — log-вероятности behavior-политики сохраняются на уровне токенов; прямая согласованность — роллаут и актор должны работать с одной моделью. Для MoE-политик (mixture-of-experts) Molt применяет rollout routing replay: vLLM возвращает идентификаторы экспертов для каждого токена, тренировочный проход воспроизводит их и исключает расхождения в маршрутизации.

Кому доступен Molt сейчас?

Molt рассчитан на исследовательские группы с доступом к кластерам H100 или H200. По данным NVIDIA, производительность фреймворка статистически сопоставима с Megatron-стеком — исследователи не жертвуют скоростью ради компактности. Целевая аудитория: frontier-лаборатории и финансируемые AI-стартапы, занимающиеся постобучением моделей; корпоративные исследовательские группы в финансах, здравоохранении и робототехнике с доступом к многоузловым GPU-кластерам; академические лаборатории с H100/H200.

Что это значит

Molt снижает стоимость итерации в RL-исследованиях: 8 600 прозрачных строк ускоряют алгоритмические эксперименты, а поддержка стандартных SDK означает, что существующий агентный код обучается без переписывания. NVIDIA выстраивает открытый стек для обучения агентов, конкурируя с verl и OpenRLHF не только по скорости, но и по удобству исследования.

Частые вопросы

Сколько GPU нужно для запуска Molt?

Стандартный рецепт требует 16 GPU NVIDIA H100 на двух узлах: 8 отвечают за тренировку, 8 — за генерацию (роллаут).

Чем Molt отличается от verl и OpenRLHF?

Molt содержит около 8 600 строк RL-кода против 62 000 у verl и 7 200 у OpenRLHF. Ни один из трёх компонентов (Ray, vLLM, NVIDIA AutoModel) не форкается: обновления приходят через смену пина Docker-контейнера.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…