MarkTechPost→ original

NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода

NVIDIA NeMo выпустила Molt — PyTorch-нативный фреймворк для агентного обучения с подкреплением. Всего ~8600 строк RL-кода — в 7 раз компактнее verl (62 000 строк). Агент пишется на обычном Python и работает через стандартный SDK OpenAI или Anthropic. Производительность статистически сопоставима с Megatron-стеком. Требует кластер из 16 GPU H100.

Traité par IA depuis MarkTechPost ; édité par Hamidun News
NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода
Source : MarkTechPost. Collage: Hamidun News.
◐ Écouter l'article

NVIDIA a publié Molt le 1er août 2026 — un framework pour l'apprentissage par renforcement agentique sur PyTorch, développé par l'équipe NeMo. Caractéristique clé : environ 8 600 lignes de code RL, soit 7 fois moins que verl, avec des performances comparables à la pile Megatron.

Pourquoi la taille du code est-elle importante pour les chercheurs ?

Molt est conçu pour qu'un chercheur puisse garder l'intégralité de la base de code en tête, et qu'un assistant AI puisse la lire et la comprendre dans son ensemble. Dans les projets RL académiques et d'entreprise, chaque itération d'algorithme nécessite des modifications dans le formateur, le backend distribué et les enveloppes de rollout — et chaque changement est coûteux en temps. Molt résout ce problème par la compacité : 8 600 lignes contre 62 000 pour verl, 25 000 pour slime et 7 200 pour OpenRLHF.

  • Volume du code RL de Molt : ~8 600 lignes (vs 62 000 pour verl, 25 000 pour slime, 7 200 pour OpenRLHF)
  • Licence : Apache 2.0, avec des scripts Slurm prêts à l'emploi et un conteneur préassemblé
  • Configuration matérielle requise : 16 GPU NVIDIA H100 sur deux nœuds (8 pour l'entraînement, 8 pour le rollout)
  • Composants : Ray (orchestration), vLLM (rollout), NVIDIA AutoModel + FSDP2 (entraînement)
  • Scénarios pris en charge : agents tool-use multi-tours, code-execution, environnements vision-language, LLM-as-judge, distillation on-policy vers un modèle plus petit

Comment Molt est-il structuré en interne ?

Molt connecte trois composants sans forks : Ray gère le placement et les files d'attente asynchrones, vLLM effectue le rollout, NVIDIA AutoModel avec FSDP2 prend en charge l'entraînement. Les mises à jour upstream arrivent via un changement de pin de conteneur — sans rebase.

«

La base de code doit être suffisamment compacte pour qu'un chercheur puisse la garder en tête, et pour qu'un assistant AI puisse la lire et la comprendre dans son ensemble » — indique la documentation technique de Molt par NVIDIA NeMo.

Un agent dans Molt est un programme Python ordinaire : le chercheur spécifie le module avec AgentRunner, et la fonction de récompense est écrite en code standard. Deux modes sont pris en charge : Env (le framework gère la boucle LLM dans le style Gymnasium) et ChatAgent (le développeur contrôle via le SDK standard OpenAI ou Anthropic). Le framework exécute un serveur loopback prenant en charge les deux protocoles wire, et chaque requête est décodée côté serveur en séquence exacte de tokens.

Trois invariants de correction organisent la conception : identité des tokens — les tokens générés définissent la trajectoire, et non un transcript re-tokenisé ; sémantique de version de politique — les log-probabilités de la politique de comportement sont préservées au niveau des tokens ; cohérence directe — le rollout et l'acteur doivent opérer sur le même modèle. Pour les politiques MoE (mixture-of-experts), Molt applique le rollout routing replay : vLLM renvoie les identifiants d'experts pour chaque token, et la passe d'entraînement les rejoue pour éliminer les divergences de routage.

Qui peut accéder à Molt maintenant ?

Molt est destiné aux groupes de recherche ayant accès à des clusters H100 ou H200. Selon NVIDIA, les performances du framework sont statistiquement comparables à la pile Megatron — les chercheurs ne sacrifient pas la vitesse pour la compacité. Public cible : laboratoires de pointe et startups AI financées travaillant sur le post-entraînement de modèles ; groupes de recherche d'entreprise en finance, santé et robotique ayant accès à des clusters GPU multi-nœuds ; laboratoires académiques avec H100/H200.

Ce que cela signifie

Molt réduit le coût d'itération dans la recherche RL : 8 600 lignes transparentes accélèrent les expériences algorithmiques, et le support des SDK standards signifie que le code agentique existant peut être entraîné sans réécriture. NVIDIA construit une pile ouverte pour l'entraînement d'agents, en concurrençant verl et OpenRLHF non seulement sur la vitesse, mais aussi sur la commodité de recherche.

Foire aux questions

Combien de GPU faut-il pour faire fonctionner Molt ?

La recette standard nécessite 16 GPU NVIDIA H100 sur deux nœuds : 8 pour l'entraînement et 8 pour la génération (rollout).

En quoi Molt diffère-t-il de verl et OpenRLHF ?

Molt contient environ 8 600 lignes de code RL contre 62 000 pour verl et 7 200 pour OpenRLHF. Aucun des trois composants (Ray, vLLM, NVIDIA AutoModel) n'est forké : les mises à jour arrivent via un changement de pin du conteneur Docker.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…