MarkTechPost→ original

NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода

NVIDIA NeMo выпустила Molt — PyTorch-нативный фреймворк для агентного обучения с подкреплением. Всего ~8600 строк RL-кода — в 7 раз компактнее verl (62 000 строк). Агент пишется на обычном Python и работает через стандартный SDK OpenAI или Anthropic. Производительность статистически сопоставима с Megatron-стеком. Требует кластер из 16 GPU H100.

Procesado por IA desde MarkTechPost; editado por Hamidun News
NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода
Fuente: MarkTechPost. Collage: Hamidun News.
◐ Escuchar artículo

NVIDIA lanzó Molt el 1 de agosto de 2026 — un framework para aprendizaje por refuerzo agéntico en PyTorch, desarrollado por el equipo NeMo. Característica clave: aproximadamente 8.600 líneas de código RL, lo que supone 7 veces menos que verl, con un rendimiento comparable al stack de Megatron.

¿Por qué el tamaño del código importa a los investigadores?

Molt está diseñado para que un investigador pueda mantener toda la base de código en su cabeza, y un asistente de AI pueda leerla y comprenderla en su totalidad. En los proyectos de RL académicos y empresariales, cada iteración de algoritmo requiere cambios en el entrenador, el backend distribuido y los envoltorios de rollout — y cada cambio tiene un coste elevado en tiempo. Molt resuelve este problema mediante la compacidad: 8.600 líneas frente a 62.000 en verl, 25.000 en slime y 7.200 en OpenRLHF.

  • Tamaño del código RL de Molt: ~8.600 líneas (vs. 62.000 en verl, 25.000 en slime, 7.200 en OpenRLHF)
  • Licencia: Apache 2.0, con scripts Slurm listos para usar y un contenedor precompilado
  • Requisitos de hardware: 16 GPU NVIDIA H100 en dos nodos (8 para entrenamiento, 8 para rollout)
  • Componentes: Ray (orquestación), vLLM (rollout), NVIDIA AutoModel + FSDP2 (entrenamiento)
  • Escenarios admitidos: agentes de tool-use multiturno, code-execution, entornos vision-language, LLM-as-judge, destilación on-policy a un modelo más pequeño

¿Cómo está estructurado Molt internamente?

Molt conecta tres componentes sin forks: Ray gestiona la ubicación y las colas asíncronas, vLLM realiza el rollout y NVIDIA AutoModel con FSDP2 se encarga del entrenamiento. Las actualizaciones upstream llegan mediante el cambio del pin del contenedor — sin necesidad de rebase.

"La base de código debe ser lo suficientemente compacta para que un

investigador pueda mantenerla en su cabeza, y para que un asistente de AI pueda leerla y comprenderla en su totalidad" — se afirma en la documentación técnica de Molt de NVIDIA NeMo.

Un agente en Molt es un programa Python ordinario: el investigador especifica el módulo con AgentRunner, y la función de recompensa se escribe en código estándar. Se admiten dos modos: Env (el framework gestiona el bucle del LLM al estilo Gymnasium) y ChatAgent (el desarrollador lo controla mediante el SDK estándar de OpenAI o Anthropic). El framework ejecuta un servidor loopback con soporte para ambos protocolos wire, y cada solicitud se decodifica en el lado del servidor en la secuencia exacta de tokens.

Tres invariantes de corrección organizan el diseño: identidad de tokens — los tokens generados definen la trayectoria, no un transcript re-tokenizado; semántica de versión de política — las log-probabilidades de la política de comportamiento se preservan a nivel de token; consistencia directa — el rollout y el actor deben operar sobre el mismo modelo. Para políticas MoE (mixture-of-experts), Molt aplica rollout routing replay: vLLM devuelve los identificadores de expertos para cada token, y el paso de entrenamiento los reproduce para eliminar divergencias en el enrutamiento.

¿Quién puede acceder a Molt ahora?

Molt está diseñado para grupos de investigación con acceso a clústeres H100 o H200. Según NVIDIA, el rendimiento del framework es estadísticamente comparable al stack de Megatron — los investigadores no sacrifican velocidad a cambio de compacidad. Público objetivo: laboratorios de frontera y startups de AI financiadas que trabajan en el postentrenamiento de modelos; grupos de investigación corporativa en finanzas, salud y robótica con acceso a clústeres GPU multinodo; laboratorios académicos con H100/H200.

Qué significa esto

Molt reduce el coste de iteración en la investigación de RL: 8.600 líneas transparentes aceleran los experimentos algorítmicos, y el soporte para SDKs estándar significa que el código agéntico existente se puede entrenar sin reescritura. NVIDIA está construyendo un stack abierto para el entrenamiento de agentes, compitiendo con verl y OpenRLHF no solo en velocidad, sino también en comodidad para la investigación.

Preguntas frecuentes

¿Cuántas GPU se necesitan para ejecutar Molt?

La receta estándar requiere 16 GPU NVIDIA H100 en dos nodos: 8 para entrenamiento y 8 para generación (rollout).

¿En qué se diferencia Molt de verl y OpenRLHF?

Molt contiene aproximadamente 8.600 líneas de código RL frente a las 62.000 de verl y las 7.200 de OpenRLHF. Ninguno de los tres componentes (Ray, vLLM, NVIDIA AutoModel) es forkeado: las actualizaciones llegan mediante el cambio del pin del contenedor Docker.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…