MarkTechPost→ original

NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода

NVIDIA NeMo выпустила Molt — PyTorch-нативный фреймворк для агентного обучения с подкреплением. Всего ~8600 строк RL-кода — в 7 раз компактнее verl (62 000 строк). Агент пишется на обычном Python и работает через стандартный SDK OpenAI или Anthropic. Производительность статистически сопоставима с Megatron-стеком. Требует кластер из 16 GPU H100.

Processado por IA de MarkTechPost; editado por Hamidun News
NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

A NVIDIA lançou o Molt em 1º de agosto de 2026 — um framework para aprendizado por reforço agêntico em PyTorch, desenvolvido pela equipe NeMo. Característica-chave: aproximadamente 8.600 linhas de código RL, o que é 7 vezes menos do que o verl, com desempenho comparável ao stack Megatron.

Por que o tamanho do código importa para os pesquisadores?

O Molt foi projetado para que um pesquisador possa manter toda a base de código em mente, e um assistente de AI consiga lê-la e compreendê-la integralmente. Em projetos de RL acadêmicos e corporativos, cada iteração de algoritmo exige alterações no treinador, no backend distribuído e nos wrappers de rollout — e cada mudança tem um custo elevado em termos de tempo. O Molt resolve esse problema por meio da compacidade: 8.600 linhas versus 62.000 no verl, 25.000 no slime e 7.200 no OpenRLHF.

  • Tamanho do código RL do Molt: ~8.600 linhas (vs. 62.000 no verl, 25.000 no slime, 7.200 no OpenRLHF)
  • Licença: Apache 2.0, com scripts Slurm prontos e container pré-compilado
  • Requisitos de hardware: 16 GPUs NVIDIA H100 em dois nós (8 para treinamento, 8 para rollout)
  • Componentes: Ray (orquestração), vLLM (rollout), NVIDIA AutoModel + FSDP2 (treinamento)
  • Cenários suportados: agentes multi-turno com tool-use, code-execution, ambientes vision-language, LLM-as-judge, destilação on-policy para um modelo menor

Como o Molt é estruturado internamente?

O Molt conecta três componentes sem forks: o Ray gerencia a alocação e as filas assíncronas, o vLLM executa o rollout, e o NVIDIA AutoModel com FSDP2 cuida do treinamento. As atualizações upstream chegam por meio da troca do pin do container — sem necessidade de rebase.

"A base de código deve ser compacta o suficiente para que um

pesquisador a mantenha em mente, e para que um assistente de AI consiga lê-la e compreendê-la integralmente" — afirma a documentação técnica do Molt da NVIDIA NeMo.

Um agente no Molt é um programa Python comum: o pesquisador especifica o módulo com o AgentRunner, e a função de recompensa é escrita em código padrão. Dois modos são suportados: Env (o framework gerencia o loop do LLM no estilo Gymnasium) e ChatAgent (o desenvolvedor controla via SDK padrão da OpenAI ou Anthropic). O framework executa um servidor loopback com suporte a ambos os protocolos wire, e cada requisição é decodificada no lado do servidor na sequência exata de tokens.

Três invariantes de correção organizam o design: identidade de tokens — os tokens gerados definem a trajetória, não um transcript re-tokenizado; semântica da versão da política — as log-probabilidades da política de comportamento são preservadas no nível do token; consistência direta — o rollout e o ator devem operar sobre o mesmo modelo. Para políticas MoE (mixture-of-experts), o Molt aplica rollout routing replay: o vLLM retorna os IDs dos especialistas para cada token, e o passo de treinamento os reproduz para eliminar divergências de roteamento.

Quem pode acessar o Molt agora?

O Molt é voltado para grupos de pesquisa com acesso a clusters H100 ou H200. Segundo a NVIDIA, o desempenho do framework é estatisticamente comparável ao stack Megatron — os pesquisadores não sacrificam velocidade em troca de compacidade. Público-alvo: laboratórios de fronteira e startups de AI financiadas que trabalham com pós-treinamento de modelos; grupos de pesquisa corporativa em finanças, saúde e robótica com acesso a clusters GPU multinó; laboratórios acadêmicos com H100/H200.

O que isso significa

O Molt reduz o custo de iteração em pesquisa de RL: 8.600 linhas transparentes aceleram experimentos algorítmicos, e o suporte a SDKs padrão significa que o código agêntico existente pode ser treinado sem reescrita. A NVIDIA está construindo um stack aberto para treinamento de agentes, competindo com verl e OpenRLHF não apenas em velocidade, mas também em conveniência para pesquisa.

Perguntas frequentes

Quantas GPUs são necessárias para executar o Molt?

A receita padrão requer 16 GPUs NVIDIA H100 em dois nós: 8 para treinamento e 8 para geração (rollout).

Como o Molt se diferencia do verl e do OpenRLHF?

O Molt contém aproximadamente 8.600 linhas de código RL versus 62.000 no verl e 7.200 no OpenRLHF. Nenhum dos três componentes (Ray, vLLM, NVIDIA AutoModel) é forkeado: as atualizações chegam por meio da troca do pin do container Docker.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…