NVIDIA выпустила Molt: PyTorch-фреймворк для агентного RL в 8600 строк кода
NVIDIA NeMo выпустила Molt — PyTorch-нативный фреймворк для агентного обучения с подкреплением. Всего ~8600 строк RL-кода — в 7 раз компактнее verl (62 000 строк). Агент пишется на обычном Python и работает через стандартный SDK OpenAI или Anthropic. Производительность статистически сопоставима с Megatron-стеком. Требует кластер из 16 GPU H100.
Processado por IA de MarkTechPost; editado por Hamidun News
A NVIDIA lançou o Molt em 1º de agosto de 2026 — um framework para aprendizado por reforço agêntico em PyTorch, desenvolvido pela equipe NeMo. Característica-chave: aproximadamente 8.600 linhas de código RL, o que é 7 vezes menos do que o verl, com desempenho comparável ao stack Megatron.
Por que o tamanho do código importa para os pesquisadores?
O Molt foi projetado para que um pesquisador possa manter toda a base de código em mente, e um assistente de AI consiga lê-la e compreendê-la integralmente. Em projetos de RL acadêmicos e corporativos, cada iteração de algoritmo exige alterações no treinador, no backend distribuído e nos wrappers de rollout — e cada mudança tem um custo elevado em termos de tempo. O Molt resolve esse problema por meio da compacidade: 8.600 linhas versus 62.000 no verl, 25.000 no slime e 7.200 no OpenRLHF.
- Tamanho do código RL do Molt: ~8.600 linhas (vs. 62.000 no verl, 25.000 no slime, 7.200 no OpenRLHF)
- Licença: Apache 2.0, com scripts Slurm prontos e container pré-compilado
- Requisitos de hardware: 16 GPUs NVIDIA H100 em dois nós (8 para treinamento, 8 para rollout)
- Componentes: Ray (orquestração), vLLM (rollout), NVIDIA AutoModel + FSDP2 (treinamento)
- Cenários suportados: agentes multi-turno com tool-use, code-execution, ambientes vision-language, LLM-as-judge, destilação on-policy para um modelo menor
Como o Molt é estruturado internamente?
O Molt conecta três componentes sem forks: o Ray gerencia a alocação e as filas assíncronas, o vLLM executa o rollout, e o NVIDIA AutoModel com FSDP2 cuida do treinamento. As atualizações upstream chegam por meio da troca do pin do container — sem necessidade de rebase.
"A base de código deve ser compacta o suficiente para que um
pesquisador a mantenha em mente, e para que um assistente de AI consiga lê-la e compreendê-la integralmente" — afirma a documentação técnica do Molt da NVIDIA NeMo.
Um agente no Molt é um programa Python comum: o pesquisador especifica o módulo com o AgentRunner, e a função de recompensa é escrita em código padrão. Dois modos são suportados: Env (o framework gerencia o loop do LLM no estilo Gymnasium) e ChatAgent (o desenvolvedor controla via SDK padrão da OpenAI ou Anthropic). O framework executa um servidor loopback com suporte a ambos os protocolos wire, e cada requisição é decodificada no lado do servidor na sequência exata de tokens.
Três invariantes de correção organizam o design: identidade de tokens — os tokens gerados definem a trajetória, não um transcript re-tokenizado; semântica da versão da política — as log-probabilidades da política de comportamento são preservadas no nível do token; consistência direta — o rollout e o ator devem operar sobre o mesmo modelo. Para políticas MoE (mixture-of-experts), o Molt aplica rollout routing replay: o vLLM retorna os IDs dos especialistas para cada token, e o passo de treinamento os reproduz para eliminar divergências de roteamento.
Quem pode acessar o Molt agora?
O Molt é voltado para grupos de pesquisa com acesso a clusters H100 ou H200. Segundo a NVIDIA, o desempenho do framework é estatisticamente comparável ao stack Megatron — os pesquisadores não sacrificam velocidade em troca de compacidade. Público-alvo: laboratórios de fronteira e startups de AI financiadas que trabalham com pós-treinamento de modelos; grupos de pesquisa corporativa em finanças, saúde e robótica com acesso a clusters GPU multinó; laboratórios acadêmicos com H100/H200.
O que isso significa
O Molt reduz o custo de iteração em pesquisa de RL: 8.600 linhas transparentes aceleram experimentos algorítmicos, e o suporte a SDKs padrão significa que o código agêntico existente pode ser treinado sem reescrita. A NVIDIA está construindo um stack aberto para treinamento de agentes, competindo com verl e OpenRLHF não apenas em velocidade, mas também em conveniência para pesquisa.
Perguntas frequentes
Quantas GPUs são necessárias para executar o Molt?
A receita padrão requer 16 GPUs NVIDIA H100 em dois nós: 8 para treinamento e 8 para geração (rollout).
Como o Molt se diferencia do verl e do OpenRLHF?
O Molt contém aproximadamente 8.600 linhas de código RL versus 62.000 no verl e 7.200 no OpenRLHF. Nenhum dos três componentes (Ray, vLLM, NVIDIA AutoModel) é forkeado: as atualizações chegam por meio da troca do pin do container Docker.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.