Prefix-GRPO: метод обучения малых языковых моделей-агентов на префиксах траекторий
Исследователи представили Prefix-GRPO — метод обучения с подкреплением для малых языковых моделей-агентов. Вместо того чтобы копировать поведение сильной модели-учителя одним махом, он разбивает её траектории на префиксы, воспроизводит их в среде для восстановления промежуточного состояния и дообучает модель онлайн с наградой за задачу. На трёх средах — TextCraft, BabyAI и ALFWorld — подход обошёл и классическую дистилляцию, и стандартный RL.
Processado por IA de arXiv cs.LG; editado por Hamidun News
Pesquisadores propuseram o Prefix-GRPO — um método de aprendizado por reforço publicado no arXiv (cs.LG) em julho de 2026. Ele ajuda modelos de linguagem pequenos que atuam como agentes a aprender com as trajetórias de um modelo professor forte, sem transformá-las em uma imitação de uso único, e em três ambientes — TextCraft, BabyAI e ALFWorld — supera tanto a destilação clássica quanto o RL padrão.
Por que a destilação emperra em tarefas longas
A destilação direta reduz o comportamento rico e de múltiplas etapas do professor a metas de uma única etapa para imitação — e isso é ineficiente nos casos em que decisões iniciais determinam estados e recompensas futuras. Modelos pequenos são atraentes como base para agentes interativos: são baratos e rápidos. Mas quando um agente precisa percorrer uma longa cadeia de ações (pegar um item, chegar ao objetivo, executar uma instrução), o treinamento do tipo "repita a resposta do professor" perde a estrutura causal: o modelo memoriza as falas finais, mas não entende como o professor chegou ao estado necessário.
Como funciona o Prefix-GRPO
O Prefix-GRPO divide cada trajetória do professor em dois componentes: replay-aligned prefix queries (prefixos para reprodução) e online continuations (continuações on-line). Cada prefixo é reproduzido novamente no ambiente para restaurar um estado intermediário válido, após o que o aluno continua a interação por conta própria e recebe a recompensa pela tarefa.
A principal diferença em relação ao GRPO response-only é que o método aplica atualizações de política recortadas (clipped) também aos tokens históricos do assistente dentro do prefixo reproduzido. As antigas log-probabilidades desses tokens são estimadas por um checkpoint SFT separado, obtido por destilação de política. Com isso, o treinamento do prefixo e o treinamento da continuação se unem em uma única forma de otimização de política.
*Método: Prefix-GRPO, aprendizado por reforço construído sobre o GRPO
*Ideia: a trajetória do professor = um prefixo para replay + uma continuação on-line
*Diferença: atualizações clipped também para os tokens do assistente dentro do prefixo
*Estimativa das antigas log-probabilidades — via um checkpoint SFT policy-distilled
*Ambientes de teste: TextCraft, BabyAI, ALFWorld (3 benchmarks)
O que os experimentos mostraram
Nos três ambientes, o Prefix-GRPO melhorou os agentes em modelos pequenos em comparação tanto com a destilação quanto com os baselines de RL padrão. Uma série separada de experimentos de ablation verificou exatamente o que gera esse ganho: apenas o replay dos prefixos se mostrou insuficiente sem uma otimização explícita dos tokens dentro deles.
Apenas reproduzir os prefixos não é suficiente sem uma otimização
explícita dos tokens dentro do prefixo.
— formulação do resumo (abstract) do estudo no arXiv. Em outras palavras, restaurar o estado intermediário do ambiente não basta por si só — também é preciso atualizar a política sobre os tokens históricos, caso contrário o método não produz seu efeito completo. A implementação e os scripts para reproduzir os resultados, segundo os autores, foram disponibilizados em acesso aberto no GitHub.
O que isso significa
O Prefix-GRPO é uma tentativa de transferir parte da "inteligência" dos grandes modelos professores para modelos compactos sem perder a lógica de comportamento de múltiplas etapas. Se a abordagem escalar para além dos ambientes do tipo jogo, agentes locais baratos poderão resolver tarefas longas visivelmente melhor do que com a destilação convencional.
Perguntas frequentes
O que é o Prefix-GRPO?
É um framework de aprendizado por reforço para modelos de linguagem pequenos que atuam como agentes. Ele divide as trajetórias de um modelo professor em prefixos, as reproduz no ambiente para restaurar o estado intermediário e continua treinando o aluno em interação on-line com uma recompensa pela tarefa.
Em que o Prefix-GRPO se diferencia do GRPO comum?
Ao contrário do GRPO response-only, que atualiza a política apenas com base em respostas novas, o Prefix-GRPO aplica atualizações recortadas também aos tokens históricos do assistente dentro do prefixo reproduzido, estimando suas antigas log-probabilidades por meio de um checkpoint SFT policy-distilled separado.
Onde o método foi testado?
Os autores testaram o Prefix-GRPO em três ambientes para agentes — TextCraft, BabyAI e ALFWorld —, nos quais ele superou a destilação e os baselines de RL padrão. O código e os scripts de reprodução estão disponíveis no GitHub.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.