arXiv cs.LG→ original

Prefix-GRPO: метод обучения малых языковых моделей-агентов на префиксах траекторий

Исследователи представили Prefix-GRPO — метод обучения с подкреплением для малых языковых моделей-агентов. Вместо того чтобы копировать поведение сильной модели-учителя одним махом, он разбивает её траектории на префиксы, воспроизводит их в среде для восстановления промежуточного состояния и дообучает модель онлайн с наградой за задачу. На трёх средах — TextCraft, BabyAI и ALFWorld — подход обошёл и классическую дистилляцию, и стандартный RL.

Processado por IA de arXiv cs.LG; editado por Hamidun News
Prefix-GRPO: метод обучения малых языковых моделей-агентов на префиксах траекторий
Fonte: arXiv cs.LG. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores propuseram o Prefix-GRPO — um método de aprendizado por reforço publicado no arXiv (cs.LG) em julho de 2026. Ele ajuda modelos de linguagem pequenos que atuam como agentes a aprender com as trajetórias de um modelo professor forte, sem transformá-las em uma imitação de uso único, e em três ambientes — TextCraft, BabyAI e ALFWorld — supera tanto a destilação clássica quanto o RL padrão.

Por que a destilação emperra em tarefas longas

A destilação direta reduz o comportamento rico e de múltiplas etapas do professor a metas de uma única etapa para imitação — e isso é ineficiente nos casos em que decisões iniciais determinam estados e recompensas futuras. Modelos pequenos são atraentes como base para agentes interativos: são baratos e rápidos. Mas quando um agente precisa percorrer uma longa cadeia de ações (pegar um item, chegar ao objetivo, executar uma instrução), o treinamento do tipo "repita a resposta do professor" perde a estrutura causal: o modelo memoriza as falas finais, mas não entende como o professor chegou ao estado necessário.

Como funciona o Prefix-GRPO

O Prefix-GRPO divide cada trajetória do professor em dois componentes: replay-aligned prefix queries (prefixos para reprodução) e online continuations (continuações on-line). Cada prefixo é reproduzido novamente no ambiente para restaurar um estado intermediário válido, após o que o aluno continua a interação por conta própria e recebe a recompensa pela tarefa.

A principal diferença em relação ao GRPO response-only é que o método aplica atualizações de política recortadas (clipped) também aos tokens históricos do assistente dentro do prefixo reproduzido. As antigas log-probabilidades desses tokens são estimadas por um checkpoint SFT separado, obtido por destilação de política. Com isso, o treinamento do prefixo e o treinamento da continuação se unem em uma única forma de otimização de política.

*Método: Prefix-GRPO, aprendizado por reforço construído sobre o GRPO

*Ideia: a trajetória do professor = um prefixo para replay + uma continuação on-line

*Diferença: atualizações clipped também para os tokens do assistente dentro do prefixo

*Estimativa das antigas log-probabilidades — via um checkpoint SFT policy-distilled

*Ambientes de teste: TextCraft, BabyAI, ALFWorld (3 benchmarks)

O que os experimentos mostraram

Nos três ambientes, o Prefix-GRPO melhorou os agentes em modelos pequenos em comparação tanto com a destilação quanto com os baselines de RL padrão. Uma série separada de experimentos de ablation verificou exatamente o que gera esse ganho: apenas o replay dos prefixos se mostrou insuficiente sem uma otimização explícita dos tokens dentro deles.

Apenas reproduzir os prefixos não é suficiente sem uma otimização

explícita dos tokens dentro do prefixo.

— formulação do resumo (abstract) do estudo no arXiv. Em outras palavras, restaurar o estado intermediário do ambiente não basta por si só — também é preciso atualizar a política sobre os tokens históricos, caso contrário o método não produz seu efeito completo. A implementação e os scripts para reproduzir os resultados, segundo os autores, foram disponibilizados em acesso aberto no GitHub.

O que isso significa

O Prefix-GRPO é uma tentativa de transferir parte da "inteligência" dos grandes modelos professores para modelos compactos sem perder a lógica de comportamento de múltiplas etapas. Se a abordagem escalar para além dos ambientes do tipo jogo, agentes locais baratos poderão resolver tarefas longas visivelmente melhor do que com a destilação convencional.

Perguntas frequentes

O que é o Prefix-GRPO?

É um framework de aprendizado por reforço para modelos de linguagem pequenos que atuam como agentes. Ele divide as trajetórias de um modelo professor em prefixos, as reproduz no ambiente para restaurar o estado intermediário e continua treinando o aluno em interação on-line com uma recompensa pela tarefa.

Em que o Prefix-GRPO se diferencia do GRPO comum?

Ao contrário do GRPO response-only, que atualiza a política apenas com base em respostas novas, o Prefix-GRPO aplica atualizações recortadas também aos tokens históricos do assistente dentro do prefixo reproduzido, estimando suas antigas log-probabilidades por meio de um checkpoint SFT policy-distilled separado.

Onde o método foi testado?

Os autores testaram o Prefix-GRPO em três ambientes para agentes — TextCraft, BabyAI e ALFWorld —, nos quais ele superou a destilação e os baselines de RL padrão. O código e os scripts de reprodução estão disponíveis no GitHub.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…