S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам
Новый метод S2T-RLHF нацелен на давнюю проблему RLHF — нестабильность обучения. Вместо того чтобы дробить награду до отдельных токенов, он сначала распределяет её по предложениям ответа, а внутри каждого делает лишь ограниченную корректировку. По данным авторов, это повышает стабильность обучения без переобучения reward-модели и сохраняет качество выравнивания под предпочтения.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Por que o RLHF é instável
O RLHF padrão é instável porque o modelo recebe uma única recompensa escalar para toda a resposta, e essa avaliação depois é "espalhada" pelas atualizações da política no nível de tokens individuais. Por causa disso, não fica claro qual parte exata da resposta mereceu a avaliação alta ou baixa — a tarefa de atribuição de crédito (credit assignment) dentro da resposta continua ambígua.
O modelo de preferências (preference model), treinado em comparações par a par de respostas, avalia a resposta apenas como um todo, e não palavra por palavra. O sinal de preferência é definido somente no nível da resposta inteira (response level), portanto sua transferência mecânica para tokens individuais introduz ruído adicional e desestabiliza o treinamento.
O que o S2T-RLHF propõe
O S2T-RLHF (sentence-to-token) introduz um nível intermediário entre a resposta inteira e o token individual — a frase. O método primeiro decompõe a recompensa de toda a resposta por frases e, dentro de cada frase, faz apenas um ajuste limitado (bounded) no nível de tokens. Detalhe importante: para isso não é preciso nem retreinar o modelo de recompensa (reward model), nem preparar uma rotulagem separada de recompensas no nível de token.
- Três níveis de granularidade: resposta inteira → frase → token
- A recompensa primeiro é dividida por frases, depois ajustada de forma limitada no nível de token
- Não exige retreinar o modelo de recompensa
- Não exige token-level supervision — rotulagem separada de recompensas por token
- Testado em vários conjuntos de dados e diferentes configurações de otimização
Segundo os autores, com essa abordagem o treinamento se torna mais estável e robusto, enquanto a qualidade do alinhamento às preferências (preference alignment) permanece competitiva — ou seja, não é preciso pagar em precisão pela estabilidade.
Por que frase, e não token
A frase foi escolhida como escala intermediária porque preserva a integridade semântica e, ao mesmo tempo, é mais resistente a ruído do que um token individual. Os autores contestam diretamente a suposição comum de que quanto mais fina a divisão da recompensa, melhor a otimização.
"Quando os sinais de preferência são ruidosos e definidos apenas no
nível da resposta, um refinamento excessivamente granular da recompensa pode amplificar a incerteza e desestabilizar o treinamento", afirma o artigo no arXiv.
Em vez de buscar a recompensa mais granular possível, os autores formulam um princípio granularity-aware: o design da recompensa deve ser voltado para a estabilidade, e não para a máxima precisão da distribuição. O nível de frase equilibra a coerência semântica com a resistência ao ruído no nível de token.
O que isso significa
O RLHF continua sendo a principal forma de ajustar grandes modelos de linguagem às preferências humanas, mas sua instabilidade é uma dor de cabeça constante para os engenheiros. O S2T-RLHF propõe uma receita barata: em vez de buscar a recompensa mais granular possível, escolher uma escala intermediária razoável — a frase. Se os resultados se reproduzirem em outras tarefas e modelos, o "nível de frase" pode se firmar como a granularidade padrão no treinamento por preferências.
Perguntas frequentes
O que é RLHF?
RLHF (reinforcement learning from human feedback) é o aprendizado por reforço a partir de feedback humano. O modelo é ajustado às preferências das pessoas: um modelo de recompensa, treinado em comparações de respostas, gera uma recompensa que serve para corrigir a política de geração.
O S2T-RLHF precisa de rotulagem adicional?
Não. Segundo a descrição do método, o S2T-RLHF funciona sem retreinar o modelo de recompensa e sem token-level supervision. Isso significa que não é necessária nem uma nova rotulagem de treinamento de recompensas por token, nem um treinamento separado do avaliador — o método reutiliza o sinal de preferências já existente.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.