arXiv cs.AI→ original

S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам

Новый метод S2T-RLHF нацелен на давнюю проблему RLHF — нестабильность обучения. Вместо того чтобы дробить награду до отдельных токенов, он сначала распределяет её по предложениям ответа, а внутри каждого делает лишь ограниченную корректировку. По данным авторов, это повышает стабильность обучения без переобучения reward-модели и сохраняет качество выравнивания под предпочтения.

Processado por IA de arXiv cs.AI; editado por Hamidun News
S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Por que o RLHF é instável

O RLHF padrão é instável porque o modelo recebe uma única recompensa escalar para toda a resposta, e essa avaliação depois é "espalhada" pelas atualizações da política no nível de tokens individuais. Por causa disso, não fica claro qual parte exata da resposta mereceu a avaliação alta ou baixa — a tarefa de atribuição de crédito (credit assignment) dentro da resposta continua ambígua.

O modelo de preferências (preference model), treinado em comparações par a par de respostas, avalia a resposta apenas como um todo, e não palavra por palavra. O sinal de preferência é definido somente no nível da resposta inteira (response level), portanto sua transferência mecânica para tokens individuais introduz ruído adicional e desestabiliza o treinamento.

O que o S2T-RLHF propõe

O S2T-RLHF (sentence-to-token) introduz um nível intermediário entre a resposta inteira e o token individual — a frase. O método primeiro decompõe a recompensa de toda a resposta por frases e, dentro de cada frase, faz apenas um ajuste limitado (bounded) no nível de tokens. Detalhe importante: para isso não é preciso nem retreinar o modelo de recompensa (reward model), nem preparar uma rotulagem separada de recompensas no nível de token.

  • Três níveis de granularidade: resposta inteira → frase → token
  • A recompensa primeiro é dividida por frases, depois ajustada de forma limitada no nível de token
  • Não exige retreinar o modelo de recompensa
  • Não exige token-level supervision — rotulagem separada de recompensas por token
  • Testado em vários conjuntos de dados e diferentes configurações de otimização

Segundo os autores, com essa abordagem o treinamento se torna mais estável e robusto, enquanto a qualidade do alinhamento às preferências (preference alignment) permanece competitiva — ou seja, não é preciso pagar em precisão pela estabilidade.

Por que frase, e não token

A frase foi escolhida como escala intermediária porque preserva a integridade semântica e, ao mesmo tempo, é mais resistente a ruído do que um token individual. Os autores contestam diretamente a suposição comum de que quanto mais fina a divisão da recompensa, melhor a otimização.

"Quando os sinais de preferência são ruidosos e definidos apenas no

nível da resposta, um refinamento excessivamente granular da recompensa pode amplificar a incerteza e desestabilizar o treinamento", afirma o artigo no arXiv.

Em vez de buscar a recompensa mais granular possível, os autores formulam um princípio granularity-aware: o design da recompensa deve ser voltado para a estabilidade, e não para a máxima precisão da distribuição. O nível de frase equilibra a coerência semântica com a resistência ao ruído no nível de token.

O que isso significa

O RLHF continua sendo a principal forma de ajustar grandes modelos de linguagem às preferências humanas, mas sua instabilidade é uma dor de cabeça constante para os engenheiros. O S2T-RLHF propõe uma receita barata: em vez de buscar a recompensa mais granular possível, escolher uma escala intermediária razoável — a frase. Se os resultados se reproduzirem em outras tarefas e modelos, o "nível de frase" pode se firmar como a granularidade padrão no treinamento por preferências.

Perguntas frequentes

O que é RLHF?

RLHF (reinforcement learning from human feedback) é o aprendizado por reforço a partir de feedback humano. O modelo é ajustado às preferências das pessoas: um modelo de recompensa, treinado em comparações de respostas, gera uma recompensa que serve para corrigir a política de geração.

O S2T-RLHF precisa de rotulagem adicional?

Não. Segundo a descrição do método, o S2T-RLHF funciona sem retreinar o modelo de recompensa e sem token-level supervision. Isso significa que não é necessária nem uma nova rotulagem de treinamento de recompensas por token, nem um treinamento separado do avaliador — o método reutiliza o sinal de preferências já existente.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…