S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам
Новый метод S2T-RLHF нацелен на давнюю проблему RLHF — нестабильность обучения. Вместо того чтобы дробить награду до отдельных токенов, он сначала распределяет её по предложениям ответа, а внутри каждого делает лишь ограниченную корректировку. По данным авторов, это повышает стабильность обучения без переобучения reward-модели и сохраняет качество выравнивания под предпочтения.
Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
Pourquoi le RLHF est instable
Le RLHF standard est instable car le modèle reçoit une seule récompense scalaire pour l'ensemble de la réponse, et cette évaluation est ensuite « diluée » lors des mises à jour de la politique au niveau des tokens individuels. De ce fait, on ne sait pas clairement quelle partie exacte de la réponse a mérité une note élevée ou basse — la tâche d'attribution de mérite (credit assignment) au sein de la réponse reste ambiguë.
Le modèle de préférence (preference model), entraîné sur des comparaisons par paires de réponses, n'évalue la réponse que dans son ensemble, et non mot par mot. Le signal de préférence n'est défini qu'au niveau de la réponse entière (response level), si bien que son transfert mécanique vers des tokens individuels introduit un bruit supplémentaire et déstabilise l'entraînement.
Ce que propose S2T-RLHF
S2T-RLHF (sentence-to-token) introduit un niveau intermédiaire entre la réponse entière et le token individuel — la phrase. La méthode décompose d'abord la récompense de toute la réponse par phrases, puis effectue, à l'intérieur de chaque phrase, un ajustement seulement limité (bounded) au niveau des tokens. Détail important : cela ne nécessite ni de réentraîner le modèle de récompense (reward model), ni de préparer un étiquetage séparé des récompenses au niveau des tokens.
- Trois niveaux de granularité : réponse entière → phrase → token
- La récompense est d'abord répartie par phrases, puis affinée de manière limitée au niveau des tokens
- Ne nécessite pas de réentraîner le modèle de récompense
- Ne nécessite pas de token-level supervision — un étiquetage séparé des récompenses par token
- Testé sur plusieurs jeux de données et différentes configurations d'optimisation
Selon les auteurs, cette approche rend l'entraînement plus stable et plus robuste, tandis que la qualité de l'alignement aux préférences (preference alignment) reste compétitive — autrement dit, la stabilité ne se paie pas en précision.
Pourquoi la phrase, et non le token
La phrase a été choisie comme échelle intermédiaire car elle préserve l'intégrité sémantique tout en étant plus résistante au bruit qu'un token individuel. Les auteurs contestent directement l'hypothèse répandue selon laquelle plus la décomposition de la récompense est fine, meilleure serait l'optimisation.
«
Lorsque les signaux de préférence sont bruités et définis seulement au niveau de la réponse, un raffinement excessivement fin de la récompense peut amplifier l'incertitude et déstabiliser l'entraînement », indique l'article publié sur arXiv.
Plutôt que de rechercher la récompense la plus fine possible, les auteurs formulent un principe granularity-aware : la conception de la récompense doit viser la stabilité, et non la précision maximale de la répartition. Le niveau de la phrase équilibre la cohérence sémantique et la résistance au bruit au niveau des tokens.
Ce que cela signifie
Le RLHF reste le principal moyen d'aligner les grands modèles de langage sur les préférences humaines, mais son instabilité est un casse-tête permanent pour les ingénieurs. S2T-RLHF propose une recette peu coûteuse : ne pas courir après la récompense la plus fine possible, mais choisir une échelle intermédiaire raisonnable — la phrase. Si les résultats se reproduisent sur d'autres tâches et modèles, le « niveau de la phrase » pourrait s'imposer comme la granularité par défaut dans l'entraînement par préférences.
Questions fréquentes
Qu'est-ce que le RLHF ?
Le RLHF (reinforcement learning from human feedback) est l'apprentissage par renforcement à partir du retour humain. Le modèle est affiné selon les préférences des personnes : un modèle de récompense, entraîné sur des comparaisons de réponses, produit une récompense qui sert à corriger la politique de génération.
S2T-RLHF nécessite-t-il un étiquetage supplémentaire ?
Non. Selon la description de la méthode, S2T-RLHF fonctionne sans réentraîner le modèle de récompense et sans token-level supervision. Cela signifie qu'il ne faut ni nouvel étiquetage d'entraînement des récompenses par token, ni entraînement séparé de l'évaluateur — la méthode réutilise le signal de préférence déjà existant.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.