arXiv cs.AI→ original

S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам

Новый метод S2T-RLHF нацелен на давнюю проблему RLHF — нестабильность обучения. Вместо того чтобы дробить награду до отдельных токенов, он сначала распределяет её по предложениям ответа, а внутри каждого делает лишь ограниченную корректировку. По данным авторов, это повышает стабильность обучения без переобучения reward-модели и сохраняет качество выравнивания под предпочтения.

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
S2T-RLHF: почему в RLHF награда по предложениям стабильнее, чем по токенам
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

Por qué el RLHF es inestable

El RLHF estándar es inestable porque el modelo recibe una única recompensa escalar por toda la respuesta, y esta puntuación luego se "difumina" en las actualizaciones de la política a nivel de tokens individuales. Debido a esto, no queda claro qué parte exacta de la respuesta mereció la puntuación alta o baja: la tarea de asignación de crédito (credit assignment) dentro de la respuesta sigue siendo ambigua.

El modelo de preferencias (preference model), entrenado con comparaciones por pares de respuestas, evalúa la respuesta solo en su conjunto, no palabra por palabra. La señal de preferencia se define únicamente a nivel de toda la respuesta (response level), por lo que su traslado mecánico a tokens individuales introduce ruido adicional y desestabiliza el entrenamiento.

Qué propone S2T-RLHF

S2T-RLHF (sentence-to-token) introduce un nivel intermedio entre toda la respuesta y el token individual: la oración. El método primero descompone la recompensa de toda la respuesta por oraciones, y dentro de cada oración realiza solo un ajuste limitado (bounded) a nivel de tokens. Un detalle importante: para esto no es necesario ni reentrenar el modelo de recompensa (reward model) ni preparar un etiquetado independiente de recompensas a nivel de token.

  • Tres niveles de granularidad: toda la respuesta → oración → token
  • La recompensa primero se divide por oraciones, luego se ajusta de forma limitada a nivel de token
  • No requiere reentrenar el modelo de recompensa
  • No requiere token-level supervision: etiquetado independiente de recompensas por token
  • Verificado en varios conjuntos de datos y distintas configuraciones de optimización

Según los autores, con este enfoque el entrenamiento se vuelve más estable y robusto, mientras que la calidad de la alineación con las preferencias (preference alignment) sigue siendo competitiva; es decir, la estabilidad no se paga con precisión.

Por qué oración y no token

La oración se eligió como escala intermedia porque conserva la integridad semántica y, a la vez, es más resistente al ruido que un token individual. Los autores cuestionan directamente la suposición extendida de que cuanto más fina es la división de la recompensa, mejor funciona la optimización.

«Cuando las señales de preferencia son ruidosas y solo están definidas

a nivel de respuesta, un refinamiento de la recompensa excesivamente granular puede amplificar la incertidumbre y desestabilizar el entrenamiento», se afirma en el artículo de arXiv.

En lugar de perseguir la recompensa más granular posible, los autores formulan un principio granularity-aware: el diseño de la recompensa debe orientarse a la estabilidad y no a la máxima precisión de la distribución. El nivel de oración equilibra la coherencia semántica con la resistencia al ruido a nivel de token.

Qué significa esto

El RLHF sigue siendo la principal forma de ajustar los grandes modelos de lenguaje a las preferencias humanas, pero su inestabilidad es un dolor de cabeza constante para los ingenieros. S2T-RLHF propone una receta económica: no perseguir la recompensa más granular posible, sino elegir una escala intermedia razonable: la oración. Si los resultados se reproducen en otras tareas y modelos, el «nivel de oración» podría consolidarse como la granularidad predeterminada en el entrenamiento por preferencias.

Preguntas frecuentes

¿Qué es el RLHF?

RLHF (reinforcement learning from human feedback) es el aprendizaje por refuerzo a partir de la retroalimentación humana. El modelo se ajusta según las preferencias de las personas: un modelo de recompensa, entrenado con comparaciones de respuestas, genera una recompensa con la que se corrige la política de generación.

¿S2T-RLHF necesita etiquetado adicional?

No. Según la descripción del método, S2T-RLHF funciona sin reentrenar el modelo de recompensa y sin token-level supervision. Esto significa que no se necesita ni un nuevo etiquetado de entrenamiento de recompensas por token ni un entrenamiento aparte del evaluador: el método reutiliza la señal de preferencias ya existente.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…