arXiv cs.CL→ original

SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений

На arXiv вышел препринт SLPO (Surrogate Latent Policy Optimization) — метод, который переносит обучение с подкреплением по итоговой награде на латентные модели рассуждений. У латентных траекторий нет пошаговой вероятности и удобной остановки, поэтому обычный RL к ним не применялся. SLPO закрывает это суррогатной политикой и «головой остановки», поднимая Pass@k.

Procesado por IA desde arXiv cs.CL; editado por Hamidun News
SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений
Fuente: arXiv cs.CL. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026, unos investigadores publicaron en arXiv un preprint de SLPO (Surrogate Latent Policy Optimization) — un método que traslada el aprendizaje por refuerzo con recompensa por resultado final a modelos de razonamiento latente autorregresivos y les enseña a elegir por sí mismos la duración de su "pensamiento".

Qué es el razonamiento latente

El razonamiento latente (latent reasoning) almacena los cálculos intermedios del modelo como vectores continuos, en lugar de decodificar cada paso en un token de texto. Según el resumen publicado en arXiv, este enfoque ya iguala, y a veces supera, a la cadena de razonamiento explícita (Chain-of-Thought, CoT) con horizontes de cómputo notablemente más cortos.

El ahorro aquí es directo: el razonamiento CoT clásico despliega el pensamiento token a token, y cada paso intermedio cuesta una decodificación aparte. El modelo latente recorre el mismo camino en el espacio interno de representaciones — más rápido y más barato en términos de cómputo.

¿Por qué el RL no funcionaba con modelos latentes?

El RL habitual con recompensa verificable (RLVR) no se podía aplicar a los modelos latentes debido a dos barreras técnicas. Los razonadores CoT explícitos ya habían superado la mera imitación de los datos de entrenamiento gracias a las recompensas por resultado, mientras que los modelos latentes seguían "atados a la imitación".

La razón, según escriben los autores del preprint, está en la naturaleza de las trayectorias latentes:

  • no tienen una probabilidad calculable paso a paso (per-step likelihood) — no hay a qué anclar la recompensa por pasos;
  • no existe una interfaz adaptativa de parada bajo un presupuesto fijo de "pensamiento";
  • por eso, la recompensa por resultado no activaba el escalado de cómputo en tiempo de inferencia (test-time scaling).

Qué propone SLPO

SLPO cierra ambas barreras con dos componentes. El primero es una densidad de política sustituta (surrogate) empírica sobre las transiciones latentes: proporciona una distribución de probabilidades con la que se puede repartir el "crédito" por el éxito a nivel de toda la trayectoria. El segundo es una "cabeza de parada" (stopping head), entrenada con la señal de corrección; al optimizar según la recompensa final, esta se convierte en una política de horizonte variable que decide por sí misma cuándo detener el razonamiento.

Datos clave del trabajo:

  • Método — SLPO (Surrogate Latent Policy Optimization), preprint de arXiv, julio de 2026.
  • Objetivo — trasladar el RL con recompensa por resultado a modelos de razonamiento latente autorregresivos.
  • Componente 1 — densidad de política sustituta para asignar la recompensa a nivel de trayectoria.
  • Componente 2 — stopping head entrenada por corrección → razonamiento de longitud variable.
  • Resultado — aumento del Pass@k con muestreo paralelo; más cómputo se destina a los ejemplos difíciles.

Según el resumen, en los modos de pensamiento continuo y "suave" SLPO eleva la métrica Pass@k con muestreo paralelo y destina cálculos latentes más largos a las tareas difíciles, elevando de paso la precisión determinista.

«SLPO mejora el

Pass@k con muestreo paralelo y destina cálculos latentes más largos a los ejemplos difíciles con una precisión determinista más alta», — del resumen del preprint en arXiv.

Qué significa esto

SLPO elimina la principal limitación de los modelos de razonamiento latente: ahora se los puede reentrenar con recompensa por resultado final, tal como se lleva haciendo desde hace tiempo con la cadena de razonamiento en texto. Si el resultado se confirma en modelos más grandes, este es un camino hacia modelos de razonamiento que piensan más barato que el CoT habitual y que dosifican por sí mismos la profundidad del razonamiento según la dificultad de la tarea.

Preguntas frecuentes

¿Qué es el razonamiento latente en palabras simples?

Es cuando el modelo realiza los cálculos intermedios en un espacio vectorial interno, en lugar de escribir cada paso con palabras. Según el resumen en arXiv, este método ya es comparable a la cadena de razonamiento explícita (CoT) y, además, requiere horizontes de cómputo más cortos.

¿En qué se diferencia SLPO del RL habitual para CoT?

El RL habitual con recompensa verificable se apoya en la probabilidad paso a paso de los tokens de texto. Las trayectorias latentes no tienen esa probabilidad, por eso SLPO introduce una densidad de política sustituta y una "cabeza de parada" entrenable — solo así la recompensa por resultado empieza a funcionar para los modelos latentes.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…