arXiv cs.CL→ original

SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений

На arXiv вышел препринт SLPO (Surrogate Latent Policy Optimization) — метод, который переносит обучение с подкреплением по итоговой награде на латентные модели рассуждений. У латентных траекторий нет пошаговой вероятности и удобной остановки, поэтому обычный RL к ним не применялся. SLPO закрывает это суррогатной политикой и «головой остановки», поднимая Pass@k.

Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений
Source : arXiv cs.CL. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, des chercheurs ont publié sur arXiv un preprint sur SLPO (Surrogate Latent Policy Optimization) — une méthode qui transpose l'apprentissage par renforcement à récompense finale vers des modèles de raisonnement latent autorégressifs et leur apprend à choisir eux-mêmes la durée de leur « réflexion ».

Qu'est-ce que le raisonnement latent

Le raisonnement latent (latent reasoning) stocke les calculs intermédiaires du modèle sous forme de vecteurs continus, au lieu de décoder chaque étape en un token de texte. Selon le résumé publié sur arXiv, cette approche égale déjà, et parfois dépasse, la chaîne de raisonnement explicite (Chain-of-Thought, CoT), avec des horizons de calcul nettement plus courts.

L'économie est ici directe : le raisonnement CoT classique déroule la pensée token par token, et chaque étape intermédiaire coûte un décodage séparé. Le modèle latent parcourt le même chemin dans l'espace interne de représentations — plus rapide et moins coûteux en calcul.

Pourquoi le RL ne fonctionnait-il pas avec les modèles latents ?

Le RL classique à récompense vérifiable (RLVR) ne pouvait pas être appliqué aux modèles latents à cause de deux obstacles techniques. Les raisonneurs CoT explicites étaient déjà allés au-delà de la simple imitation des données d'entraînement grâce aux récompenses fondées sur le résultat, alors que les modèles latents restaient jusqu'ici « prisonniers de l'imitation ».

La raison, selon les auteurs du preprint, tient à la nature des trajectoires latentes :

  • elles n'ont pas de vraisemblance calculable étape par étape (per-step likelihood) — rien à quoi rattacher une récompense par étape ;
  • il n'existe pas d'interface d'arrêt adaptative pour un budget de « réflexion » fixe ;
  • de ce fait, la récompense finale ne déclenchait pas la montée en puissance du calcul au moment de l'inférence (test-time scaling).

Ce que propose SLPO

SLPO lève ces deux obstacles grâce à deux composants. Le premier est une densité de politique de substitution (surrogate) empirique sur les transitions latentes : elle fournit une distribution de probabilités permettant de répartir le « crédit » du succès à l'échelle de toute la trajectoire. Le second est une « tête d'arrêt » (stopping head), entraînée sur le signal de correction ; l'optimisation selon la récompense finale la transforme en une politique à horizon variable, qui décide elle-même du moment où arrêter le raisonnement.

Faits clés sur ces travaux :

  • Méthode — SLPO (Surrogate Latent Policy Optimization), preprint arXiv, juillet 2026.
  • Objectif — transposer le RL à récompense finale vers des modèles de raisonnement latent autorégressifs.
  • Composant 1 — densité de politique de substitution pour attribuer la récompense à l'échelle de la trajectoire.
  • Composant 2 — stopping head entraînée sur la correction → raisonnement de longueur variable.
  • Résultat — hausse du Pass@k en échantillonnage parallèle ; davantage de calcul consacré aux exemples difficiles.

Selon le résumé, en modes de pensée continue et « douce », SLPO augmente la métrique Pass@k en échantillonnage parallèle et consacre des calculs latents plus longs aux tâches difficiles, tout en augmentant la précision déterministe.

« SLPO améliore le

Pass@k en échantillonnage parallèle et consacre des calculs latents plus longs aux exemples difficiles, avec une précision déterministe plus élevée », — extrait du résumé du preprint sur arXiv.

Ce que cela signifie

SLPO lève la principale limite des modèles de raisonnement latent : on peut désormais les affiner avec une récompense finale, comme cela se fait depuis longtemps pour la chaîne de raisonnement textuelle. Si le résultat se confirme sur des modèles plus grands, cela ouvre la voie à des modèles de raisonnement qui pensent moins cher qu'un CoT classique et qui dosent eux-mêmes la profondeur de leur raisonnement selon la difficulté de la tâche.

Questions fréquentes

Qu'est-ce que le raisonnement latent, en termes simples ?

C'est le fait qu'un modèle effectue ses calculs intermédiaires dans un espace vectoriel interne, au lieu d'écrire chaque étape en mots. Selon le résumé publié sur arXiv, cette méthode est déjà comparable à la chaîne de raisonnement explicite (CoT), tout en exigeant des horizons de calcul plus courts.

En quoi SLPO diffère-t-il du RL classique pour le CoT ?

Le RL classique à récompense vérifiable s'appuie sur la vraisemblance étape par étape des tokens de texte. Les trajectoires latentes n'ont pas une telle vraisemblance, c'est pourquoi SLPO introduit une densité de politique de substitution et une « tête d'arrêt » entraînable — c'est seulement ainsi que la récompense finale se met à fonctionner pour les modèles latents.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…