arXiv cs.CL→ оригинал

SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений

На arXiv вышел препринт SLPO (Surrogate Latent Policy Optimization) — метод, который переносит обучение с подкреплением по итоговой награде на латентные модели рассуждений. У латентных траекторий нет пошаговой вероятности и удобной остановки, поэтому обычный RL к ним не применялся. SLPO закрывает это суррогатной политикой и «головой остановки», поднимая Pass@k.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

В июле 2026 года исследователи опубликовали на arXiv препринт SLPO (Surrogate Latent Policy Optimization) — метод, который переносит обучение с подкреплением по итоговой награде на авторегрессивные латентные модели рассуждений и учит их самостоятельно выбирать длину «мышления».

Что такое латентное рассуждение

Латентное рассуждение (latent reasoning) хранит промежуточные вычисления модели как непрерывные векторы, а не декодирует каждый шаг в текстовый токен. По данным аннотации на arXiv, такой подход уже не уступает, а иногда превосходит явную цепочку рассуждений (Chain-of-Thought, CoT) при заметно более коротких горизонтах вычислений.

Экономия здесь прямая: классический CoT-ризонинг раскручивает мысль токен за токеном, и каждый промежуточный шаг стоит отдельного декодирования. Латентная модель проходит тот же путь во внутреннем пространстве представлений — быстрее и дешевле по вычислениям.

Почему RL не работал с латентными моделями?

Обычный RL с проверяемой наградой (RLVR) не удавалось применить к латентным моделям из-за двух технических барьеров. Явные CoT-ризонеры уже вышли за пределы имитации обучающих данных благодаря наградам по итогу, тогда как латентные модели до сих пор оставались «привязанными к имитации».

Причина, как пишут авторы препринта, в природе латентных траекторий:

  • у них нет вычислимой пошаговой вероятности (per-step likelihood) — не к чему привязать награду по шагам;
  • нет адаптивного интерфейса остановки при фиксированном бюджете «мышления»;
  • из-за этого награда по итогу не запускала масштабирование вычислений на этапе вывода (test-time scaling).

Что предлагает SLPO

SLPO закрывает оба барьера двумя компонентами. Первый — эмпирическая суррогатная плотность политики над латентными переходами: она даёт распределение вероятностей, по которому можно раздать «кредит» за успех на уровне всей траектории. Второй — «голова остановки» (stopping head), обученная на сигнале корректности; оптимизация по итоговой награде превращает её в политику с переменным горизонтом, которая сама решает, когда остановить рассуждение.

Ключевые факты о работе:

  • Метод — SLPO (Surrogate Latent Policy Optimization), препринт arXiv, июль 2026 года.
  • Задача — перенести outcome-reward RL на авторегрессивные латентные модели рассуждений.
  • Компонент 1 — суррогатная плотность политики для назначения награды на уровне траектории.
  • Компонент 2 — stopping head с обучением по корректности → рассуждение переменной длины.
  • Результат — рост Pass@k при параллельном сэмплировании; больше вычислений уходит на сложные примеры.

По данным аннотации, в режимах непрерывного и «мягкого» мышления SLPO повышает метрику Pass@k при параллельном сэмплировании и выделяет более длинные латентные вычисления сложным задачам, попутно поднимая детерминированную точность.

«SLPO улучшает

Pass@k при параллельном сэмплировании и выделяет более длинные латентные вычисления сложным примерам с более высокой детерминированной точностью», — из аннотации препринта на arXiv.

Что это значит

SLPO снимает главное ограничение латентных моделей рассуждений: теперь их можно дообучать наградой по итогу, как это давно делают с текстовой цепочкой рассуждений. Если результат подтвердится на больших моделях, это путь к рассуждающим моделям, которые думают дешевле обычного CoT и сами дозируют глубину рассуждения под сложность задачи.

Частые вопросы

Что такое латентное рассуждение простыми словами?

Это когда модель ведёт промежуточные вычисления во внутреннем векторном пространстве, а не пишет каждый шаг словами. Согласно аннотации на arXiv, такой способ уже сопоставим с явной цепочкой рассуждений (CoT) и при этом требует более коротких горизонтов вычислений.

Чем SLPO отличается от обычного RL для CoT?

Обычный RL с проверяемой наградой опирается на пошаговую вероятность текстовых токенов. У латентных траекторий такой вероятности нет, поэтому SLPO вводит суррогатную плотность политики и обучаемую «голову остановки» — только так награда по итогу начинает работать для латентных моделей.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…