arXiv cs.CL→ original

SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений

На arXiv вышел препринт SLPO (Surrogate Latent Policy Optimization) — метод, который переносит обучение с подкреплением по итоговой награде на латентные модели рассуждений. У латентных траекторий нет пошаговой вероятности и удобной остановки, поэтому обычный RL к ним не применялся. SLPO закрывает это суррогатной политикой и «головой остановки», поднимая Pass@k.

Processado por IA de arXiv cs.CL; editado por Hamidun News
SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, pesquisadores publicaram no arXiv um preprint do SLPO (Surrogate Latent Policy Optimization) — um método que transfere o aprendizado por reforço com recompensa pelo resultado final para modelos de raciocínio latente autorregressivos e os ensina a escolher sozinhos a duração do "pensamento".

O que é raciocínio latente

O raciocínio latente (latent reasoning) armazena os cálculos intermediários do modelo como vetores contínuos, em vez de decodificar cada etapa em um token de texto. Segundo o resumo publicado no arXiv, essa abordagem já se equipara, e às vezes supera, a cadeia de raciocínio explícita (Chain-of-Thought, CoT), com horizontes de computação visivelmente mais curtos.

A economia aqui é direta: o raciocínio CoT clássico desenrola o pensamento token a token, e cada etapa intermediária custa uma decodificação separada. O modelo latente percorre o mesmo caminho no espaço interno de representações — mais rápido e mais barato em termos computacionais.

Por que o RL não funcionava com modelos latentes?

O RL comum com recompensa verificável (RLVR) não conseguia ser aplicado a modelos latentes por causa de duas barreiras técnicas. Os raciocinadores CoT explícitos já haviam ultrapassado a mera imitação dos dados de treinamento graças às recompensas pelo resultado, enquanto os modelos latentes continuavam "presos à imitação".

O motivo, segundo os autores do preprint, está na natureza das trajetórias latentes:

  • elas não têm uma probabilidade calculável passo a passo (per-step likelihood) — não há a que atrelar a recompensa por etapa;
  • não existe uma interface adaptativa de parada sob um orçamento fixo de "pensamento";
  • por isso, a recompensa pelo resultado não acionava o escalonamento de computação em tempo de inferência (test-time scaling).

O que o SLPO propõe

O SLPO fecha as duas barreiras com dois componentes. O primeiro é uma densidade de política substituta (surrogate) empírica sobre as transições latentes: ela fornece uma distribuição de probabilidades com a qual se pode distribuir "crédito" pelo sucesso no nível de toda a trajetória. O segundo é uma "cabeça de parada" (stopping head), treinada com o sinal de correção; a otimização pela recompensa final a transforma em uma política de horizonte variável, que decide sozinha quando interromper o raciocínio.

Fatos-chave sobre o trabalho:

  • Método — SLPO (Surrogate Latent Policy Optimization), preprint no arXiv, julho de 2026.
  • Tarefa — transferir o RL com recompensa pelo resultado para modelos de raciocínio latente autorregressivos.
  • Componente 1 — densidade de política substituta para atribuir recompensa no nível da trajetória.
  • Componente 2 — stopping head treinada por correção → raciocínio de comprimento variável.
  • Resultado — aumento do Pass@k com amostragem paralela; mais computação é dedicada aos exemplos difíceis.

Segundo o resumo, nos modos de pensamento contínuo e "suave" o SLPO eleva a métrica Pass@k com amostragem paralela e dedica cálculos latentes mais longos às tarefas difíceis, elevando de quebra a precisão determinística.

"O SLPO melhora o

Pass@k com amostragem paralela e dedica cálculos latentes mais longos a exemplos difíceis, com maior precisão determinística", — do resumo do preprint no arXiv.

O que isso significa

O SLPO remove a principal limitação dos modelos de raciocínio latente: agora eles podem ser ajustados com recompensa pelo resultado final, como já se faz há tempos com a cadeia de raciocínio em texto. Se o resultado se confirmar em modelos maiores, esse é um caminho para modelos de raciocínio que pensam de forma mais barata que o CoT convencional e que dosam sozinhos a profundidade do raciocínio conforme a dificuldade da tarefa.

Perguntas frequentes

O que é raciocínio latente em termos simples?

É quando o modelo realiza os cálculos intermediários em um espaço vetorial interno, em vez de escrever cada etapa em palavras. Segundo o resumo no arXiv, esse método já é comparável à cadeia de raciocínio explícita (CoT) e, ainda assim, exige horizontes de computação mais curtos.

Em que o SLPO se diferencia do RL comum para CoT?

O RL comum com recompensa verificável se apoia na probabilidade passo a passo dos tokens de texto. As trajetórias latentes não têm essa probabilidade, por isso o SLPO introduz uma densidade de política substituta e uma "cabeça de parada" treinável — só assim a recompensa pelo resultado passa a funcionar para os modelos latentes.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…