SLPO: метод переносит RL с проверяемой наградой на латентные модели рассуждений
На arXiv вышел препринт SLPO (Surrogate Latent Policy Optimization) — метод, который переносит обучение с подкреплением по итоговой награде на латентные модели рассуждений. У латентных траекторий нет пошаговой вероятности и удобной остановки, поэтому обычный RL к ним не применялся. SLPO закрывает это суррогатной политикой и «головой остановки», поднимая Pass@k.
Processado por IA de arXiv cs.CL; editado por Hamidun News
Em julho de 2026, pesquisadores publicaram no arXiv um preprint do SLPO (Surrogate Latent Policy Optimization) — um método que transfere o aprendizado por reforço com recompensa pelo resultado final para modelos de raciocínio latente autorregressivos e os ensina a escolher sozinhos a duração do "pensamento".
O que é raciocínio latente
O raciocínio latente (latent reasoning) armazena os cálculos intermediários do modelo como vetores contínuos, em vez de decodificar cada etapa em um token de texto. Segundo o resumo publicado no arXiv, essa abordagem já se equipara, e às vezes supera, a cadeia de raciocínio explícita (Chain-of-Thought, CoT), com horizontes de computação visivelmente mais curtos.
A economia aqui é direta: o raciocínio CoT clássico desenrola o pensamento token a token, e cada etapa intermediária custa uma decodificação separada. O modelo latente percorre o mesmo caminho no espaço interno de representações — mais rápido e mais barato em termos computacionais.
Por que o RL não funcionava com modelos latentes?
O RL comum com recompensa verificável (RLVR) não conseguia ser aplicado a modelos latentes por causa de duas barreiras técnicas. Os raciocinadores CoT explícitos já haviam ultrapassado a mera imitação dos dados de treinamento graças às recompensas pelo resultado, enquanto os modelos latentes continuavam "presos à imitação".
O motivo, segundo os autores do preprint, está na natureza das trajetórias latentes:
- elas não têm uma probabilidade calculável passo a passo (per-step likelihood) — não há a que atrelar a recompensa por etapa;
- não existe uma interface adaptativa de parada sob um orçamento fixo de "pensamento";
- por isso, a recompensa pelo resultado não acionava o escalonamento de computação em tempo de inferência (test-time scaling).
O que o SLPO propõe
O SLPO fecha as duas barreiras com dois componentes. O primeiro é uma densidade de política substituta (surrogate) empírica sobre as transições latentes: ela fornece uma distribuição de probabilidades com a qual se pode distribuir "crédito" pelo sucesso no nível de toda a trajetória. O segundo é uma "cabeça de parada" (stopping head), treinada com o sinal de correção; a otimização pela recompensa final a transforma em uma política de horizonte variável, que decide sozinha quando interromper o raciocínio.
Fatos-chave sobre o trabalho:
- Método — SLPO (Surrogate Latent Policy Optimization), preprint no arXiv, julho de 2026.
- Tarefa — transferir o RL com recompensa pelo resultado para modelos de raciocínio latente autorregressivos.
- Componente 1 — densidade de política substituta para atribuir recompensa no nível da trajetória.
- Componente 2 — stopping head treinada por correção → raciocínio de comprimento variável.
- Resultado — aumento do Pass@k com amostragem paralela; mais computação é dedicada aos exemplos difíceis.
Segundo o resumo, nos modos de pensamento contínuo e "suave" o SLPO eleva a métrica Pass@k com amostragem paralela e dedica cálculos latentes mais longos às tarefas difíceis, elevando de quebra a precisão determinística.
"O SLPO melhora o
Pass@k com amostragem paralela e dedica cálculos latentes mais longos a exemplos difíceis, com maior precisão determinística", — do resumo do preprint no arXiv.
O que isso significa
O SLPO remove a principal limitação dos modelos de raciocínio latente: agora eles podem ser ajustados com recompensa pelo resultado final, como já se faz há tempos com a cadeia de raciocínio em texto. Se o resultado se confirmar em modelos maiores, esse é um caminho para modelos de raciocínio que pensam de forma mais barata que o CoT convencional e que dosam sozinhos a profundidade do raciocínio conforme a dificuldade da tarefa.
Perguntas frequentes
O que é raciocínio latente em termos simples?
É quando o modelo realiza os cálculos intermediários em um espaço vetorial interno, em vez de escrever cada etapa em palavras. Segundo o resumo no arXiv, esse método já é comparável à cadeia de raciocínio explícita (CoT) e, ainda assim, exige horizontes de computação mais curtos.
Em que o SLPO se diferencia do RL comum para CoT?
O RL comum com recompensa verificável se apoia na probabilidade passo a passo dos tokens de texto. As trajetórias latentes não têm essa probabilidade, por isso o SLPO introduz uma densidade de política substituta e uma "cabeça de parada" treinável — só assim a recompensa pelo resultado passa a funcionar para os modelos latentes.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.