SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия
Исследование на arXiv показало: стандартное дообучение SFT повышает точность языковых моделей в играх, но резко сужает разнообразие их ходов — сильнее, чем требует баланс точности и разнообразия. Причина — обучение на единственном оптимальном ходе. Частично спасает action augmentation: обучение сразу на всех оптимальных ходах состояния.
Processado por IA de arXiv cs.CL; editado por Hamidun News
Em julho de 2026, pesquisadores publicaram no arXiv um artigo intitulado «When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play», que mostrou que o ajuste fino padrão (SFT) aumenta a precisão dos modelos de linguagem em jogos, mas ao mesmo tempo reduz drasticamente a diversidade de seus movimentos — mais do que exigiria o equilíbrio entre precisão e diversidade.
O que o estudo mostrou
O artigo do arXiv (categoria cs.CL, identificador 2607.19523) analisou como o supervised fine-tuning afeta a diversidade comportamental dos modelos na tomada de decisões sequenciais. Os autores construíram um conjunto controlado de jogos de tabuleiro determinísticos baseados em variantes do jogo da velha: neles, os movimentos ótimos são calculados com exatidão, o que significa que a diversidade de comportamento pode ser medida diretamente, sem avaliações controversas. A avaliação foi realizada simultaneamente em três níveis — estados individuais do jogo, partidas ao vivo no modo «arena» e trajetórias do próprio treinamento —, o que permitiu observar como a diversidade se degrada justamente durante o processo de ajuste fino, e não apenas no modelo final.
- Plataforma — arXiv, categoria cs.CL, identificador 2607.19523, tipo de publicação «new»
- Ambiente de teste — jogos de tabuleiro determinísticos baseados em variantes do jogo da velha
- Os movimentos ótimos são calculáveis com exatidão, por isso a diversidade é medida diretamente
- A avaliação foi feita em três níveis: estados individuais, partidas na «arena» e trajetórias de treinamento
- Método de mitigação — action augmentation, treinamento com todos os movimentos ótimos de um estado
Por que o SFT reduz as opções do modelo?
O SFT padrão provoca um colapso prematuro da diversidade: a política do modelo se reduz a um conjunto estreito de movimentos mais rápido do que justificaria o trade-off «precisão versus diversidade». Segundo o estudo, o modo de raciocínio passo a passo (reasoning-mode) muitas vezes suprime ainda mais a diversidade de movimentos, sem melhorar a precisão de forma uniforme. Um detalhe importante: o modo de raciocínio, geralmente considerado uma forma de melhorar as decisões, aqui atuou contra a diversidade — reduzindo o conjunto de movimentos sem um ganho estável de precisão.
A causa, segundo os autores, é a «imitação de suporte estreito» (narrow-support imitation): o modelo aprende a partir de um único movimento ótimo demonstrado para cada estado e ignora as demais opções igualmente válidas. Como resultado, ele perde não só alternativas, mas também a tendência de explorar o espaço de soluções.
Como mitigar isso
O action augmentation resolve parcialmente o problema — treinar de uma vez com todas as ações ótimas para cada estado, em vez de um único movimento demonstrado. Segundo o resumo, essa técnica preserva o «suporte de ações» (action support) e mantém o comportamento exploratório do modelo sem prejudicar a precisão. Ainda assim, o método não elimina o problema por completo — os autores chamam explicitamente a mitigação de parcial, mas mostram que a própria formulação do treinamento com suporte amplo de ações já melhora o comportamento do modelo.
«Preservar o suporte de ações durante o SFT é importante para manter o
comportamento exploratório», afirma o resumo do estudo publicado no arXiv.
O que isso significa
O trabalho aponta para um custo oculto de um método popular de ajuste fino: ao otimizar um modelo para a precisão, os desenvolvedores podem, sem perceber, tirar dele flexibilidade e tendência a explorar. Para tarefas em que a diversidade de soluções importa — agentes de jogos, planejamento, ações de múltiplas etapas —, os autores recomendam preservar o action support já na etapa de SFT.
Perguntas frequentes
O que é colapso de diversidade em modelos de linguagem?
Colapso de diversidade é a situação em que, após o ajuste fino, um modelo passa a escolher o mesmo conjunto estreito de respostas ou movimentos, perdendo alternativas igualmente válidas. No estudo, isso ocorria com o SFT padrão antes do que exigiria o equilíbrio entre precisão e diversidade.
Como o action augmentation ajuda a preservar a diversidade?
O action augmentation treina o modelo com todos os movimentos ótimos de cada estado, em vez de apenas um demonstrado. Segundo o estudo, isso mitiga parcialmente o colapso de diversidade e preserva o comportamento exploratório do modelo.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.