arXiv cs.CL→ original

SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия

Исследование на arXiv показало: стандартное дообучение SFT повышает точность языковых моделей в играх, но резко сужает разнообразие их ходов — сильнее, чем требует баланс точности и разнообразия. Причина — обучение на единственном оптимальном ходе. Частично спасает action augmentation: обучение сразу на всех оптимальных ходах состояния.

Processado por IA de arXiv cs.CL; editado por Hamidun News
SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, pesquisadores publicaram no arXiv um artigo intitulado «When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play», que mostrou que o ajuste fino padrão (SFT) aumenta a precisão dos modelos de linguagem em jogos, mas ao mesmo tempo reduz drasticamente a diversidade de seus movimentos — mais do que exigiria o equilíbrio entre precisão e diversidade.

O que o estudo mostrou

O artigo do arXiv (categoria cs.CL, identificador 2607.19523) analisou como o supervised fine-tuning afeta a diversidade comportamental dos modelos na tomada de decisões sequenciais. Os autores construíram um conjunto controlado de jogos de tabuleiro determinísticos baseados em variantes do jogo da velha: neles, os movimentos ótimos são calculados com exatidão, o que significa que a diversidade de comportamento pode ser medida diretamente, sem avaliações controversas. A avaliação foi realizada simultaneamente em três níveis — estados individuais do jogo, partidas ao vivo no modo «arena» e trajetórias do próprio treinamento —, o que permitiu observar como a diversidade se degrada justamente durante o processo de ajuste fino, e não apenas no modelo final.

  • Plataforma — arXiv, categoria cs.CL, identificador 2607.19523, tipo de publicação «new»
  • Ambiente de teste — jogos de tabuleiro determinísticos baseados em variantes do jogo da velha
  • Os movimentos ótimos são calculáveis com exatidão, por isso a diversidade é medida diretamente
  • A avaliação foi feita em três níveis: estados individuais, partidas na «arena» e trajetórias de treinamento
  • Método de mitigação — action augmentation, treinamento com todos os movimentos ótimos de um estado

Por que o SFT reduz as opções do modelo?

O SFT padrão provoca um colapso prematuro da diversidade: a política do modelo se reduz a um conjunto estreito de movimentos mais rápido do que justificaria o trade-off «precisão versus diversidade». Segundo o estudo, o modo de raciocínio passo a passo (reasoning-mode) muitas vezes suprime ainda mais a diversidade de movimentos, sem melhorar a precisão de forma uniforme. Um detalhe importante: o modo de raciocínio, geralmente considerado uma forma de melhorar as decisões, aqui atuou contra a diversidade — reduzindo o conjunto de movimentos sem um ganho estável de precisão.

A causa, segundo os autores, é a «imitação de suporte estreito» (narrow-support imitation): o modelo aprende a partir de um único movimento ótimo demonstrado para cada estado e ignora as demais opções igualmente válidas. Como resultado, ele perde não só alternativas, mas também a tendência de explorar o espaço de soluções.

Como mitigar isso

O action augmentation resolve parcialmente o problema — treinar de uma vez com todas as ações ótimas para cada estado, em vez de um único movimento demonstrado. Segundo o resumo, essa técnica preserva o «suporte de ações» (action support) e mantém o comportamento exploratório do modelo sem prejudicar a precisão. Ainda assim, o método não elimina o problema por completo — os autores chamam explicitamente a mitigação de parcial, mas mostram que a própria formulação do treinamento com suporte amplo de ações já melhora o comportamento do modelo.

«Preservar o suporte de ações durante o SFT é importante para manter o

comportamento exploratório», afirma o resumo do estudo publicado no arXiv.

O que isso significa

O trabalho aponta para um custo oculto de um método popular de ajuste fino: ao otimizar um modelo para a precisão, os desenvolvedores podem, sem perceber, tirar dele flexibilidade e tendência a explorar. Para tarefas em que a diversidade de soluções importa — agentes de jogos, planejamento, ações de múltiplas etapas —, os autores recomendam preservar o action support já na etapa de SFT.

Perguntas frequentes

O que é colapso de diversidade em modelos de linguagem?

Colapso de diversidade é a situação em que, após o ajuste fino, um modelo passa a escolher o mesmo conjunto estreito de respostas ou movimentos, perdendo alternativas igualmente válidas. No estudo, isso ocorria com o SFT padrão antes do que exigiria o equilíbrio entre precisão e diversidade.

Como o action augmentation ajuda a preservar a diversidade?

O action augmentation treina o modelo com todos os movimentos ótimos de cada estado, em vez de apenas um demonstrado. Segundo o estudo, isso mitiga parcialmente o colapso de diversidade e preserva o comportamento exploratório do modelo.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…