arXiv cs.CL→ original

SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия

Исследование на arXiv показало: стандартное дообучение SFT повышает точность языковых моделей в играх, но резко сужает разнообразие их ходов — сильнее, чем требует баланс точности и разнообразия. Причина — обучение на единственном оптимальном ходе. Частично спасает action augmentation: обучение сразу на всех оптимальных ходах состояния.

Procesado por IA desde arXiv cs.CL; editado por Hamidun News
SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия
Fuente: arXiv cs.CL. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026, los investigadores publicaron en arXiv un artículo titulado «When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play», que demostró que el ajuste fino estándar (SFT) mejora la precisión de los modelos de lenguaje en los juegos, pero al mismo tiempo reduce drásticamente la diversidad de sus movimientos, más de lo que exigiría el equilibrio entre precisión y diversidad.

Qué mostró el estudio

El artículo de arXiv (categoría cs.CL, identificador 2607.19523) examinó cómo el supervised fine-tuning afecta la diversidad conductual de los modelos en la toma de decisiones secuenciales. Los autores construyeron un conjunto controlado de juegos de mesa deterministas basados en variantes del tres en raya: en ellos, los movimientos óptimos se calculan con exactitud, por lo que la diversidad de comportamiento puede medirse directamente, sin evaluaciones discutibles. La evaluación se realizó simultáneamente en tres niveles — estados individuales del juego, partidas en vivo en modo «arena» y trayectorias del propio entrenamiento —, lo que permitió observar cómo la diversidad se degrada precisamente durante el proceso de ajuste fino, y no solo en el modelo final.

  • Plataforma — arXiv, categoría cs.CL, identificador 2607.19523, tipo de publicación «new»
  • Entorno de prueba — juegos de mesa deterministas basados en variantes del tres en raya
  • Los movimientos óptimos son calculables con exactitud, por lo que la diversidad se mide directamente
  • La evaluación se realizó en tres niveles: estados individuales, partidas en «arena» y trayectorias de entrenamiento
  • Método de mitigación — action augmentation, entrenamiento con todos los movimientos óptimos de un estado

¿Por qué el SFT reduce las opciones del modelo?

El SFT estándar provoca un colapso prematuro de la diversidad: la política del modelo se colapsa hacia un conjunto reducido de movimientos más rápido de lo que justifica el compromiso «precisión frente a diversidad». Según el estudio, el modo de razonamiento paso a paso (reasoning-mode) a menudo suprime aún más la diversidad de movimientos, sin mejorar la precisión de manera uniforme. Un matiz importante: el modo de razonamiento, que habitualmente se considera una forma de mejorar las decisiones, aquí actuó en contra de la diversidad, reduciendo el conjunto de movimientos sin una ganancia estable de precisión.

La causa, según los autores, es la «imitación de soporte estrecho» (narrow-support imitation): el modelo aprende a partir de un único movimiento óptimo demostrado para cada estado e ignora las demás opciones igualmente válidas. Como resultado, pierde no solo alternativas, sino también la tendencia a explorar el espacio de soluciones.

Cómo mitigarlo

El action augmentation resuelve parcialmente el problema: entrenar de una vez con todas las acciones óptimas para cada estado en lugar de un único movimiento demostrado. Según el resumen, esta técnica preserva el «soporte de acciones» (action support) y mantiene el comportamiento exploratorio del modelo sin dañar la precisión. Sin embargo, el método no elimina el problema por completo: los autores llaman explícitamente parcial a esta mitigación, pero muestran que el mero planteamiento de entrenar sobre un soporte de acciones amplio ya mejora el comportamiento del modelo.

«Preservar el soporte de acciones durante el SFT es importante para

mantener el comportamiento exploratorio», se afirma en el resumen del estudio publicado en arXiv.

Qué significa esto

El trabajo señala un costo oculto de un método de ajuste fino popular: al optimizar un modelo para la precisión, los desarrolladores pueden despojarlo, sin darse cuenta, de flexibilidad y tendencia a explorar. Para tareas donde la diversidad de soluciones importa —agentes de juego, planificación, acciones de varios pasos—, los autores recomiendan preservar el action support ya desde la etapa de SFT.

Preguntas frecuentes

¿Qué es el colapso de diversidad en los modelos de lenguaje?

El colapso de diversidad es una situación en la que, tras el ajuste fino, un modelo empieza a elegir el mismo conjunto reducido de respuestas o movimientos, perdiendo alternativas igualmente válidas. En el estudio, este se producía con el SFT estándar antes de lo que exigiría el equilibrio entre precisión y diversidad.

¿Cómo ayuda el action augmentation a preservar la diversidad?

El action augmentation entrena al modelo con todos los movimientos óptimos de cada estado, en lugar de con uno solo demostrado. Según el estudio, esto mitiga parcialmente el colapso de diversidad y preserva el comportamiento exploratorio del modelo.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…