arXiv cs.CL→ original

SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия

Исследование на arXiv показало: стандартное дообучение SFT повышает точность языковых моделей в играх, но резко сужает разнообразие их ходов — сильнее, чем требует баланс точности и разнообразия. Причина — обучение на единственном оптимальном ходе. Частично спасает action augmentation: обучение сразу на всех оптимальных ходах состояния.

Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
SFT-дообучение сужает поведение ИИ: исследование arXiv о коллапсе разнообразия
Source : arXiv cs.CL. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, des chercheurs ont publié sur arXiv un article intitulé « When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play », qui a montré que l'affinage standard (SFT) améliore la précision des modèles de langage dans les jeux, mais réduit en même temps fortement la diversité de leurs coups — davantage que ne l'exigerait le compromis entre précision et diversité.

Ce que montre l'étude

L'article publié sur arXiv (catégorie cs.CL, identifiant 2607.19523) a étudié comment le supervised fine-tuning affecte la diversité comportementale des modèles dans la prise de décision séquentielle. Les auteurs ont construit un ensemble contrôlé de jeux de plateau déterministes basés sur des variantes du morpion : les coups optimaux y sont calculés avec exactitude, ce qui permet de mesurer directement la diversité du comportement, sans évaluations contestables. L'évaluation a été menée simultanément à trois niveaux — états individuels du jeu, parties en direct en mode « arène » et trajectoires de l'entraînement lui-même —, ce qui a permis d'observer comment la diversité se dégrade précisément pendant le processus d'affinage, et pas seulement dans le modèle final.

  • Plateforme — arXiv, catégorie cs.CL, identifiant 2607.19523, type de publication « new »
  • Environnement de test — jeux de plateau déterministes basés sur des variantes du morpion
  • Les coups optimaux sont calculables avec exactitude, ce qui permet de mesurer directement la diversité
  • L'évaluation a été menée à trois niveaux : états individuels, parties en « arène » et trajectoires d'entraînement
  • Méthode d'atténuation — action augmentation, entraînement sur tous les coups optimaux d'un état

Pourquoi le SFT réduit-il les choix du modèle ?

Le SFT standard provoque un effondrement prématuré de la diversité : la politique du modèle se réduit à un ensemble restreint de coups plus vite que ne le justifie le compromis « précision contre diversité ». Selon l'étude, le mode de raisonnement pas à pas (reasoning-mode) réduit souvent encore davantage la diversité des coups, sans améliorer la précision de manière uniforme. Un point important : le mode de raisonnement, généralement considéré comme un moyen d'améliorer les décisions, a ici joué contre la diversité — en réduisant l'ensemble des coups sans gain stable de précision.

La cause, selon les auteurs, est l'« imitation à support étroit » (narrow-support imitation) : le modèle apprend à partir d'un seul coup optimal démontré pour chaque état et ignore les autres options tout aussi valables. Il perd ainsi non seulement des alternatives, mais aussi la tendance à explorer l'espace des solutions.

Comment atténuer cela

L'action augmentation résout partiellement le problème — un entraînement portant à la fois sur toutes les actions optimales de chaque état, plutôt que sur un seul coup démontré. Selon le résumé, cette technique préserve le « support d'actions » (action support) et maintient le comportement exploratoire du modèle sans nuire à la précision. Cependant, la méthode n'élimine pas complètement le problème — les auteurs qualifient explicitement cette atténuation de partielle, mais montrent que le simple fait d'entraîner sur un support d'actions large change déjà le comportement du modèle pour le mieux.

«

Préserver le support d'actions pendant le SFT est important pour maintenir le comportement exploratoire », indique le résumé de l'étude publiée sur arXiv.

Ce que cela signifie

L'étude met en évidence un coût caché d'une méthode d'affinage populaire : en optimisant un modèle pour la précision, les développeurs peuvent, sans s'en rendre compte, le priver de flexibilité et de tendance à l'exploration. Pour les tâches où la diversité des solutions compte — agents de jeu, planification, actions à plusieurs étapes —, les auteurs recommandent de préserver l'action support dès l'étape du SFT.

Questions fréquentes

Qu'est-ce que l'effondrement de diversité dans les modèles de langage ?

L'effondrement de diversité est une situation où, après l'affinage, un modèle se met à choisir toujours le même ensemble restreint de réponses ou de coups, perdant des alternatives tout aussi valables. Dans l'étude, il survenait avec le SFT standard plus tôt que ne l'exigerait l'équilibre entre précision et diversité.

Comment l'action augmentation aide-t-elle à préserver la diversité ?

L'action augmentation entraîne le modèle sur tous les coups optimaux de chaque état, plutôt que sur un seul coup démontré. Selon l'étude, cela atténue partiellement l'effondrement de diversité et préserve le comportement exploratoire du modèle.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…