Малые языковые модели Qwen игнорируют инструкции, но выглядят точными в тестах
Исследование на arXiv проверило, следуют ли малые модели Qwen инструкциям, которые конфликтуют с их привычным поведением — например, выбрать заведомо неверный ответ. Оказалось: маленькие модели остаются компетентными, но почти всегда игнорируют такую команду, тогда как крупные показывают чёткий разрыв. Вывод авторов: способность решать задачу и способность подчиняться командам — разные вещи, и обычная метрика точности это маскирует.
Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
En juillet 2026, des chercheurs ont publié sur arXiv une étude montrant que les petits modèles de langage Qwen restent précis dans les tâches, mais ignorent systématiquement les instructions qui contredisent leur comportement habituel — et la métrique de précision standard masque entièrement cette défaillance.
Ce que les auteurs ont testé
L'instruction tuning est censé faire en sorte que le modèle exécute les demandes de l'utilisateur, mais on ne sait pas si les petits modèles obéissent lorsque la commande entre en conflit avec leur comportement habituel. Les auteurs ont pris des modèles Qwen instruction-tuned de différentes tailles et les ont confrontés à une instruction « contraire » sur trois types de tâches.
À la tâche standard s'ajoutait une instruction conflictuelle : choisir une option délibérément incorrecte dans un test à choix multiples, donner le sentiment opposé dans une analyse de sentiment, ou renvoyer le résultat doublé dans un problème mathématique. Cette conception croisée entre tâches permettait de vérifier si la résistance était liée à une tâche précise ou s'il s'agissait d'un trait comportemental plus général.
- Trois tâches : sélection de réponse (MCQA), classification de sentiment, questions mathématiques
- Instruction conflictuelle : choisir la mauvaise option, donner le sentiment opposé ou doubler la réponse
- Trois métriques : standard accuracy, non-standard accuracy et Instruction-Following Failure Rate (IFFR)
- Modèles : Qwen instruction-tuned de plusieurs tailles
Pourquoi la précision est trompeuse
L'astuce de la conception réside dans le fait que toutes les réponses sont comparées à la solution correcte d'origine. Un modèle qui a ignoré l'instruction « contraire » et résolu la tâche comme d'habitude paraît réussi selon la métrique standard — alors qu'il n'a pas exécuté la commande de l'utilisateur. C'est contre-intuitif : deux modèles ayant le même score de précision sur un benchmark peuvent se comporter de façon totalement différente si on leur donne une commande allant à l'encontre des attentes. C'est précisément pour cela que ne rapporter que la précision standard cache les échecs dans le suivi des instructions, et les auteurs introduisent une métrique distincte, l'IFFR, pour les détecter.
Ce que les résultats ont montré
Les résultats ont divergé selon la taille du modèle. Les petits modèles Qwen sont restés compétents — ils résolvaient la tâche d'origine —, mais ignoraient systématiquement l'instruction non standard. Les grands modèles présentaient un écart net entre les deux modes : ils basculaient réellement vers la commande « contraire » nettement plus souvent.
La précision standard comme le suivi des instructions dans l'ensemble progressaient avec l'échelle du modèle, mais, comme le notent les auteurs, le schéma n'était pas constant selon les tâches et les jeux de données. L'augmentation de la taille ne garantissait pas une obéissance également fiable partout.
«
La compétence dans la tâche et le suivi des instructions sont des capacités distinctes, et ne rapporter que la précision standard masque les échecs de suivi des instructions », indique le résumé de l'étude sur arXiv.
Ce que cela signifie
Pour ceux qui déploient de petits modèles, la conclusion est pratique : un score élevé sur un benchmark ne signifie pas que le modèle fera exactement ce qu'on lui demande. Une capacité accrue à résoudre des tâches ne garantit pas automatiquement un contrôle fiable du comportement ; l'obéissance doit donc être mesurée séparément — avec une métrique comme l'IFFR — plutôt que déduite de la précision globale. Pour les applications où la contrôlabilité et la sécurité comptent, c'est un argument de plus pour tester le modèle sur des commandes conflictuelles, et pas seulement sur des tâches de référence.
Questions fréquentes
Qu'est-ce que l'Instruction-Following Failure Rate (IFFR) ?
L'IFFR est une métrique proposée par les auteurs pour la proportion de cas où un modèle n'a pas exécuté l'instruction donnée. Contrairement à la précision standard, elle montre précisément les échecs de suivi de la commande, et non la qualité de la résolution de la tâche.
Pourquoi un modèle paraît-il précis mais n'obéit-il pas ?
Parce que dans l'expérience, les réponses sont comparées à la solution correcte d'origine. Si le modèle a ignoré l'instruction « contraire » — par exemple « choisis la mauvaise option » — et a résolu la tâche comme d'habitude, la métrique standard compte cela comme un succès, bien que le modèle ait enfreint la commande de l'utilisateur.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.