Малые языковые модели Qwen игнорируют инструкции, но выглядят точными в тестах
Исследование на arXiv проверило, следуют ли малые модели Qwen инструкциям, которые конфликтуют с их привычным поведением — например, выбрать заведомо неверный ответ. Оказалось: маленькие модели остаются компетентными, но почти всегда игнорируют такую команду, тогда как крупные показывают чёткий разрыв. Вывод авторов: способность решать задачу и способность подчиняться командам — разные вещи, и обычная метрика точности это маскирует.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Исследователи в июле 2026 года опубликовали на arXiv работу, которая показала: малые языковые модели Qwen остаются точными в задачах, но систематически игнорируют инструкции, противоречащие их привычному поведению, — а стандартная метрика точности этот сбой полностью маскирует.
Что проверяли авторы
Instruction tuning нужен, чтобы модель выполняла запросы пользователя, но неясно, подчиняются ли малые модели, когда команда конфликтует с их обычным поведением. Авторы взяли instruction-tuned модели Qwen разных размеров и столкнули их со «встречной» инструкцией на трёх типах задач.
К стандартному заданию добавляли конфликтующее: выбрать заведомо неверный вариант в тесте с выбором ответа, выдать противоположную тональность в анализе сентимента или вернуть удвоенный результат в математической задаче. Такой кросс-задачный дизайн позволял проверить, привязано ли сопротивление к конкретной задаче или это более общая поведенческая черта.
- Три задачи: выбор ответа (MCQA), классификация тональности, математические вопросы
- Конфликтующая инструкция: выбрать неверный вариант, дать противоположный сентимент или удвоить ответ
- Три метрики: standard accuracy, non-standard accuracy и Instruction-Following Failure Rate (IFFR)
- Модели: instruction-tuned Qwen нескольких размеров
Почему точность вводит в заблуждение
Хитрость дизайна в том, что все ответы сверяются с исходным правильным решением. Модель, которая проигнорировала «встречную» инструкцию и решила задачу как обычно, по стандартной метрике выглядит успешной — хотя команду пользователя она не выполнила. Это контринтуитивно: две модели с одинаковым баллом точности на бенчмарке могут вести себя совершенно по-разному, если дать им команду вразрез с ожиданиями. Именно поэтому отчёт только по стандартной точности прячет провалы в исполнении инструкций, и авторы вводят отдельную метрику IFFR, чтобы их поймать.
Что показали результаты
Результаты разошлись по размеру модели. Малые модели Qwen оставались компетентными — они решали исходную задачу, — но рутинно игнорировали нестандартную инструкцию. Крупные модели показывали чёткий разрыв между двумя режимами: они заметно чаще реально переключались на «встречную» команду.
И стандартная точность, и следование инструкциям в целом росли с масштабом модели, но, как отмечают авторы, паттерн был непостоянным по разным задачам и датасетам. Рост размера не гарантировал послушания одинаково везде.
«Компетентность в задаче и следование инструкциям — это разные
способности, а отчёт только по стандартной точности скрывает сбои следования инструкциям», — говорится в аннотации исследования на arXiv.
Что это значит
Для тех, кто внедряет малые модели, вывод практический: высокий балл на бенчмарке не означает, что модель сделает именно то, что вы просите. Рост способности решать задачи не даёт автоматически надёжного контроля над поведением, поэтому послушание стоит измерять отдельно — метрикой вроде IFFR, а не выводить из общей точности. Для приложений, где важна управляемость и безопасность, это ещё один довод тестировать модель на конфликтующих командах, а не только на эталонных задачах.
Частые вопросы
Что такое Instruction-Following Failure Rate (IFFR)?
IFFR — предложенная авторами метрика доли случаев, когда модель не выполнила заданную инструкцию. В отличие от стандартной точности, она показывает именно провалы следования команде, а не качество решения задачи.
Почему модель выглядит точной, но не слушается?
Потому что в эксперименте ответы сверяются с исходным правильным решением. Если модель проигнорировала «встречную» инструкцию — например, «выбери неверный вариант» — и решила задачу как обычно, стандартная метрика засчитает это как успех, хотя команду пользователя модель нарушила.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.