arXiv cs.CL→ original

Малые языковые модели Qwen игнорируют инструкции, но выглядят точными в тестах

Исследование на arXiv проверило, следуют ли малые модели Qwen инструкциям, которые конфликтуют с их привычным поведением — например, выбрать заведомо неверный ответ. Оказалось: маленькие модели остаются компетентными, но почти всегда игнорируют такую команду, тогда как крупные показывают чёткий разрыв. Вывод авторов: способность решать задачу и способность подчиняться командам — разные вещи, и обычная метрика точности это маскирует.

Procesado por IA desde arXiv cs.CL; editado por Hamidun News
Малые языковые модели Qwen игнорируют инструкции, но выглядят точными в тестах
Fuente: arXiv cs.CL. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026, investigadores publicaron un estudio en arXiv que mostró que los modelos de lenguaje pequeños Qwen se mantienen precisos en las tareas, pero ignoran sistemáticamente las instrucciones que contradicen su comportamiento habitual, y la métrica estándar de precisión enmascara por completo este fallo.

Qué comprobaron los autores

El instruction tuning existe para que el modelo cumpla las solicitudes del usuario, pero no está claro si los modelos pequeños obedecen cuando la orden entra en conflicto con su comportamiento habitual. Los autores tomaron modelos Qwen instruction-tuned de distintos tamaños y los enfrentaron a una instrucción "contraria" en tres tipos de tareas.

A la tarea estándar se le añadía una instrucción conflictiva: elegir una opción deliberadamente incorrecta en una prueba de opción múltiple, dar el sentimiento opuesto en un análisis de sentimiento, o devolver el resultado duplicado en un problema matemático. Este diseño entre tareas permitía comprobar si la resistencia estaba ligada a una tarea concreta o era un rasgo de comportamiento más general.

  • Tres tareas: selección de respuesta (MCQA), clasificación de sentimiento, preguntas matemáticas
  • Instrucción conflictiva: elegir la opción incorrecta, dar el sentimiento opuesto o duplicar la respuesta
  • Tres métricas: standard accuracy, non-standard accuracy e Instruction-Following Failure Rate (IFFR)
  • Modelos: Qwen instruction-tuned de varios tamaños

Por qué la precisión induce a error

El truco del diseño está en que todas las respuestas se comparan con la solución correcta original. Un modelo que ignoró la instrucción "contraria" y resolvió la tarea como de costumbre parece exitoso según la métrica estándar, aunque no cumplió la orden del usuario. Esto es contraintuitivo: dos modelos con la misma puntuación de precisión en un benchmark pueden comportarse de forma totalmente distinta si se les da una orden que va en contra de lo esperado. Por eso reportar solo la precisión estándar oculta los fallos en el cumplimiento de instrucciones, y los autores introducen una métrica aparte, IFFR, para detectarlos.

Qué mostraron los resultados

Los resultados difirieron según el tamaño del modelo. Los modelos pequeños Qwen se mantuvieron competentes —resolvían la tarea original—, pero ignoraban de forma rutinaria la instrucción no estándar. Los modelos grandes mostraron una brecha clara entre los dos modos: cambiaban realmente a la orden "contraria" con notable más frecuencia.

Tanto la precisión estándar como el seguimiento de instrucciones en general crecieron con la escala del modelo, pero, como señalan los autores, el patrón fue inconsistente entre distintas tareas y datasets. El aumento de tamaño no garantizó una obediencia igual de fiable en todos los casos.

"La competencia en la tarea y el seguimiento de instrucciones son

capacidades distintas, y reportar solo la precisión estándar oculta los fallos en el seguimiento de instrucciones", señala el resumen del estudio en arXiv.

Qué significa esto

Para quienes implementan modelos pequeños, la conclusión es práctica: una puntuación alta en un benchmark no significa que el modelo vaya a hacer exactamente lo que se le pide. Un aumento en la capacidad de resolver tareas no otorga automáticamente un control fiable sobre el comportamiento, por lo que la obediencia debe medirse por separado —con una métrica como IFFR— y no deducirse de la precisión general. Para las aplicaciones donde importan la controlabilidad y la seguridad, este es un argumento más para probar el modelo con órdenes conflictivas, y no solo con tareas de referencia.

Preguntas frecuentes

¿Qué es el Instruction-Following Failure Rate (IFFR)?

IFFR es una métrica propuesta por los autores para la proporción de casos en los que un modelo no cumplió la instrucción dada. A diferencia de la precisión estándar, muestra específicamente los fallos en el cumplimiento de la orden, no la calidad de la resolución de la tarea.

¿Por qué un modelo parece preciso pero no obedece?

Porque en el experimento las respuestas se comparan con la solución correcta original. Si el modelo ignoró la instrucción "contraria" —por ejemplo, "elige la opción incorrecta"— y resolvió la tarea como de costumbre, la métrica estándar lo cuenta como un éxito, aunque el modelo incumplió la orden del usuario.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…