Apple ML Research→ оригинал

Apple ML Research изучила alignment в мультимодальных LLM и их склонность к галлюцинациям

Apple ML Research опубликовала исследование о preference alignment в мультимодальных LLM. В отличие от текстовых моделей, MLLM галлюцинируют двояко: называют неверные факты или описывают изображения неточно. Цель alignment — привязать ответы модели к реальному содержанию картинки. Авторы называют это направление критически важным, но до сих пор малоизученным.

AI-обработка оригинала Apple ML Research; редакция Hamidun News
Apple ML Research изучила alignment в мультимодальных LLM и их склонность к галлюцинациям
Источник: Apple ML Research. Коллаж: Hamidun News.
◐ Слушать статью

Apple ML Research опубликовала комплексное исследование о выравнивании предпочтений (preference alignment) в мультимодальных языковых моделях (MLLM) — системах, способных одновременно обрабатывать текст и изображения. Авторы утверждают, что alignment, ставшая стандартом для текстовых LLM, в мультимодальном контексте остаётся значительно менее изученной.

Почему галлюцинации MLLM сложнее обычных

Мультимодальные модели галлюцинируют иначе, чем текстовые LLM. По данным исследования Apple ML Research, в системах для понимания изображений галлюцинации проявляются в двух формах: фактические ошибки — когда модель называет неверные факты о мире, и содержательная несогласованность — когда ответ звучит убедительно, но противоречит тому, что реально изображено на картинке.

Второй тип особенно коварен: если модель описывает синюю машину на фото как красную или называет летний снимок зимним — это не ошибка в знаниях, а ошибка «зрения». Именно на борьбу с этим направлен alignment для мультимодальных систем.

«Основная цель alignment для MLLM — побудить эти модели согласовывать ответы с информацией об изображении», — говорится в публикации

Apple ML Research.

Как работает preference alignment

Preference alignment — техника дообучения, при которой модели предъявляют пары ответов и размечают, какой из них «предпочтительнее» по заданным критериям. В текстовых LLM этот подход — включая RLHF (Reinforcement Learning from Human Feedback) и его производные — стал де-факто стандартом после появления InstructGPT и ChatGPT. Для мультимодальных систем подобных систематических исследований до сих пор почти не проводилось.

Ключевые тезисы работы:

  • Preference alignment критически важна для качества LLM, но в MLLM её влияние практически не исследовано
  • В MLLM alignment решает дополнительную задачу: привязать ответ модели к реальному визуальному контенту
  • Галлюцинации в MLLM делятся на два типа: фактические и визуальные (несоответствие изображению)
  • Apple ML Research проводит систематический сравнительный анализ alignment-техник применительно к задачам понимания изображений

Согласно исследованию, эта работа — одна из первых комплексных попыток восполнить пробел между тем, насколько хорошо alignment изучена для текстовых моделей, и тем, насколько мало известно о её влиянии на мультимодальные системы.

Зачем это важно для индустрии

Мультимодальные модели сегодня применяются в медицинской диагностике, контент-модерации и потребительских ассистентах — от Google Lens до Apple Intelligence. В каждом из этих сценариев галлюцинация «вижу не то, что есть» обходится несравнимо дороже текстовой ошибки: неверно расшифрованный рентген или неправильно идентифицированный объект на дороге имеют прямые последствия.

Исследование Apple ML Research появляется в момент, когда мультимодальные системы переходят от лабораторных прототипов к массовому внедрению. Понимание того, как alignment формирует точность «зрения» модели, становится фундаментальным вопросом для всей отрасли.

Что это значит

Работа Apple ML Research фиксирует системный пробел: индустрия активно разрабатывает и внедряет мультимодальные модели, но механизм их выравнивания с реальным содержанием изображений оставался малоизученным. Если выводы исследования лягут в основу новых методов обучения, это напрямую повлияет на качество продуктов, работающих с визуальным контентом, — включая Apple Intelligence и аналогичные системы.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…