Apple ML Research изучила alignment в мультимодальных LLM и их склонность к галлюцинациям
Apple ML Research опубликовала исследование о preference alignment в мультимодальных LLM. В отличие от текстовых моделей, MLLM галлюцинируют двояко: называют неверные факты или описывают изображения неточно. Цель alignment — привязать ответы модели к реальному содержанию картинки. Авторы называют это направление критически важным, но до сих пор малоизученным.
Traité par IA depuis Apple ML Research ; édité par Hamidun News
Apple ML Research a publié une étude approfondie sur l'alignement des préférences (preference alignment) dans les modèles de langage multimodaux (MLLM) — des systèmes capables de traiter simultanément du texte et des images. Les auteurs soutiennent que l'alignment, devenu la norme pour les LLM textuels, reste significativement moins étudié dans le contexte multimodal.
Pourquoi les
Hallucinations des MLLM Sont Plus Complexes que les Habituelles
Les modèles multimodaux hallucinent différemment des LLM textuels. Selon l'étude d'Apple ML Research, dans les systèmes de compréhension d'images les hallucinations se manifestent sous deux formes : les erreurs factuelles — lorsque le modèle énonce des faits incorrects sur le monde — et l'incohérence de contenu — lorsque la réponse semble convaincante mais contredit ce qui est réellement représenté dans l'image.
Le second type est particulièrement insidieux : si un modèle décrit une voiture bleue sur une photo comme rouge, ou qualifie une image estivale d'hivernale — il ne s'agit pas d'une erreur de connaissance, mais d'une erreur de « vision ». C'est précisément contre cela que l'alignment pour les systèmes multimodaux est dirigé.
« L'objectif principal de l'alignment pour les MLLM est d'inciter ces modèles à ancrer leurs réponses dans les informations contenues dans l'image », indique la publication d'Apple ML
Research.
Comment Fonctionne le Preference Alignment
Le preference alignment est une technique d'ajustement fin dans laquelle des paires de réponses sont présentées au modèle et étiquetées selon celle qui est « préférable » au regard de critères définis. Dans les LLM textuels, cette approche — incluant le RLHF (Reinforcement Learning from Human Feedback) et ses dérivés — est devenue le standard de facto depuis l'émergence d'InstructGPT et de ChatGPT. Pour les systèmes multimodaux, de telles études systématiques n'avaient presque pas été menées jusqu'à présent.
Thèses clés du travail :
- Le preference alignment est d'une importance critique pour la qualité des LLM, mais son impact dans les MLLM est pratiquement inexploré
- Dans les MLLM, l'alignment résout un défi supplémentaire : ancrer la réponse du modèle dans le contenu visuel réel
- Les hallucinations dans les MLLM se divisent en deux types : factuelles et visuelles (incohérence avec l'image)
- Apple ML Research mène une analyse comparative systématique des techniques d'alignment appliquées aux tâches de compréhension d'images
Selon l'étude, ce travail constitue l'une des premières tentatives exhaustives de combler l'écart entre la compréhension de l'alignment pour les modèles textuels et ce que l'on sait de son impact sur les systèmes multimodaux.
Pourquoi C'est Important pour l'Industrie
Les modèles multimodaux sont aujourd'hui utilisés dans le diagnostic médical, la modération de contenu et les assistants grand public — de Google Lens à Apple Intelligence. Dans chacun de ces scénarios, l'hallucination de « voir ce qui n'est pas là » coûte incomparablement plus cher qu'une erreur textuelle : une radiographie mal interprétée ou un objet mal identifié sur la route ont des conséquences directes.
L'étude d'Apple ML Research paraît au moment où les systèmes multimodaux passent des prototypes de laboratoire au déploiement à grande échelle. Comprendre comment l'alignment façonne la précision de la « vision » d'un modèle devient une question fondamentale pour l'ensemble du secteur.
Ce Que Cela Signifie
Le travail d'Apple ML Research met en évidence une lacune systémique : l'industrie développe et déploie activement des modèles multimodaux, mais le mécanisme permettant de les aligner sur le contenu réel des images est resté peu étudié. Si les conclusions de l'étude servent de base à de nouvelles méthodes d'entraînement, cela affectera directement la qualité des produits travaillant avec du contenu visuel — y compris Apple Intelligence et les systèmes similaires.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.