Apple ML Research изучила alignment в мультимодальных LLM и их склонность к галлюцинациям
Apple ML Research опубликовала исследование о preference alignment в мультимодальных LLM. В отличие от текстовых моделей, MLLM галлюцинируют двояко: называют неверные факты или описывают изображения неточно. Цель alignment — привязать ответы модели к реальному содержанию картинки. Авторы называют это направление критически важным, но до сих пор малоизученным.
Processado por IA de Apple ML Research; editado por Hamidun News
A Apple ML Research publicou um estudo abrangente sobre o alinhamento de preferências (preference alignment) em modelos de linguagem multimodais (MLLM) — sistemas capazes de processar texto e imagens simultaneamente. Os autores afirmam que o alignment, que se tornou padrão para os LLM de texto, permanece significativamente menos estudado no contexto multimodal.
Por
Que as Alucinações de MLLMs São Mais Complexas que as Comuns
Os modelos multimodais alucinam de forma diferente dos LLM de texto. De acordo com o estudo da Apple ML Research, em sistemas de compreensão de imagens as alucinações se manifestam em duas formas: erros factuais — quando o modelo afirma fatos incorretos sobre o mundo — e inconsistência de conteúdo — quando a resposta soa convincente, mas contradiz o que está realmente retratado na imagem.
O segundo tipo é especialmente traiçoeiro: se um modelo descreve um carro azul em uma foto como vermelho, ou classifica uma imagem de verão como inverno — isso não é um erro de conhecimento, mas um erro de "visão". É exatamente contra isso que o alignment para sistemas multimodais é direcionado.
"O objetivo principal do alignment para MLLMs é incentivar esses modelos a ancorar suas respostas nas informações da imagem", afirma a publicação da
Apple ML Research.
Como Funciona o Preference Alignment
O preference alignment é uma técnica de ajuste fino na qual pares de respostas são apresentados ao modelo e rotulados quanto a qual é "preferível" de acordo com critérios determinados. Em LLM de texto, essa abordagem — incluindo RLHF (Reinforcement Learning from Human Feedback) e seus derivados — tornou-se o padrão de facto desde o surgimento do InstructGPT e do ChatGPT. Para sistemas multimodais, quase nenhum estudo sistemático desse tipo havia sido conduzido até agora.
Principais teses do trabalho:
- O preference alignment é de importância crítica para a qualidade dos LLM, mas seu impacto nos MLLM é praticamente inexplorado
- Nos MLLM, o alignment resolve um desafio adicional: ancorar a resposta do modelo no conteúdo visual real
- As alucinações em MLLM se dividem em dois tipos: factuais e visuais (inconsistência com a imagem)
- A Apple ML Research realiza uma análise comparativa sistemática das técnicas de alignment aplicadas a tarefas de compreensão de imagens
De acordo com o estudo, este trabalho é uma das primeiras tentativas abrangentes de preencher a lacuna entre o quão bem o alignment é compreendido para modelos de texto e o quanto se sabe sobre seu impacto em sistemas multimodais.
Por Que Isso Importa para a Indústria
Os modelos multimodais são atualmente utilizados em diagnósticos médicos, moderação de conteúdo e assistentes para consumidores — do Google Lens ao Apple Intelligence. Em cada um desses cenários, a alucinação de "ver o que não existe" custa incomparavelmente mais do que um erro textual: uma radiografia interpretada incorretamente ou um objeto mal identificado em uma estrada têm consequências diretas.
O estudo da Apple ML Research surge no momento em que os sistemas multimodais estão transitando de protótipos laboratoriais para implantação em massa. Compreender como o alignment molda a precisão da "visão" de um modelo está se tornando uma questão fundamental para toda a indústria.
O Que Isso Significa
O trabalho da Apple ML Research identifica uma lacuna sistêmica: a indústria está desenvolvendo e implantando ativamente modelos multimodais, mas o mecanismo para alinhá-los ao conteúdo real das imagens permaneceu pouco estudado. Se as conclusões do estudo servirem de base para novos métodos de treinamento, isso afetará diretamente a qualidade dos produtos que trabalham com conteúdo visual — incluindo o Apple Intelligence e sistemas semelhantes.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.