Modelos

Modelo Multimodal

Um modelo multimodal é um sistema de IA que processa e gera dados em mais de uma modalidade — como texto, imagens, áudio ou vídeo — dentro de uma arquitetura unificada única.

Um modelo multimodal é um sistema de IA capaz de ingerir, raciocinar sobre e gerar conteúdo em mais de um tipo de dado (modalidade). A combinação mais comum é texto e imagens, mas sistemas de fronteira em 2026 também lidam com áudio, vídeo, tabelas estruturadas e código. Diferentemente de um pipeline que encadeia modelos unimodais separados, um modelo multimodal processa todas as entradas em conjunto, permitindo raciocínio cross-modal em uma única passagem de inferência — por exemplo, respondendo uma pergunta cuja resposta requer ler texto incorporado em uma imagem e combiná-lo com o contexto conversacional circundante.

A maioria das arquiteturas emparelha codificadores específicos de modalidade com um backbone de modelo de linguagem central. Um codificador de visão — tipicamente um Vision Transformer (ViT) pré-treinado com objetivos contrastivos como CLIP — converte patches de imagem em embeddings densos. Uma camada de projeção leve (um módulo MLP ou cross-attention) mapeia esses para o espaço de embedding de token do modelo de linguagem, permitindo que o decodificador autorregressivo atenda aos tokens visuais e textuais em conjunto. Entradas de áudio e vídeo são tratadas por codificadores análogos. Alguns sistemas, como GPT-4o, vão além e treinam um único modelo end-to-end através das modalidades em vez de compor módulos separados.

A capacidade multimodal é significativa porque informações do mundo real raramente chegam em um único formato. Artigos científicos combinam texto, figuras e equações; atendimento ao cliente envolve fala e conteúdo de tela; inspeção de manufatura depende de imagens e fluxos de sensores. Um modelo multimodal pode substituir pipelines inteiros de ferramentas especializadas, reduzindo latência, complexidade de integração e modos de falha em pontos de handoff entre componentes.

A partir de 2026, a multimodalidade nativa é uma expectativa de linha de base para produtos de IA de fronteira. GPT-4o, Gemini 2.0 e 2.5, e Claude 3.7 e 4 aceitam entradas de texto e imagem e, em algumas configurações, áudio e vídeo também. Modelos multimodais de peso aberto — incluindo LLaMA 3.2 Vision, Qwen-VL-Max e InternVL2 — fecharam substancialmente a lacuna com sistemas proprietários em benchmarks padrão. O foco da pesquisa mudou para geração qualquer-para-qualquer: sistemas que produzem imagens, áudio ou vídeo tão fluidamente quanto texto.

Exemplo

Um analista carrega um relatório de ganhos de 40 páginas contendo gráficos incorporados e tabelas com notas de rodapé em um modelo multimodal e pede que ele identifique as três maiores mudanças de receita ano-a-ano; o modelo lê os gráficos e tabelas em contexto, referencia cruzada da discussão textual e retorna uma resposta classificada citando locais específicos da página.

Termos relacionados

Últimas notícias sobre o tema

← Glossário