Modelos

Modelo Multimodal

Un modelo multimodal es un sistema de IA que procesa y genera datos en más de una modalidad — como texto, imágenes, audio o video — dentro de una arquitectura unificada única.

Un modelo multimodal es un sistema de IA capaz de ingerir, razonar y generar contenido en más de un tipo de datos (modalidad). La combinación más común es texto e imágenes, pero los sistemas de frontera en 2026 también manejan audio, video, tablas estructuradas y código. A diferencia de un pipeline que encadena modelos unimodales separados, un modelo multimodal procesa todas las entradas conjuntamente, permitiendo razonamiento entre modalidades en un único paso de inferencia — por ejemplo, responder a una pregunta cuya respuesta requiere leer texto incrustado en una imagen y combinarlo con el contexto conversacional circundante.

La mayoría de las arquitecturas emparejan codificadores específicos de modalidad con una columna vertebral de modelo de lenguaje central. Un codificador de visión — típicamente un Vision Transformer (ViT) preentrenado con objetivos contrastivos como CLIP — convierte parches de imagen en incrustaciones densas. Una capa de proyección ligera (un MLP o módulo de atención cruzada) mapea estos en el espacio de incrustación de tokens del modelo de lenguaje, permitiendo que el decodificador autorregresivo atienda conjuntamente tokens visuales y textuales. Las entradas de audio y video se manejan mediante codificadores análogos. Algunos sistemas, como GPT-4o, van más allá y entrenan un único modelo de extremo a extremo en todas las modalidades en lugar de componer módulos separados.

La capacidad multimodal es significativa porque la información del mundo real rara vez llega en un único formato. Los artículos científicos combinan texto, figuras y ecuaciones; el servicio al cliente implica voz y contenido de pantalla; la inspección de fabricación depende de imágenes y flujos de sensores. Un modelo multimodal puede reemplazar tuberías completas de herramientas especializadas, reduciendo latencia, complejidad de integración y modos de fallo en puntos de entrega entre componentes.

Desde 2026, la multimodalidad nativa es una expectativa de línea de base para productos de IA de frontera. GPT-4o, Gemini 2.0 y 2.5, y Claude 3.7 y 4 aceptan todas entradas de texto e imagen y, en algunas configuraciones, también audio y video. Los modelos multimodales de peso abierto — incluyendo LLaMA 3.2 Vision, Qwen-VL-Max e InternVL2 — han cerrado sustancialmente la brecha con sistemas propietarios en puntos de referencia estándar. El enfoque de investigación se ha desplazado hacia generación de cualquiera a cualquiera: sistemas que producen imágenes, audio o video con la fluidez del texto.

Ejemplo

Un analista carga un informe de ganancias de 40 páginas que contiene gráficos incrustados y tablas con notas a pie de página en un modelo multimodal y le pide que identifique los tres mayores cambios de ingresos año a año; el modelo lee los gráficos y tablas en contexto, hace referencias cruzadas con la discusión textual y devuelve una respuesta clasificada citando ubicaciones específicas de página.

Términos relacionados

Últimas noticias sobre el tema

← Glosario