Modelo de Lenguaje de Visión (VLM)
Un Modelo de Lenguaje de Visión (VLM) es un modelo de IA que procesa conjuntamente entradas visuales (imágenes o video) y texto en lenguaje natural, permitiendo tareas como generación de descripciones de imágenes, respuesta a preguntas visuales y comprensión de documentos.
Un Modelo de Lenguaje de Visión (VLM) es una arquitectura de IA multimodal que combina un componente de codificación visual con un modelo de lenguaje para soportar razonamiento bidireccional entre imágenes y texto. Los VLMs pueden describir imágenes en lenguaje natural, responder preguntas sobre contenido visual, fundamentar referencias textuales en regiones específicas de imágenes, realizar reconocimiento óptico de caracteres en diseños complejos, y — en variantes generativas — producir imágenes condicionadas en prompts de texto. El término VLM convencionalmente enfatiza el emparejamiento visión-texto específicamente, distinguiéndolo de sistemas multimodales más amplios que además manejan audio o datos estructurados.
La arquitectura VLM dominante empareja un codificador de visión preentrenado — más comúnmente un Vision Transformer (ViT) o un codificador de imágenes CLIP — con un modelo de lenguaje solo-decodificador. Los parches de imagen se codifican en incrustaciones densas, que una capa de proyección (MLP o atención cruzada) mapea en el espacio de incrustación de tokens del modelo de lenguaje. La secuencia combinada resultante de tokens visuales y textuales se procesa autoregressivamente. Este diseño, utilizado en LLaVA, PaliGemma (Google), InternVL (Shanghai AI Lab) y Qwen-VL (Alibaba), permite el ajuste fino de instrucciones para transferir las capacidades conversacionales existentes del modelo de lenguaje al dominio visual. El preentrenamiento de estilo contrastivo CLIP en cientos de millones de pares imagen-texto típicamente proporciona la alineación inicial entre modalidades.
Los VLMs son prácticamente significativos porque una gran parte de la información del mundo real está incrustada en forma visual: facturas, figuras científicas, esquemas de ingeniería, imágenes satelitales y escaneos médicos. Un VLM puede analizar una fotografía de factura y extraer datos de artículos de línea, leer una imagen de lámina de patología e identificar anomalías, o interpretar un plano de piso y responder preguntas espaciales sobre adyacencia de habitaciones — tareas que anteriormente requerían pipelines de visión por computadora específicos para cada tipo de documento.
Para 2026, los VLMs de alta capacidad están disponibles tanto como APIs comerciales como modelos de peso abierto. GPT-4V y GPT-4o, Gemini 2.0 y Claude con visión lideran en puntos de referencia como MMMU (Comprensión Multimodal Masivamente Multidisciplinaria) y DocVQA. Los puntos de control de peso abierto incluyendo LLaVA-NeXT, PaliGemma 2 e InternVL2 se despliegan ampliamente en investigación y producción. Los modelos principales se acercan al rendimiento a nivel humano en varios puntos de referencia de preguntas-respuestas visuales; razonamiento espacial de grano fino, conteo preciso de objetos y lectura de texto muy pequeño o degradado permanecen como áreas activas de mejora.