Modelo de Difusión
Un modelo de difusión es un sistema de IA generativo que produce imágenes, audio o vídeo aprendiendo a invertir un proceso iterativo de adición de ruido, comenzando desde ruido aleatorio y desruidando progresivamente a través de pasos aprendidos para producir una salida coherente.
Un modelo de difusión es una clase de modelo generativo que aprende la distribución de datos reales—más comúnmente imágenes—entrenándose para deshacer un proceso estocástico que gradualmente corrompe datos limpios en ruido puro. El enfoque está arraigado en termodinámica estadística de no-equilibrio y fue formalizado para aprendizaje profundo en el artículo Modelos Probabilísticos de Difusión Desruidante (DDPM) de Ho et al. en 2020. Los modelos de difusión ahora sustentan la mayoría de sistemas principales de generación de imágenes: Stable Diffusion de Stability AI, DALL-E 3 de OpenAI, Imagen e Imagen 3 de Google, y Firefly de Adobe todos se basan en difusión o modelado generativo basado en puntuaciones estrechamente relacionado.
El entrenamiento implica dos procesos. El proceso directo toma una muestra de datos limpia y añade pequeñas cantidades de ruido gaussiano sobre T pasos (a menudo 1.000 o más), produciendo una secuencia de imagen original a ruido puro; este proceso es fijo y no requiere parámetros aprendidos. El proceso inverso es lo que la red neuronal aprende: dada una muestra ruidosa en el paso t y el nivel de ruido, predecir el ruido que fue añadido, permitiendo que sea restado. En inferencia, el modelo comienza desde ruido gaussiano aleatorio e iterativamente aplica este paso de desruido para producir una muestra de la distribución de datos aprendida. La generación acondicionada por texto se logra mediante atención cruzada a incrustaciones de texto (de CLIP o T5), y la orientación sin clasificador amplifica la adherencia al prompt de texto al costo de diversidad. Métodos de muestreo acelerados—DDIM, DPM-Solver, y emparejamiento de flujo—han reducido los pasos de desruido requeridos de miles a decenas, o incluso un paso único con destilación de consistencia.
Los modelos de difusión en gran medida sustituyeron redes adversariales generativas (GANs) como el paradigma dominante de generación de imágenes después de 2022. Las GANs requieren un equilibrio de entrenamiento adversarial delicado entre generador y discriminador, sufren de colapso de modo, y son difíciles de escalar. Los modelos de difusión entrenan con un objetivo de desruido simple, son estables para optimizar, producen muestras diversas de alta calidad, y escalan predeciblemente con tamaño de modelo y datos. El lanzamiento público de Stable Diffusion 1.x en agosto de 2022, que permitió ejecutar generación de imágenes en GPUs de consumo, desencadenó adopción rápida y una explosión de productos y investigación descendentes.
A partir de 2026, la difusión y modelos de emparejamiento de flujo estrechamente relacionados permanecen como la columna vertebral de generación de imágenes y vídeo comercial. El emparejamiento de flujo—utilizado en Stable Diffusion 3, modelos FLUX de Black Forest Labs, y varios generadores de vídeo—ofrece un objetivo de entrenamiento matemáticamente más limpio e inferencia más rápida que DDPM, y se prefiere cada vez más en nuevos sistemas. Los modelos de difusión de vídeo, incluyendo Sora de OpenAI (anunciado febrero de 2024) y Veo de Google, extienden la arquitectura a coherencia temporal a través de fotogramas. Más allá de visuales, enfoques basados en difusión se aplican a síntesis de voz (AudioLM de Google, Voicebox de Meta) y diseño molecular, donde modelos como los de Schrödinger e Insilico Medicine generan moléculas candidatas de fármacos mediante desruido en espacio coordinado 3-D.