Red Neuronal Generativa Adversarial (GAN)
Una Red Neuronal Generativa Adversarial (GAN) es una arquitectura de red dual donde un generador produce datos sintéticos y un discriminador intenta clasificarlos como reales o falsos; el entrenamiento adversarial entre los dos impulsa una calidad de salida progresivamente mayor.
Una Red Neuronal Generativa Adversarial (GAN) es una clase de arquitectura de red neuronal introducida por Ian Goodfellow y colegas en 2014. Consiste en dos redes entrenadas en oposición: un generador G que mapea vectores de ruido aleatorio a muestras de datos sintéticos, y un discriminador D que produce una estimación de probabilidad de si una muestra dada es real o generada. Ninguna red tiene acceso directo a los parámetros de la otra; cada una aprende solo a través de la retroalimentación de la pérdida adversarial.
El entrenamiento alterna entre dos objetivos. El discriminador se actualiza para maximizar su capacidad de distinguir muestras de entrenamiento reales de las generadas. El generador se actualiza simultáneamente para minimizar la probabilidad de que el discriminador identifique correctamente sus salidas como falsas — aprendiendo a engañar a D. En el equilibrio de Nash teórico, G produce muestras indistinguibles de la distribución de entrenamiento y D produce 0.5 para todas las entradas. En la práctica, estabilizar este juego minimax requiere técnicas como pérdida de Wasserstein con penalización de gradiente (WGAN-GP), normalización espectral y crecimiento progresivo de resolución, como en las series ProGAN y StyleGAN de NVIDIA.
Las GANs establecieron que un modelo podía aprender distribuciones de datos complejas y de alta dimensión sin estimación de verosimilitud explícita, permitiendo síntesis de rostros fotorrealistas, traducción imagen a imagen (Pix2Pix, CycleGAN, 2017), super-resolución y generación de video temprana. El StyleGAN2 de NVIDIA (2020) produjo imágenes de rostros humanos en gran medida indistinguibles de fotografías en alta resolución, impulsando tanto aplicaciones creativas como preocupaciones sobre el mal uso de medios sintéticos.
Para mediados de los años 2020, los modelos de difusión desplazaron a las GANs como el paradigma dominante para generación de imágenes y video, ofreciendo entrenamiento más estable y mayor diversidad de salida. Las GANs permanecen en uso activo donde la latencia de inferencia es crítica — los modelos de difusión son sustancialmente más lentos — y para aumento de datos en imágenes médicas, donde muestras sintéticas complementan conjuntos de datos anotados escasos. Las arquitecturas basadas en StyleGAN continúan apareciendo en generación de avatares y herramientas artísticas.