Deep Learning
El deep learning es un subcampo del aprendizaje automático que entrena redes neuronales con muchas capas para aprender representaciones jerárquicas directamente a partir de datos sin procesar como píxeles, formas de onda de audio o tokens de texto, sin ingeniería de características manual.
El deep learning se refiere al entrenamiento de redes neuronales con múltiples capas ocultas — típicamente más de dos, y en arquitecturas modernas a menudo docenas o miles. La palabra 'deep' simplemente denota profundidad en el recuento de capas de la red. Apilar capas permite que el modelo construya representaciones cada vez más abstractas: en un modelo de visión, las capas tempranas detectan bordes de bajo nivel, las capas intermedias los componen en formas, y las capas más profundas reconocen objetos semánticamente significativos.
Varios desarrollos técnicos permitieron que las redes profundas se entrenaran de manera confiable a escala: la función de activación ReLU (que evita el problema de desvanecimiento de gradiente del sigmoid), dropout y normalización de lotes para regularización y entrenamiento estable, conexiones residuales que permiten que los gradientes fluyan a través de muchas capas (ResNet, 2015), y la adopción generalizada de GPUs para operaciones de matriz masivamente paralelas. Los conjuntos de datos curados grandes — ImageNet para visión, Common Crawl para texto — proporcionaron el combustible.
El deep learning produjo avances de cambio de paso en todas las disciplinas: clasificación de imágenes (AlexNet ganando ImageNet en 2012 por un margen grande), traducción automática (Google Neural Machine Translation, 2016), juego (AlphaGo, 2016), predicción de plegamiento de proteínas (AlphaFold2, 2020 CASP14), y medios generativos. Es la base de todos los modelos de lenguaje grandes y sistemas modernos de visión por computadora desplegados en producción.
A partir de 2026, el deep learning es la metodología predeterminada para cualquier tarea con datos y computación suficientes. Las fronteras de investigación activas incluyen aprendizaje autosupervisado y few-shot para reducir los requisitos de datos etiquetados, diseño de arquitectura consciente del hardware (mixture-of-experts, sparsity estructurada), y trabajo teórico sobre la comprensión de la generalización — por qué las redes sobreparametrizadas entrenadas a pérdida de entrenamiento casi cero aún generalizan bien en datos no vistos.