Modelos

Transformer

Un Transformer es una arquitectura de red neuronal centrada en auto-atención, que permite a cada posición en una secuencia atender directamente a todas las demás posiciones simultáneamente, permitiendo entrenamiento completamente paralelo y modelado efectivo de dependencias de largo alcance en lenguaje, imágenes, y otras secuencias.

La arquitectura Transformer fue introducida por Vaswani et al. en Google Brain en el artículo de 2017 'Attention Is All You Need.' Su innovación central es auto-atención multi-cabeza: para cada token en una secuencia de entrada, el modelo calcula una suma ponderada de representaciones de todos los demás tokens, donde los pesos (puntuaciones de atención) reflejan la relevancia aprendida entre pares de tokens. Ejecutar múltiples cabezas de atención en paralelo permite que el modelo capture diferentes tipos de relaciones simultáneamente. Como la atención se calcula sobre la secuencia completa de una sola vez en lugar de paso a paso, el Transformer es completamente paralelizable en la longitud de la secuencia, en contraste con redes recurrentes (RNNs, LSTMs) que deben procesar tokens secuencialmente.

Un codificador o decodificador Transformer estándar consta de capas idénticas apiladas, cada una conteniendo una subcapa de auto-atención multi-cabeza, una red feed-forward posición a posición, conexiones residuales (skip) alrededor de cada subcapa, y normalización de capas. Como la auto-atención es intrínsecamente agnóstica de posición, se añaden codificaciones posicionales (sinusoidales fijas o embeddings aprendidos) a representaciones de token para inyectar orden de secuencia. Los hiperparámetros arquitectónicos clave — número de capas, dimensión oculta, número de cabezas de atención, y ancho feed-forward — junto con volumen de datos de entrenamiento y presupuesto de computación, determinan en gran medida la capacidad del modelo.

Los Transformers se volvieron dominantes en NLP con BERT (Google, 2018) y GPT-2 (OpenAI, 2019), luego demostraron una transferencia fuerte a visión por computadora con Vision Transformer (ViT, Google, 2020), y a biología estructural con el uso de atención de AlphaFold2 sobre secuencias de aminoácidos y representaciones de pares (DeepMind, 2020). A partir de 2026, cada modelo de lenguaje grande importante — GPT-4, Claude 3, Gemini 1.5, Llama 3, Mistral — es una variante de Transformer, como lo son codificadores de visión líderes y modelos multimodales que combinan texto, imágenes, audio, y video.

La limitación práctica principal de la auto-atención estándar de Transformer es el costo computacional y de memoria cuadrático con respecto a la longitud de la secuencia, haciendo contextos muy largos costosos. A partir de 2026, múltiples técnicas abordan esto: patrones de atención dispersa, aproximaciones de atención lineal, atención de ventana deslizante (Mistral), y atención exacta optimizada para hardware (FlashAttention). Ventanas de contexto que exceden un millón de tokens son soportadas por varios modelos en producción. La investigación sobre sucesores arquitectónicos — modelos de espacio de estados como Mamba, e híbridos arquitectónicos de atención/SSM — apunta a combinar la calidad de modelado de los Transformers con escalado sub-cuadrático.

Ejemplo

Cuando un usuario presenta un documento técnico de 50.000 tokens a Claude para resumen, el Transformer subyacente procesa el documento completo en una sola pasada hacia adelante con cada oración atendiendo directamente a todas las demás oraciones, produciendo un resumen coherente sin la pérdida de información que causaría el truncamiento secuencial.

Términos relacionados

Últimas noticias sobre el tema

← Glosario