Modèles

Transformer

Un Transformer est une architecture de réseau neuronal centrée sur l'auto-attention, qui permet à chaque position d'une séquence d'accéder directement à chaque autre position simultanément, permettant un entraînement entièrement parallèle et une modélisation efficace des dépendances à longue portée dans le langage, les images et les autres séquences.

L'architecture Transformer a été introduite par Vaswani et al. à Google Brain dans l'article de 2017 « Attention Is All You Need ». Son innovation centrale est l'auto-attention multi-têtes : pour chaque jeton dans une séquence d'entrée, le modèle calcule une somme pondérée de représentations de tous les autres jetons, où les poids (scores d'attention) reflètent la pertinence apprise entre les paires de jetons. L'exécution de multiples têtes d'attention en parallèle permet au modèle de capturer différents types de relations simultanément. Parce que l'attention est calculée sur toute la séquence à la fois plutôt que pas à pas, le Transformer est entièrement parallélisable à travers la longueur de la séquence, contrairement aux réseaux récurrents (RNN, LSTM) qui doivent traiter les jetons de manière séquentielle.

Un encodeur ou décodeur Transformer standard consiste en couches identiques empilées, chacune contenant une sous-couche d'auto-attention multi-têtes, un réseau feed-forward position-wise, des connexions résiduelles autour de chaque sous-couche, et une normalisation de couche. Puisque l'auto-attention est intrinsèquement indépendante de la position, les encodages positionnels (sinusoïdaux fixes ou embeddings appris) sont ajoutés aux représentations de jetons pour injecter l'ordre de la séquence. Les hyperparamètres d'architecture clés — nombre de couches, dimension cachée, nombre de têtes d'attention et largeur feed-forward — avec le volume de données d'entraînement et le budget de calcul, déterminent largement la capacité du modèle.

Les Transformers sont devenus dominants en NLP avec BERT (Google, 2018) et GPT-2 (OpenAI, 2019), puis ont démontré un fort transfert à la vision par ordinateur avec la Vision Transformer (ViT, Google, 2020), et à la biologie structurale avec l'utilisation par AlphaFold2 de l'attention sur les séquences d'acides aminés et les représentations de paires (DeepMind, 2020). En 2026, tous les principaux grands modèles de langage — GPT-4, Claude 3, Gemini 1.5, Llama 3, Mistral — sont des variantes du Transformer, tout comme les encodeurs de vision de premier plan et les modèles multimodaux combinant le texte, les images, l'audio et la vidéo.

La principale limitation pratique de l'auto-attention Transformer standard est le coût computationnel et mémoire quadratique par rapport à la longueur de la séquence, rendant les contextes très longs coûteux. En 2026, plusieurs techniques abordent cela : les motifs d'attention clairsemés, les approximations d'attention linéaire, l'attention à fenêtre coulissante (Mistral), et l'attention exacte optimisée pour le matériel (FlashAttention). Les fenêtres de contexte dépassant un million de jetons sont soutenues par plusieurs modèles en production. La recherche sur les successeurs architecturaux — les modèles d'espace d'état tels que Mamba, et les architectures hybrides attention/SSM — vise à combiner la qualité de modélisation des Transformers avec une mise à l'échelle sub-quadratique.

Exemple

Lorsqu'un utilisateur soumet un document technique de 50 000 jetons à Claude pour résumé, le Transformer sous-jacent traite l'ensemble du document en une seule passe directe où chaque phrase accède directement à chaque autre phrase, produisant un résumé cohérent sans la perte d'information que la troncature séquentielle causerait.

Termes liés

Dernières actualités sur le sujet

← Glossaire