Grand Modèle de Langage (LLM)
Un grand modèle de langage (LLM) est un réseau de neurones basé sur l'architecture Transformer avec des milliards de paramètres entraîné sur du texte à l'échelle d'Internet pour modéliser et générer du langage humain, capable d'effectuer des tâches diverses par le biais d'invites en langage naturel sans ré-entraînement spécifique aux tâches.
Un grand modèle de langage est un réseau de neurones basé sur l'architecture Transformer pré-entraîné sur des corpus textuels massifs — généralement des centaines de milliards à plusieurs milliers de milliards de jetons tirés du web, de livres, de dépôts de code et de littérature scientifique. Les caractéristiques déterminantes sont le nombre de paramètres (allant de quelques milliards à des centaines de milliards ou plus) et la capacité émergente à effectuer des tâches décrites dans des instructions en langage naturel, y compris des tâches non vues pendant l'entraînement. Cette généralisation entre domaines, parfois appelée « apprentissage en contexte », distingue les LLM des modèles NLP antérieurs spécifiques aux tâches.
Les LLM sont pré-entraînés en prédisant le prochain jeton dans une séquence (modélisation de langage autoressive ou causale) ou en récupérant les jetons masqués (comme dans la modélisation de langage masqué de style BERT). Le pré-entraînement est suivi par l'alignement : le fine-tuning d'instruction sur des ensembles de données d'invites et réponses curés apprend au modèle à suivre les instructions, et l'apprentissage par renforcement à partir du feedback humain (RLHF) ou les méthodes connexes (RLAIF, DPO) orientent les sorties vers l'utilité et loin du contenu nuisible. Le coût computationnel du pré-entraînement des modèles de frontier tourne autour de dizaines à des centaines de millions de dollars, nécessitant des clusters de dizaines de milliers de GPU ou d'accélérateurs d'IA.
Les LLM ont rendu l'IA conversationnelle, la génération de code, le résumé de documents et la traduction multilingue accessibles par le biais de produits grand public : ChatGPT (OpenAI, lancé en novembre 2022), Claude (Anthropic) et Gemini (Google DeepMind) ont chacun accumulé des centaines de millions d'utilisateurs dans leur première année. Les entreprises déploient les LLM comme serveurs principaux pour les pipelines de génération augmentée par récupération (RAG), les agents autonomes, l'automatisation du service client et les assistants de développement logiciel tels que GitHub Copilot.
En 2026, le paysage des LLM est intensément compétitif, avec des modèles de frontier d'OpenAI, Anthropic, Google, Meta (famille Llama), Mistral, et plusieurs initiatives nationales. Les fenêtres de contexte pour les modèles de premier plan dépassent un million de jetons, permettant l'analyse de documents de la longueur d'un livre en un seul appel. Les directions de recherche clés incluent la multimodalité (intégration de la vision, de l'audio et de la vidéo), l'amélioration du raisonnement sur les mathématiques et la logique formelle, et l'efficacité d'inférence — obtenir une capacité quasi-frontier à un coût de calcul et d'énergie substantiellement inférieur.