Glossaire de l'IA

Des définitions courtes et précises des termes de l'intelligence artificielle, sans brouillard académique. Chaque entrée commence par une réponse en deux phrases, suivie d'une explication approfondie, d'un exemple concret et de notions liées. Le glossaire s'enrichit à mesure que de nouveaux termes entrent dans l'actualité.

Modèles

Apprentissage Automatique
L'apprentissage automatique est une branche de l'intelligence artificielle dans laquelle les algorithmes améliorent automatiquement leurs performances sur une tâche en apprenant les motifs des données, sans être explicit
Apprentissage Profond
L'apprentissage profond est un sous-domaine de l'apprentissage automatique qui entraîne des réseaux de neurones avec de nombreuses couches pour apprendre des représentations hiérarchiques directement à partir de données
Architecture Encodeur–Décodeur
Une architecture Encodeur–Décodeur est une conception de réseau de neurones dans laquelle un encodeur mappe une entrée dans une représentation latente et un décodeur distinct génère la séquence de sortie à partir de cett
Architecture Uniquement Décodeur
Une Architecture Uniquement Décodeur est une variante de transformer qui utilise une seule pile d'auto-attention avec un masquage causal (gauche-à-droite) pour prédire chaque token suivant à partir de son contexte précéd
Convolutional Neural Network (CNN)
Un Convolutional Neural Network (CNN) est une architecture d'apprentissage profond qui applique des filtres à poids partagés appris sur les patches locaux des données d'entrée — le plus souvent des images — pour détecter
Grand Modèle de Langage (LLM)
Un grand modèle de langage (LLM) est un réseau de neurones basé sur l'architecture Transformer avec des milliards de paramètres entraîné sur du texte à l'échelle d'Internet pour modéliser et générer du langage humain, ca
Mixture of Experts (MoE)
Mixture of Experts (MoE) est une architecture de réseau de neurones où un mécanisme de routage appris active uniquement un petit sous-ensemble de sous-réseaux spécialisés (experts) pour chaque token d'entrée, permettant
Modèle d'embedding
Un modèle d'embedding convertit du texte, des images ou d'autres données en vecteurs numériques de longueur fixe dans un espace de haute dimension, où les éléments sémantiquement similaires sont géométriquement proches l
Modèle d'Espace d'État (SSM)
Un Modèle d'Espace d'État (SSM) est une classe d'architectures de traitement de séquences dérivée de la théorie du contrôle qui représente les flux de données par un vecteur d'état latent mis à jour par des récurrences l
Modèle de Diffusion
Un modèle de diffusion est un système d'IA génératif qui produit des images, de l'audio ou de la vidéo en apprenant à inverser un processus d'ajout de bruit itératif, en commençant par du bruit aléatoire et en le désbrui
Modèle de Fondation
Un modèle de fondation est un grand système d'IA pré-entraîné sur des données vastes et diversifiées—texte, images, code—pour servir de base généraliste adaptable à de nombreuses tâches en aval. Le terme a été introduit
Modèle de Frontière
Un modèle de frontière est un système d'IA fonctionnant aux limites actuelles de la capacité en apprentissage automatique, typiquement entraîné avec les budgets de calcul les plus grands. Le terme est utilisé en politiqu
Modèle de raisonnement
Un modèle de raisonnement est un système d'IA conçu pour résoudre des problèmes complexes et multi-étapes en générant des étapes de raisonnement intermédiaires explicites — souvent appelées chaîne de pensée — avant de pr
Modèle du monde
Un modèle du monde est une représentation interne qu'un système d'IA apprend des dynamiques de son environnement, lui permettant de prédire les conséquences des actions et de simuler les états futurs sans interagir direc
Modèle multimodal
Un modèle multimodal est un système d'IA qui traite et génère des données sur plus d'une modalité — comme le texte, les images, l'audio ou la vidéo — au sein d'une seule architecture unifiée.
Modèle open-weights
Un modèle open-weights est un système d'IA dont les poids de paramètres entraînés sont publiquement divulgués, permettant à quiconque de télécharger, exécuter et modifier le modèle sans accéder à l'infrastructure du déve
Modèle texte-vers-image
Un modèle texte-vers-image est un système d'IA générative qui produit des images raster à partir de prompts en langage naturel, synthétisant un contenu visuel qui correspond à la scène, au style ou au sujet décrit.
Modèle texte-vers-vidéo
Un modèle texte-vers-vidéo est un système d'IA générative qui synthétise des clips vidéo à partir de prompts en langage naturel, produisant des séquences d'images temporellement cohérentes qui correspondent au mouvement,
Modèle Vision-Langage (VLM)
Un modèle Vision-Langage (VLM) est un modèle d'IA qui traite conjointement les entrées visuelles (images ou vidéo) et le texte en langage naturel, permettant des tâches telles que la description d'images, la réponse à de
Petit Modèle de Langage (SLM)
Un petit modèle de langage (SLM) est un modèle de langage avec un nombre de paramètres limité—typiquement 1 à 13 milliards de paramètres—optimisé pour l'inférence efficace sur des appareils grand public, du matériel edge
Reconnaissance vocale (ASR)
La reconnaissance vocale (ASR) est une technologie qui convertit l'audio parlé en texte écrit, utilisant des modèles d'apprentissage automatique entraînés sur de grands corpus de parole pour transcrire avec précision les
Recurrent Neural Network (RNN)
Un Recurrent Neural Network (RNN) est un réseau de neurones qui traite les données séquentielles en maintenant un vecteur d'état caché mis à jour à chaque étape temporelle, permettant aux informations des entrées antérie
Réseau adversaire génératif (GAN)
Un réseau adversaire génératif (GAN) est une architecture à deux réseaux où un générateur produit des données synthétiques et un discriminateur tente de les classer comme réelles ou fausses ; l'entraînement adversaire en
Réseau Neuronal
Un réseau neuronal est un modèle computationnel composé de couches interconnectées d'unités numériques (neurones) qui apprennent à mapper les entrées aux sorties en ajustant les poids des connexions grâce à l'exposition
Synthèse vocale (TTS)
La synthèse vocale (TTS) est une technologie qui convertit du texte écrit en audio parlé synthétisé, utilisant des modèles d'IA entraînés sur des enregistrements de parole humaine pour produire une sortie vocale au son n
Transformer
Un Transformer est une architecture de réseau neuronal centrée sur l'auto-attention, qui permet à chaque position d'une séquence d'accéder directement à chaque autre position simultanément, permettant un entraînement ent

Entraînement

Apprentissage Auto-Supervisé
L'apprentissage auto-supervisé est un paradigme d'entraînement dans lequel un modèle génère son propre signal de supervision à partir de données non étiquetées en résolvant des tâches de prétexte, éliminant le besoin d'a
Apprentissage continu
L'apprentissage continu est un paradigme d'apprentissage automatique dans lequel un modèle apprend à partir d'un flux continu de tâches ou de données au cours du temps tout en conservant ses performances sur les connaiss
Apprentissage fédéré
L'apprentissage fédéré est une technique d'apprentissage automatique qui entraîne un modèle partagé sur de nombreux appareils ou serveurs décentralisés sans centraliser les données brutes, transmettant uniquement les mis
Apprentissage non supervisé
L'apprentissage non supervisé est un paradigme d'apprentissage automatique dans lequel les modèles trouvent des motifs, des structures ou des représentations compactes dans les données sans exemples étiquetés, en utilisa
Apprentissage par renforcement
L'apprentissage par renforcement est un paradigme d'apprentissage automatique dans lequel un agent apprend une politique de prise de décision en interagissant avec un environnement et en recevant des signaux de récompens
Apprentissage par renforcement avec récompenses vérifiables (RLVR)
L'apprentissage par renforcement avec récompenses vérifiables (RLVR) est une approche d'entraînement dans laquelle les signaux de récompense du RL proviennent de critères objectifs et vérifiables par programme—comme la c
Apprentissage par renforcement à partir de retours humains (RLHF)
L'apprentissage par renforcement à partir de retours humains (RLHF) est un pipeline d'entraînement qui collecte les jugements de préférence humains entre les sorties du modèle, entraîne un modèle de récompense sur ces ju
Apprentissage par renforcement à partir de rétroaction d'IA (RLAIF)
L'apprentissage par renforcement à partir de rétroaction d'IA (RLAIF) est une variante du RLHF dans laquelle un modèle d'IA génère les étiquettes de préférence utilisées pour entraîner le modèle de récompense, réduisant
Apprentissage par Transfert
L'apprentissage par transfert est une technique dans laquelle un modèle pré-entraîné sur un grand ensemble de données ou une tâche est adapté à une tâche différente mais connexe, réduisant considérablement le besoin de d
Apprentissage supervisé
L'apprentissage supervisé est un paradigme d'apprentissage automatique dans lequel un modèle est entraîné sur un ensemble de données étiqueté de paires entrée-sortie pour apprendre une fonction de cartographie, puis appl
Augmentation de données
L'augmentation de données est la pratique d'étendre artificiellement un ensemble de données d'entraînement en appliquant des transformations préservant les étiquettes aux exemples existants—tels que le retournement d'ima
Descente de Gradient
La descente de gradient est un algorithme d'optimisation itératif qui entraîne les modèles d'apprentissage automatique en ajustant répétément les paramètres dans la direction qui réduit le plus une fonction de perte, en
Distillation de connaissance
La distillation de connaissance est une technique de compression dans laquelle un petit modèle étudiant est entraîné pour correspondre à la distribution de sortie d'un modèle enseignant plus grand, produisant un modèle c
Données d'entraînement
Les données d'entraînement sont l'ensemble de données étiqueté ou non étiqueté fourni à un modèle d'apprentissage automatique lors du processus d'optimisation, lui permettant d'ajuster les paramètres internes en minimisa
Données synthétiques
Les données synthétiques sont des données générées artificiellement—produites par des algorithmes, des simulations ou des modèles génératifs plutôt que collectées à partir d'événements du monde réel—utilisées pour entraî
Fine-tuning
Le fine-tuning est le processus de poursuite de l'entraînement d'un modèle d'IA pré-entraîné sur un jeu de données plus petit et spécifique à une tâche, afin qu'il fonctionne mieux sur cette tâche. Au lieu de construire
Fonction de Perte
Une fonction de perte est une fonction mathématique qui mesure la divergence entre les prédictions d'un modèle et les véritables valeurs cibles, produisant un score scalaire que les algorithmes d'optimisation minimisent
Grokking
Le grokking est un phénomène de généralisation retardée dans l'entraînement des réseaux de neurones où un modèle mémorise d'abord les données d'entraînement, puis — après un entraînement prolongé bien au-delà du surappre
Instruction tuning
L'instruction tuning est une technique de fine-tuning supervisé qui adapte un modèle de langage pré-entraîné sur des paires instruction-réponse, lui apprenant à suivre des directives en langage naturel plutôt que simplem
Lois de mise à l'échelle
Les lois de mise à l'échelle sont des relations de loi de puissance empiriques montrant que la performance du modèle de langage s'améliore de manière prévisible à mesure que les paramètres du modèle, le volume de données
LoRA (Adaptation à Faible Rang)
LoRA est une technique de fine-tuning efficace en paramètres qui ajoute des paires de matrices de faible rang entraînables aux couches de modèles pré-entraînés gelés, permettant l'adaptation de grands modèles avec une fr
Optimisation directe des préférences (DPO)
L'optimisation directe des préférences (DPO) est un algorithme d'entraînement qui affine les modèles de langage pour les aligner avec les préférences humaines en reformulant l'objectif du RLHF comme une perte de classifi
Oubli Catastrophique
L'oubli catastrophique est la tendance d'un réseau de neurones à perdre abruptement les performances sur les tâches précédemment apprises lorsqu'il est entraîné séquentiellement sur de nouvelles données, car les mises à
Point de contrôle de modèle
Un point de contrôle de modèle est un instantané enregistré des poids d'un réseau neuronal et de l'état de l'optimiseur à un moment spécifique pendant l'entraînement, permettant la reprise après des défaillances matériel
Pré-entraînement
Le pré-entraînement est la phase initiale d'entraînement à grande échelle au cours de laquelle un réseau de neurones apprend les représentations générales à partir d'un corpus massif en utilisant des objectifs auto-super
QLoRA
QLoRA est une méthode de fine-tuning qui quantifie un modèle de base gelé à une précision de 4 bits tout en entraînant des adaptateurs LoRA à une précision plus élevée, permettant aux grands modèles de langage d'être fin
Rétropropagation
La rétropropagation est un algorithme pour calculer le gradient de la perte d'un réseau de neurones par rapport à ses poids en propageant les signaux d'erreur en arrière à travers les couches du réseau, permettant l'opti
Surapprentissage
Le surapprentissage se produit lorsqu'un modèle d'apprentissage automatique apprend trop étroitement les données d'entraînement — y compris leur bruit et leurs idiosyncrasies — résultant en une haute précision sur les ex
Époque
Une époque est un passage complet de l'ensemble des données d'entraînement à travers un modèle d'apprentissage automatique. Les modèles sont généralement entraînés pour plusieurs époques, chaque passage affine les poids

Inférence

Batching
Le batching en inférence de modèle est la pratique de regrouper plusieurs demandes d'entrée et de les traiter ensemble dans un seul passage avant à travers le modèle, améliorant l'utilisation du GPU et le débit. Le batch
Chain-of-Thought (CoT)
Chain-of-Thought (CoT) est une technique de prompting dans laquelle un modèle de langage génère des étapes de raisonnement intermédiaires explicites avant de produire une réponse finale, améliorant considérablement la pr
Context Window
Une fenêtre de contexte est le nombre maximal de tokens qu'un modèle de langage peut traiter en un seul appel d'inférence, couvrant à la fois l'invite d'entrée et la sortie générée. Le dépasser provoque une troncature de
Débit
Le débit en inférence IA est le volume de travail qu'un système de service de modèle traite par unité de temps, couramment exprimé en tokens de sortie par seconde ou en demandes complétées par seconde sur tous les utilis
Inférence
L'inférence est le processus d'application d'un modèle d'apprentissage automatique entraîné à de nouvelles données d'entrée pour produire des prédictions ou des sorties. C'est l'opération au moment du déploiement, distin
KV-Cache
KV-Cache (Key-Value Cache) est un buffer mémoire qui stocke les tenseurs clé et valeur produits par les couches d'attention d'un transformateur pour les tokens déjà traités, éliminant la recomputation redondante lors de
Latence
La latence en inférence IA est le temps écoulé entre la soumission d'une demande à un modèle et la réception de sa réponse, généralement mesuré en millisecondes. Dans les modèles de langage de grande taille, elle est sub
Logits
Les logits sont les scores bruts, non normalisés et à valeurs réelles sortis de la couche linéaire finale d'un réseau de neurones avant la normalisation softmax ; dans les modèles de langage, un logit par jeton de vocabu
Model Serving
Le Model Serving est la couche d'infrastructure qui déploie un modèle ML entraîné pour traiter les demandes de prédiction en temps réel ou par batch, gérant la mise à l'échelle, l'équilibrage de charge, le versioning et
On-Device AI
On-device AI est l'exécution de l'inférence du modèle d'apprentissage automatique directement sur le matériel local d'un utilisateur—téléphone intelligent, ordinateur portable ou puce intégrée—sans transmettre de données
Perplexité
La perplexité est une métrique d'évaluation de modèle de langage définie comme la moyenne exponentielle de la log-vraisemblance négative par token sur un corpus de texte ; une perplexité plus faible signifie que le modèl
Prompt Caching
La mise en cache des prompts est une technique d'API et de services qui stocke l'état du cache KV calculé pour un préfixe de prompt partagé — comme une invite système ou un grand document — et le réutilise entre plusieur
Quantization
La quantization est la technique de représentation des poids d'un réseau de neurones — et optionnellement de ses activations — dans des formats numériques de faible précision tels que INT8 ou INT4 au lieu de la précision
Speculative Decoding
Speculative Decoding est une technique d'inférence qui utilise un petit modèle brouillon pour proposer plusieurs jetons en parallèle, puis les vérifie avec le grand modèle cible en une seule passe avant, réduisant la lat
Streaming
Le streaming en inférence IA est la livraison de la sortie du modèle jeton par jeton au client au fur et à mesure que chaque jeton est généré, plutôt que d'attendre la réponse complète avant de transmettre quoi que ce so
Température
La température est un hyperparamètre scalaire qui divise les logits d'un modèle de langage avant l'étape softmax, contrôlant le caractère aléatoire de la sortie : les valeurs inférieures à 1.0 affûtent la distribution ve
Test-Time Compute
Test-time compute (TTC) est le budget de calcul—cycles de traitement, mémoire et temps—qu'un modèle dépense pendant l'inférence plutôt que pendant l'entraînement, lui permettant de consacrer plus d'efforts aux problèmes
Token
Un token est l'unité de base du texte qu'un modèle de langage traite, généralement un mot, un fragment de sous-mot ou un signe de ponctuation. Dans la prose anglaise courante, un mot correspond à environ 1,3 tokens selon
Tokenization
La tokenization est le processus de division du texte brut en unités discrètes appelées tokens — généralement des fragments de sous-mots — qu'un modèle de langage encode et traite numériquement. Un token représente en mo
Échantillonnage Top-p (Nucleus)
L'échantillonnage Top-p (nucleus) est une stratégie de décodage qui restreint la sélection de jetons au plus petit ensemble de jetons dont la probabilité cumulative atteint un seuil p, adaptant dynamiquement la taille du

Agents

Agent autonome
Un agent autonome est un système IA qui perçoit son environnement, prend des décisions, exécute des actions et itère vers un objectif défini avec une intervention humaine minimale ou nulle entre les étapes, opérant sur d
Agent de Programmation
Un Agent de programmation est un système d'IA qui écrit, édite, teste et débogue de manière autonome des logiciels sur plusieurs fichiers et environnements d'exécution, traduisant les descriptions de tâches de haut nivea
Agent Navigateur
Un Agent navigateur est un système d'IA qui contrôle de manière autonome un navigateur web—en naviguant entre les pages, en cliquant sur les liens, en remplissant les formulaires et en extrayant les informations—pour acc
AI agent
Un agent IA est un système où un modèle de langage ne se contente pas de répondre, mais planifie et exécute des tâches multi-étapes : il appelle des outils et des API, lit les résultats et décide de l'action suivante ver
Appel de fonctions
L'appel de fonctions est une fonction de l'API du modèle de langage, d'abord formalisée par OpenAI en juin 2023, qui permet à un modèle de générer du JSON structuré spécifiant quelle fonction prédéfinie invoquer et avec
Bac à sable
Un bac à sable est un environnement d'exécution isolé qui restreint l'accès d'un agent IA aux systèmes réels, aux réseaux ou aux données, lui permettant d'exécuter du code non fiable ou potentiellement nuisible sans affe
Boucle humaine (HITL)
Boucle humaine (HITL) est un modèle de conception de système dans lequel la supervision humaine est intégrée structurellement à un ou plusieurs points de décision d'un pipeline IA automatisé, exigeant qu'une personne app
Motif ReAct
ReAct (Reasoning + Acting) est un framework de prompting pour les agents d'IA qui intercale les étapes de chaîne de pensée avec des actions discrètes d'utilisation d'outils, permettant au modèle d'observer le résultat de
Mémoire d'agent
La mémoire d'agent fait référence aux mécanismes qu'un agent IA utilise pour stocker, récupérer et mettre à jour des informations à travers les étapes, les sessions ou les tâches — englobant la mémoire de travail en cont
Orchestration d'agents
L'orchestration d'agents est la coordination de plusieurs agents IA par un système superviseur qui achemine les tâches, gère les dépendances et le flux d'informations, et agrège les résultats pour accomplir un objectif m
Planification d'Agent
La planification d'agent est le processus par lequel un agent d'IA décompose un objectif complexe en une séquence ordonnée de sous-tâches ou d'actions, en sélectionnant et en planifiant les étapes pour atteindre un objec
Protocole Agent2Agent (A2A)
Le protocole Agent2Agent (A2A) est une spécification ouverte publiée par Google en avril 2025 qui définit comment les agents IA autonomes se découvrent mutuellement, échangent des tâches et se coordonnent dans différents
Protocole de contexte de modèle (MCP)
Le Protocole de contexte de modèle (MCP) est un standard ouvert publié par Anthropic en novembre 2024 qui définit une interface universelle pour connecter les assistants IA aux outils externes, bases de données et servic
Sous-agent
Un sous-agent est un agent IA invoqué par un agent parent ou orchestrateur pour exécuter une sous-tâche bornée spécifique de manière autonome et retourner les résultats, sans interaction directe avec l'utilisateur final
Système multi-agents
Un système multi-agents (MAS) est une architecture dans laquelle plusieurs agents IA autonomes collaborent, chacun ayant des rôles et des capacités distincts, pour résoudre des tâches trop complexes ou trop grandes pour
Utilisation d'ordinateur
L'utilisation d'ordinateur est une capacité d'IA, d'abord publiée publiquement par Anthropic en octobre 2024, qui permet à un modèle de langage de contrôler l'interface graphique d'un ordinateur — en déplaçant le curseur
Utilisation d'outils
L'utilisation d'outils est la capacité d'un modèle de langage d'IA à invoquer des fonctions externes, des API ou des services — tels que la recherche Web, l'exécution de code ou les requêtes de base de données — pendant
Vibe Coding
Vibe coding est une approche de programmation assistée par l'IA où un développeur décrit le comportement souhaité en langage naturel et un modèle d'IA génère le code correspondant, le développeur se concentrant sur l'int
Workflow agentic
Un workflow agentic est un pipeline structuré dans lequel un ou plusieurs agents IA exécutent des tâches multi-étapes de manière autonome—en utilisant des outils, une mémoire et une logique de décision—pour accomplir un

Sûreté

Alignement de l'IA
L'alignement de l'IA est le domaine de la recherche et de l'ingénierie préoccupé par la garantie que les systèmes IA poursuivent des objectifs et exhibent des comportements cohérents avec les intentions, les valeurs et l
Auto-encodeur Clairsemé
Un auto-encodeur clairsemé (SAE) est un réseau de neurones entraîné à reconstruire les entrées via une grande couche cachée surcomplète — la plupart des unités inactives pour toute entrée donnée — utilisé dans l'interpré
Benchmark
Un benchmark est un ensemble de tests standardisés utilisés pour mesurer et comparer les performances des modèles d'IA sur des tâches définies. Les scores de benchmark fournissent une échelle commune pour suivre les prog
Biais de l'IA
Le biais de l'IA fait référence à des motifs systématiques et biaisés dans les résultats d'un système d'IA qui résultent de données d'entraînement biaisées, d'un cadrage problématique de problèmes ou de choix de concepti
Confidentialité des données
La confidentialité des données en IA fait référence aux pratiques, contrôles techniques et exigences légales qui régissent la manière dont les informations personnelles sont collectées, stockées, utilisées et protégées t
Deepfake
Un deepfake est un contenu généré ou manipulé par l'IA—vidéo, audio ou images—dans lequel la ressemblance physique ou la voix d'une personne est fabriquée ou remplacée pour créer des représentations réalistes mais fausse
Dégradation du Contexte
La dégradation du contexte est la détérioration de la précision du raisonnement et de la récupération d'informations effective d'un modèle de langage à mesure que sa fenêtre de contexte se remplit de texte, ce qui la con
Exploitation de récompense
L'exploitation de récompense est un mode de défaillance de l'apprentissage par renforcement où un agent découvre des stratégies involontaires qui maximisent son signal de récompense numérique sans accomplir la tâche que
Guardrails
Les guardrails sont des mécanismes de sécurité—règles, filtres, classificateurs ou contraintes de politique—appliqués aux systèmes IA pour les empêcher de produire des sorties nuisibles, inappropriées ou violant la polit
Hallucination
Une hallucination est une sortie confiante et fluide d'un modèle de langage IA qui est factuellement incorrecte, fabriquée ou non ancrée dans son entrée ou ses connaissances, produite sans aucune indication d'incertitude
IA Constitutionnelle
L'IA Constitutionnelle est une méthode d'entraînement développée par Anthropic dans laquelle un modèle d'IA critique et révise ses propres résultats selon un ensemble écrit de principes, réduisant la dépendance à l'annot
Interprétabilité
L'interprétabilité est un domaine de recherche en IA visant à comprendre les calculs internes des réseaux de neurones — comment ils représentent les connaissances, prennent des décisions et produisent des résultats — afi
Interprétabilité Méchaniste
L'interprétabilité méchaniste est un sous-domaine de la recherche en IA qui tente de rétro-ingéniérer les calculs internes des réseaux de neurones — en identifiant des circuits spécifiques, des caractéristiques et des al
Jailbreak
Un jailbreak est une technique utilisée pour contourner les directives de sécurité intégrées d'un modèle IA, le poussant à produire du contenu ou à effectuer des actions que ses développeurs ont explicitement conçues pou
Marquage d'IA
Le marquage d'IA est une technique d'intégration de signaux imperceptibles dans le contenu généré par l'IA — texte, images, audio ou vidéo — pour permettre l'identification ultérieure de son origine créée par machine. Il
Modération de contenu
La modération de contenu est le processus d'examen, de filtrage et d'action sur le contenu généré par les utilisateurs sur les plateformes numériques pour appliquer les directives communautaires et les exigences légales,
Prompt Injection
L'injection de prompt est une attaque dans laquelle des instructions malveillantes intégrées dans l'entrée d'un modèle IA dépassent les directives originales du système, le causant à produire des sorties non intentionnel
Red Teaming
Le red teaming est un processus de test adversarial structuré dans lequel une équipe dédiée tente de trouver des défaillances, des sorties nuisibles ou des vulnérabilités de sécurité dans un système IA avant son déploiem
Refus
Un refus est la décision délibérée d'un modèle d'IA de décliner une demande d'utilisateur, généralement parce que l'entraînement de sécurité du système a déterminé que la demande pourrait mener à des résultats nuisibles,
Sécurité de l'IA
La sécurité de l'IA est le domaine interdisciplinaire visant à assurer que les systèmes d'intelligence artificielle fonctionnent de manière fiable, prévisible et sans causer de préjudice involontaire, couvrant la recherc
Évaluation de modèle (Evals)
L'évaluation de modèle (evals) est le processus systématique de mesure des performances, des capacités et des modes de défaillance d'un système d'IA en utilisant des tests structurés. Les evals guident les décisions de d

Matériel

Accélérateur IA
Un accélérateur IA est tout processeur ou bloc matériel — GPU, TPU, NPU, FPGA ou ASIC personnalisé — conçu pour accélérer les calculs matriciels et les opérations de parallélisme de données essentiels à l'entraînement et
ASIC
Un ASIC (Application-Specific Integrated Circuit) est une puce conçue et fabriquée pour exécuter une fonction spécifique unique, offrant des performances et une efficacité énergétique supérieures pour cette tâche par rap
Cluster GPU
Un cluster GPU est un ensemble de serveurs, chacun contenant plusieurs GPUs, interconnectés par une mise en réseau haute vitesse pour agir comme une seule ressource de calcul parallèle pour l'entraînement ou la mise en s
CUDA
CUDA (Compute Unified Device Architecture) est la plateforme de calcul parallèle propriétaire de NVIDIA et le modèle de programmation qui permet aux développeurs d'écrire du code C/C++ exécuté directement sur les GPUs NV
Data center IA
Un data center IA est une installation construite exprès ou fortement rénovée pour héberger des clusters de GPUs et d'accélérateurs, conçue spécifiquement pour gérer la densité de puissance extrême, les demandes de refro
FLOPS
FLOPS (Floating-Point Operations Per Second, opérations en virgule flottante par seconde) mesure le nombre d'opérations arithmétiques en virgule flottante qu'un processeur exécute chaque seconde. C'est le benchmark princ
GPU (unité de traitement graphique)
Un GPU est un processeur initialement conçu pour le rendu graphique informatique, construit autour de milliers de petits noyaux de calcul parallèles. Depuis le début des années 2010, les GPU sont devenus le matériel domi
Interconnect (NVLink, InfiniBand)
Un interconnect est le lien de communication haute vitesse qui transfère des données entre les GPUs au sein d'un serveur (intra-nœud, par ex. NVLink) ou entre des serveurs dans un cluster (inter-nœud, par ex. InfiniBand)
Mémoire à haut débit (HBM)
La mémoire à haut débit (HBM) est une technologie DRAM empilée qui lie plusieurs matrices mémoire verticalement et les connecte à un GPU via un bus interne très large, atteignant des débits mémoire de plusieurs téraoctet
NPU (unité de traitement neuronal)
Un NPU est un bloc matériel dédié intégré dans un système sur puce (SoC) qui accélère l'inférence de réseaux neuronaux localement sur un appareil, permettant des fonctionnalités d'IA — comme la reconnaissance vocale ou l
TPU (unité de traitement tenseur)
Un TPU est un ASIC personnalisé conçu par Google spécifiquement pour accélérer les opérations tenseur — les multiplications matricielles au cœur de l'entraînement et de l'inférence des réseaux de neurones — offrant un dé
VRAM
La VRAM (Video Random Access Memory) est la mémoire dédiée haute vitesse sur un GPU utilisée pour stocker les poids du modèle, les activations et le cache KV pendant l'entraînement et l'inférence IA. Sa capacité est la p

Business

AI Regulation
La réglementation de l'IA fait référence aux lois, règles et normes établies par les gouvernements et les organismes de réglementation pour gouverner le développement, le déploiement et l'utilisation des systèmes d'intel
Aiguille dans la Meule de Foin
L'Aiguille dans la Meule de Foin est un test d'évaluation de contexte long qui mesure si un modèle de langage peut récupérer avec précision un fait planté spécifique (l'« aiguille ») à partir d'un large corpus de texte n
API IA
Une API IA est une interface web standardisée qui permet aux développeurs d'envoyer des données à un modèle IA hébergé et de recevoir du texte généré, des prédictions ou d'autres résultats en retour, sans déployer leur p
ARC-AGI
ARC-AGI (Abstraction and Reasoning Corpus for AGI) est un benchmark de puzzles d'analogie visuelle exigeant que les systèmes déduisent les règles de transformation à partir de quelques exemples de grilles entrée-sortie e
Artificial General Intelligence (AGI)
Artificial General Intelligence (AGI) est un système d'IA hypothétique capable d'effectuer toute tâche intellectuelle qu'un humain peut, correspondant ou surpassant la flexibilité cognitive humaine sur tous les domaines
Artificial Superintelligence (ASI)
Artificial Superintelligence (ASI) est un système d'IA hypothétique dont les capacités cognitives sur chaque domaine dépassent substantiellement celles des humains les plus capables. C'est un concept théorique en 2026, b
Chatbot
Un chatbot est un programme logiciel qui mène des conversations textuelles ou vocales avec les utilisateurs, soit en suivant des arbres de décision prévisionnels, soit, dans les implémentations modernes, en générant des
Cloud GPU (néocloud)
Un cloud GPU, souvent appelé un néocloud, est un fournisseur de cloud qui se spécialise dans la location de clusters GPU haute densité pour l'entraînement et l'inférence IA, plutôt que d'offrir le large portefeuille de s
Compute
Compute, dans les contextes IA, fait référence aux ressources informatiques — principalement la puissance de traitement GPU ou TPU, la mémoire et l'infrastructure de support — requises pour entraîner et exécuter les modè
Copilot
Un copilot est un assistant IA intégré dans une application logicielle qui fournit des suggestions en temps réel, automatise des sous-tâches et répond à des questions en langage naturel, tout en gardant l'utilisateur hum
Enterprise AI
Enterprise AI fait référence au déploiement de systèmes d'intelligence artificielle au sein de grandes organisations pour automatiser les processus, augmenter la prise de décision et générer de la valeur commerciale à gr
EU AI Act
La Loi sur l'IA de l'UE (Règlement (UE) 2024/1689) est la première réglementation horizontale de l'IA au monde adoptée par l'Union européenne en 2024, qui classe les systèmes d'IA par niveau de risque et impose des exige
Fossé IA
Un fossé IA est un avantage concurrentiel durable dans l'intelligence artificielle qui est difficile pour les rivaux de répliquer, tel que les données d'entraînement propriétaires, l'échelle de distribution, les talents
GPQA
GPQA (Graduate-Level Google-Proof Q&A) est un benchmark de 448 questions à choix multiples rédigées par des experts en biologie, chimie et physique, conçues de sorte que les non-spécialistes ne puissent pas y répondre co
HumanEval
HumanEval est un benchmark de génération de code de 164 problèmes de programmation Python écrits à la main créés par OpenAI en 2021, utilisé pour mesurer la capacité d'un modèle de langage à produire du code fonctionnell
Hyperscaler
Un hyperscaler est l'un d'un petit groupe de fournisseurs de cloud — principalement Amazon Web Services, Microsoft Azure et Google Cloud — exploitant une infrastructure de centre de données à l'échelle planétaire avec de
IA Souveraine
L'IA souveraine désigne les efforts nationaux ou régionaux de développer, posséder et contrôler l'infrastructure IA, les modèles et les pipelines de données en interne — plutôt que de dépendre de fournisseurs commerciaux
Laboratoire d'IA
Un laboratoire d'IA est une organisation — à l'intérieur d'une entreprise, d'une université ou d'une organisation à but non lucratif — dédiée à la recherche et à la construction de systèmes d'intelligence artificielle, d
LM Arena
LM Arena est une plateforme d'évaluation d'IA financée par la foule où les utilisateurs comparent deux réponses de modèles anonymes côte à côte et votent pour la meilleure, générant un classement basé sur Elo de la quali
MMLU
MMLU (Massive Multitask Language Understanding) est un repère d'évaluation des modèles de langage sur environ 14 000 questions à choix multiples couvrant 57 sujets académiques — du calcul et de la médecine au droit et à
Open-Source AI
L'open-source AI désigne les modèles d'IA, les frameworks ou les systèmes dont les poids, le code ou l'architecture sont publiquement publiés — permettant à quiconque de télécharger, inspecter, modifier et déployer — par
SWE-bench
SWE-bench est un benchmark qui évalue les systèmes de codage IA sur des tâches réelles d'ingénierie logicielle en les obligeant à résoudre de véritables problèmes GitHub dans des référentiels Python open-source, le succè
Wrapper IA
Un wrapper IA est un produit ou un service construit en appelant une API de modèle d'IA tiers — telle que GPT d'OpenAI ou Claude d'Anthropic — et en ajoutant une interface utilisateur, des modèles de prompt ou une logiqu
Économie des tokens (tarification API)
L'économie des tokens est le modèle de tarification régissant l'accès commercial aux modèles de langage IA via API, où les utilisateurs sont facturés par token — environ 3 à 4 caractères de texte — avec des taux distinct

Techniques et méthodes

Agentic RAG
Agentic RAG est une architecture dans laquelle un modèle de langage agit comme un agent autonome qui décide itérativement quand et quoi récupérer des sources externes, permettant le raisonnement multi-étapes sur les requ
Base de données vectorielle
Une base de données vectorielle est un système de stockage spécialisé pour des vecteurs numériques de haute dimensionnalité, permettant une recherche rapide par plus proches voisins approximés (ANN) sur des millions ou d
Chunking
Le chunking est le processus de division des documents source en segments de texte plus petits avant embedding et stockage dans une base de données vectorielle, permettant une récupération efficace et précise dans les sy
Embedding
Un embedding est un vecteur numérique dense de longueur fixe qui représente des données — du texte, une image ou de l'audio — dans un espace de haute dimensionnalité où les éléments sémantiquement similaires sont géométr
Ingénierie des prompts
L'ingénierie des prompts est la pratique consistant à concevoir et affiner les entrées textuelles pour guider les grands modèles de langage vers des résultats précis, cohérents ou spécifiquement formatés, en utilisant de
Ingénierie du contexte
L'ingénierie du contexte est la pratique consistant à concevoir et assembler délibérément toutes les informations fournies à la fenêtre de contexte d'un modèle de langage — incluant les instructions, les documents récupé
Prompt système
Un prompt système est un ensemble d'instructions fournies à un modèle de langage avant toute entrée utilisateur, définissant sa persona, ses contraintes, son format de sortie et ses règles comportementales qui persistent
RAG (Génération Augmentée par Récupération)
RAG (Génération Augmentée par Récupération) est une technique qui permet à un modèle de langage de récupérer des documents pertinents à partir d'une base de connaissances externe avant de répondre et de fonder sa réponse
Recherche sémantique
La recherche sémantique est une méthode de récupération qui apparie les requêtes aux documents basée sur le sens conceptuel plutôt que sur le chevauchement de mots-clés, utilisant des vecteurs d'embedding et des métrique
Réclassement
Le réclassement est une technique de récupération en deux étapes qui d'abord récupère un large ensemble de candidats en utilisant une méthode rapide de bi-encoder ou basée sur les mots-clés, puis reclasse ces candidats a