RAG (Génération Augmentée par Récupération)
RAG (Génération Augmentée par Récupération) est une technique qui permet à un modèle de langage de récupérer des documents pertinents à partir d'une base de connaissances externe avant de répondre et de fonder sa réponse sur eux. Elle réduit les hallucinations et garde les réponses actuelles sans réentraîner le modèle.
RAG combine deux composants : un récupérateur et un générateur. Quand une question arrive, le récupérateur la convertit en embedding, recherche une base de données vectorielle de vos documents pour les passages sémantiquement similaires, et remet les meilleures correspondances au modèle de langage comme contexte. Le modèle écrit alors sa réponse fondée sur ces passages au lieu de s'appuyer uniquement sur ce qu'il a mémorisé pendant l'entraînement.
L'approche résout trois problèmes chroniques du LLM à la fois. Fraîcheur des connaissances : vous mettez à jour la base de documents, pas le modèle. Hallucinations : le modèle cite le texte récupéré au lieu d'inventer des faits. Données privées : les wikis d'entreprise, les contrats et les tickets de support n'ont jamais besoin d'entrer dans l'entraînement du modèle — ils restent dans l'index et sont récupérés au moment de la requête.
RAG n'est pas une panacée : la qualité de la réponse est plafonnée par la qualité de la récupération. Si l'étape de recherche retourne des chunks non pertinents, le modèle résumera avec confiance le mauvais matériel. Les systèmes en production investissent donc dans la stratégie de chunking, la recherche hybride (mot-clé + vecteur), le re-ranking et l'évaluation de l'étape de récupération séparément de l'étape de génération.