Apprentissage Profond
L'apprentissage profond est un sous-domaine de l'apprentissage automatique qui entraîne des réseaux de neurones avec de nombreuses couches pour apprendre des représentations hiérarchiques directement à partir de données brutes telles que les pixels, les formes d'onde audio ou les jetons de texte, sans ingénierie de caractéristiques codifiée à la main.
L'apprentissage profond fait référence à l'entraînement de réseaux de neurones avec plusieurs couches cachées — généralement plus de deux, et dans les architectures modernes souvent des dizaines à des milliers. Le mot « profond » désigne simplement la profondeur du nombre de couches du réseau. L'empilement de couches permet au modèle de construire des représentations de plus en plus abstraites : dans un modèle de vision, les premières couches détectent des arêtes de bas niveau, les couches intermédiaires composent celles-ci en formes, et les couches plus profondes reconnaissent des objets sémantiquement significatifs.
Plusieurs développements techniques ont permis aux réseaux profonds de s'entraîner de manière fiable à grande échelle : la fonction d'activation ReLU (qui évite le problème du gradient qui disparaît avec les sigmoid), dropout et normalisation de couche pour la régularisation et un entraînement stable, les connexions résiduelles qui permettent aux gradients de circuler à travers de nombreuses couches (ResNet, 2015), et l'adoption généralisée des GPU pour les opérations matricielles massivement parallèles. De grands ensembles de données curés — ImageNet pour la vision, Common Crawl pour le texte — ont fourni le carburant.
L'apprentissage profond a produit des avancées majeures dans plusieurs disciplines : la classification d'images (AlexNet gagnant ImageNet en 2012 par une grande marge), la traduction automatique (Google Neural Machine Translation, 2016), la stratégie de jeu (AlphaGo, 2016), le repliement des protéines (AlphaFold2, 2020 CASP14), et les médias génératifs. C'est le fondement de tous les grands modèles de langage et des systèmes modernes de vision par ordinateur déployés en production.
En 2026, l'apprentissage profond est la méthodologie par défaut pour toute tâche avec suffisamment de données et de puissance de calcul. Les frontières de recherche actives incluent l'apprentissage auto-supervisé et par peu d'exemples pour réduire les exigences de données étiquetées, la conception d'architectures consciente du matériel (mélange d'experts, sparsité structurée), et le travail théorique pour comprendre la généralisation — pourquoi les réseaux surparamétrisés entraînés à une perte d'entraînement quasi-zéro généralisent toujours bien sur des données non vues.