NPU (unité de traitement neuronal)
Un NPU est un bloc matériel dédié intégré dans un système sur puce (SoC) qui accélère l'inférence de réseaux neuronaux localement sur un appareil, permettant des fonctionnalités d'IA — comme la reconnaissance vocale ou l'amélioration d'images — sans nécessiter une connexion cloud.
Une unité de traitement neuronal (NPU) est un noyau de processeur spécialisé intégré dans un système sur puce, conçu pour exécuter les multiplications matricielles et les fonctions d'activation de l'inférence de réseaux neuronaux avec une efficacité énergétique bien supérieure à celle d'un CPU ou d'un GPU à usage général dans le même SoC. Les NPU sont des accélérateurs à fonction fixe ou quasi-fixe optimisés pour les types de données et les modèles d'opération trouvés dans les modèles d'apprentissage profond modernes, en particulier les architectures convolutionnelles et de transformer.
Les NPU implémentent généralement un petit réseau systolique ou un moteur vectoriel à côté d'une SRAM dédiée sur puce pour tenir les poids du modèle près des unités de calcul, minimisant le coût énergétique du mouvement de données — ce qui domine la puissance totale dans les charges de travail limitées par la mémoire. Ils traitent les entiers 8 bits (INT8) ou les entiers 4 bits (INT4) par défaut, exploitant la tolérance de l'inférence de réseaux neuronaux pour l'arithmétique quantifiée. Le Neural Engine d'Apple, introduit dans l'A11 Bionic en 2017, et l'NPU Hexagon de Qualcomm sont des exemples commerciaux précoces ; en 2025, pratiquement chaque SoC mobile de premier plan d'Apple, Qualcomm, MediaTek et Samsung inclut un NPU dédié évalué à des dizaines de TOPS.
Les NPU importent principalement pour l'IA sur appareil : exécuter les modèles localement préserve la confidentialité de l'utilisateur, élimine la latence réseau et active les fonctionnalités d'IA dans les environnements hors ligne. Les capacités iOS et Android telles que la segmentation de photos en temps réel, la détection du mot-clé d'activation, la transcription en direct de la parole et l'inférence de petit modèle de langage sur appareil dépendent toutes de l'accélération NPU pour respecter les contraintes énergétiques et thermiques d'un smartphone ou d'un ordinateur portable.
En 2026, les NPU se sont étendus au-delà des appareils mobiles aux ordinateurs portables — Intel Meteor Lake et Lunar Lake, AMD Ryzen AI et Qualcomm Snapdragon X Elite intègrent tous des blocs NPU évalués. La certification Copilot+ PC de Microsoft exige au moins 40 TOPS de performance NPU, poussant les OEM à sélectionner des SoC avec du silicium NPU capable. La tendance indique l'exécution de modèles à milliards de paramètres localement, avec les NPU comme moteur d'exécution principal.