NPU (Unidad de Procesamiento Neural)
Una NPU es un bloque de hardware dedicado integrado en un system-on-chip (SoC) que acelera la inferencia de redes neuronales localmente en un dispositivo, habilitando características de IA — como reconocimiento de voz o mejora de imagen — sin requerir una conexión en la nube.
Una Neural Processing Unit (NPU) es un núcleo de procesador especializado integrado dentro de un system-on-chip, diseñado para ejecutar las multiplicaciones de matrices y funciones de activación de la inferencia de redes neuronales con mucha mayor eficiencia energética que una CPU o GPU de propósito general en el mismo SoC. Las NPU son aceleradores de función fija o casi fija ajustados para los tipos de datos y patrones de operación encontrados en modelos de aprendizaje profundo modernos, particularmente arquitecturas convolucionales y de transformer.
Las NPU típicamente implementan una pequeña matriz sistólica o motor vectorial junto con SRAM dedicado en chip para mantener pesos de modelo cerca de las unidades de cómputo, minimizando el costo energético del movimiento de datos — que domina la potencia total en cargas de trabajo limitadas por memoria. Procesan enteros de 8 bits (INT8) o enteros de 4 bits (INT4) por defecto, explotando la tolerancia de la inferencia de redes neuronales a la aritmética cuantificada. El Neural Engine de Apple, introducido en el A11 Bionic en 2017, y la NPU Hexagon de Qualcomm son ejemplos comerciales tempranos; para 2025, prácticamente cada SoC móvil insignia de Apple, Qualcomm, MediaTek y Samsung incluye una NPU dedicada calificada en decenas de TOPS.
Las NPU importan principalmente para IA en dispositivo: ejecutar modelos localmente preserva la privacidad del usuario, elimina la latencia de red y permite características de IA en entornos sin conexión. Las capacidades de iOS y Android tales como segmentación de fotos en tiempo real, detección de palabra clave de activación, transcripción de voz en vivo e inferencia de modelo de lenguaje pequeño en dispositivo dependen de la aceleración de NPU para cumplir con las restricciones de potencia y térmica de un teléfono inteligente o portátil.
Para 2026, las NPU se han expandido más allá del móvil hacia portátiles — Intel Meteor Lake y Lunar Lake, AMD Ryzen AI y Qualcomm Snapdragon X Elite todos envían bloques NPU calificados. La certificación Copilot+ PC de Microsoft requiere al menos 40 TOPS de rendimiento de NPU, impulsando a los OEM a seleccionar SoC con silicio NPU capaz. La trayectoria apunta hacia ejecutar modelos de mil millones de parámetros localmente, con NPU como el motor de ejecución principal.