Hardware

NPU (Unidad de Procesamiento Neural)

Una NPU es un bloque de hardware dedicado integrado en un system-on-chip (SoC) que acelera la inferencia de redes neuronales localmente en un dispositivo, habilitando características de IA — como reconocimiento de voz o mejora de imagen — sin requerir una conexión en la nube.

Una Neural Processing Unit (NPU) es un núcleo de procesador especializado integrado dentro de un system-on-chip, diseñado para ejecutar las multiplicaciones de matrices y funciones de activación de la inferencia de redes neuronales con mucha mayor eficiencia energética que una CPU o GPU de propósito general en el mismo SoC. Las NPU son aceleradores de función fija o casi fija ajustados para los tipos de datos y patrones de operación encontrados en modelos de aprendizaje profundo modernos, particularmente arquitecturas convolucionales y de transformer.

Las NPU típicamente implementan una pequeña matriz sistólica o motor vectorial junto con SRAM dedicado en chip para mantener pesos de modelo cerca de las unidades de cómputo, minimizando el costo energético del movimiento de datos — que domina la potencia total en cargas de trabajo limitadas por memoria. Procesan enteros de 8 bits (INT8) o enteros de 4 bits (INT4) por defecto, explotando la tolerancia de la inferencia de redes neuronales a la aritmética cuantificada. El Neural Engine de Apple, introducido en el A11 Bionic en 2017, y la NPU Hexagon de Qualcomm son ejemplos comerciales tempranos; para 2025, prácticamente cada SoC móvil insignia de Apple, Qualcomm, MediaTek y Samsung incluye una NPU dedicada calificada en decenas de TOPS.

Las NPU importan principalmente para IA en dispositivo: ejecutar modelos localmente preserva la privacidad del usuario, elimina la latencia de red y permite características de IA en entornos sin conexión. Las capacidades de iOS y Android tales como segmentación de fotos en tiempo real, detección de palabra clave de activación, transcripción de voz en vivo e inferencia de modelo de lenguaje pequeño en dispositivo dependen de la aceleración de NPU para cumplir con las restricciones de potencia y térmica de un teléfono inteligente o portátil.

Para 2026, las NPU se han expandido más allá del móvil hacia portátiles — Intel Meteor Lake y Lunar Lake, AMD Ryzen AI y Qualcomm Snapdragon X Elite todos envían bloques NPU calificados. La certificación Copilot+ PC de Microsoft requiere al menos 40 TOPS de rendimiento de NPU, impulsando a los OEM a seleccionar SoC con silicio NPU capaz. La trayectoria apunta hacia ejecutar modelos de mil millones de parámetros localmente, con NPU como el motor de ejecución principal.

Ejemplo

Cuando un usuario de iPhone activa Live Voicemail, el Neural Engine del dispositivo ejecuta el modelo de reconocimiento de voz completamente en chip a menos de un vatio, devolviendo una transcripción en tiempo real sin enviar audio a los servidores de Apple.

Términos relacionados

Últimas noticias sobre el tema

← Glosario