Hardware

NPU (Neural Processing Unit)

Uma NPU é um bloco de hardware dedicado integrado em um system-on-chip (SoC) que acelera a inferência de redes neurais localmente em um dispositivo, habilitando recursos de IA — como reconhecimento de voz ou aprimoramento de imagem — sem exigir uma conexão com a nuvem.

Uma Neural Processing Unit (NPU) é um núcleo de processador especializado embutido em um system-on-chip, projetado para executar as multiplicações de matriz e funções de ativação de inferência de redes neurais com eficiência energética muito maior do que uma CPU ou GPU de propósito geral no mesmo SoC. As NPUs são aceleradores de função fixa ou quase-fixa otimizados para os tipos de dados e padrões de operação encontrados em modelos modernos de aprendizado profundo, particularmente arquiteturas convolucionais e transformer.

As NPUs típicamente implementam uma pequena matriz sistólica ou mecanismo de vetor junto com SRAM dedicado no chip para manter pesos do modelo perto das unidades de computação, minimizando o custo energético do movimento de dados — que domina a potência total em cargas de trabalho limitadas por memória. Elas processam inteiros de 8 bits (INT8) ou inteiros de 4 bits (INT4) por padrão, explorando a tolerância de inferência de redes neurais para aritmética quantizada. O Neural Engine da Apple, introduzido no A11 Bionic em 2017, e a Hexagon NPU da Qualcomm são exemplos comerciais iniciais; até 2025, praticamente todos os SoCs móveis de ponta da Apple, Qualcomm, MediaTek e Samsung incluem uma NPU dedicada classificada em dezenas de TOPS.

As NPUs importam principalmente para IA no dispositivo: executar modelos localmente preserva a privacidade do usuário, elimina latência de rede e habilita recursos de IA em ambientes offline. Capacidades de iOS e Android como segmentação de foto em tempo real, detecção de wake-word, transcrição de fala ao vivo e inferência de modelo de linguagem pequena no dispositivo dependem de aceleração de NPU para atender aos limites de potência e térmica de um smartphone ou laptop.

Até 2026, as NPUs expandiram além de dispositivos móveis para laptops — Intel Meteor Lake e Lunar Lake, AMD Ryzen AI e Qualcomm Snapdragon X Elite todos possuem blocos NPU classificados. A certificação Copilot+ PC da Microsoft exige pelo menos 40 TOPS de desempenho de NPU, pressionando os OEMs a selecionar SoCs com silício NPU capaz. A trajetória aponta para executar modelos com bilhões de parâmetros localmente, com NPUs como mecanismo de execução primária.

Exemplo

Quando um usuário do iPhone ativa o Live Voicemail, o Neural Engine do dispositivo executa o modelo de reconhecimento de fala inteiramente no chip em menos de um watt, retornando uma transcrição em tempo real sem enviar áudio para os servidores da Apple.

Termos relacionados

Últimas notícias sobre o tema

← Glossário