VK e HSE criaram um modelo de IA leve para supressão de ruído e derreverberation em tempo real
O desenvolvedor Zakhar Kondaurov, com apoio da VK e da Escola de Engenharia-Matemática da HSE, criou um modelo leve que realiza supressão de ruído e derreverberation de áudio simultaneamente em tempo real na taxa de amostragem completa de 48 kHz. A maioria das soluções existentes lida com essas tarefas separadamente e funciona pior em áudio de banda completa, dificultando o processamento de fala localmente em dispositivos de baixa potência.
Processado por IA de Habr AI; editado por Hamidun News
Zakhar Kondaurov, desenvolvedor na Escola de Engenharia e Matemática da Universidade Nacional de Pesquisa de Economia, trabalhando sob a orientação de Ivan Beskrovnyi, chefe do time de tecnologias de áudio do VK Video, criou um modelo leve que resolve simultaneamente as tarefas de supressão de ruído e dereverberação de sinais de áudio em tempo real.
Por que essa tarefa é mais complexa do que parece
A maioria das pesquisas em aprimoramento de fala se limita apenas à supressão de ruído, embora arquiteturas modernas permitam resolver um problema mais complexo — supressão conjunta de ruído e dereverberação. A razão está em um viés da indústria: há significativamente mais benchmarks e modelos prontos para supressão de ruído do que para lidar com outras distorções de sinal, incluindo reverberação, tornando difícil comparar novas soluções.
- O autor do projeto é Zakhar Kondaurov, participante da Escola de Engenharia e Matemática da Universidade Nacional de Pesquisa de Economia
- O trabalho foi conduzido conjuntamente com VK sob a orientação de Ivan Beskrovnyi, chefe do time de tecnologias de áudio do VK Video
- A maioria das soluções existentes é treinada em áudio com taxa de amostragem de 16 kHz, não 48 kHz de banda completa
- A supressão de ruído e a dereverberação são tipicamente resolvidas sequencialmente usando duas redes neurais diferentes
O que um modelo de banda completa fornece
A limitação de 16 kHz reduz significativamente a faixa de frequências no sinal processado — harmônicos superiores de fala e detalhes finos de som são simplesmente descartados. Um modelo treinado em áudio de banda completa a 48 kHz preserva consideravelmente mais informações acústicas, o que é importante para serviços de voz como videochamadas e transmissões ao vivo, onde o time do VK Video opera.
Muitas vezes, a supressão de ruído e a dereverberação são atualmente resolvidas sequencialmente: primeiro uma rede neural remove ruído externo, depois uma segunda combate eco e acústica de sala. Tal pipeline consome mais memória e tempo de processamento do que um único modelo que lidar com ambas as tarefas simultaneamente. Combinar tarefas em uma arquitetura permite que dispositivos com recursos limitados — smartphones, laptops, headsets — processem fala localmente sem enviar a transmissão de áudio para um servidor, reduzindo assim carga de infraestrutura e latência de resposta do sistema.
O que isso significa
O projeto demonstra para onde a indústria de processamento de fala está se movimentando: em vez de uma cadeia de redes neurais especializadas — um único modelo de banda completa compacto que pode ser executado diretamente no dispositivo do usuário, em vez de enviar áudio através de um servidor para obter som limpo em uma chamada ou transmissão.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.