VK y HSE crearon un modelo de IA ligero para supresión de ruido y derreverberación en tiempo real
El desarrollador Zakhar Kondaurov, con apoyo de VK y la Escuela de Ingeniería-Matemática de HSE, creó un modelo ligero que maneja tanto la supresión de ruido como la derreverberación de audio en tiempo real a la frecuencia de muestreo completa de 48 kHz. La mayoría de las soluciones existentes manejan estas tareas por separado y funcionan peor en audio de banda completa, lo que dificulta el procesamiento de voz localmente en dispositivos de baja potencia.
Procesado por IA desde Habr AI; editado por Hamidun News
Zakhar Kondaurov, desarrollador en la Escuela de Ingeniería y Matemáticas de la Universidad Estatal de Educación Superior, trabajando bajo la dirección de Ivan Beskrovnyi, jefe del equipo de tecnologías de audio de VK Video, ha creado un modelo ligero que resuelve simultáneamente las tareas de supresión de ruido y dereverberación de señales de audio en tiempo real.
Por qué esta tarea es más compleja de lo que parece
La mayoría de la investigación en mejora del habla se limita solo a la supresión de ruido, aunque las arquitecturas modernas permiten resolver un problema más complejo: la supresión conjunta de ruido y dereverberación. La razón radica en un sesgo de la industria: hay significativamente más puntos de referencia y modelos listos para usar para la supresión de ruido que para tratar otras distorsiones de señal, incluida la reverberación, lo que dificulta comparar nuevas soluciones.
- El autor del proyecto es Zakhar Kondaurov, participante de la Escuela de Ingeniería y Matemáticas de la Universidad Estatal de Educación Superior
- El trabajo se realizó conjuntamente con VK bajo la dirección de Ivan Beskrovnyi, jefe del equipo de tecnologías de audio de VK Video
- La mayoría de las soluciones existentes se entrenan con audio a una frecuencia de muestreo de 16 kHz, no a 48 kHz de banda completa
- La supresión de ruido y la dereverberación se resuelven típicamente de forma secuencial utilizando dos redes neuronales diferentes
Lo que proporciona un modelo de banda completa
La limitación de 16 kHz reduce significativamente el rango de frecuencias en la señal procesada — los armónicos superiores del habla y los detalles finos del sonido se descartan simplemente. Un modelo entrenado en audio de banda completa a 48 kHz preserva considerablemente más información acústica, lo que es importante para servicios de voz como videollamadas y transmisiones en vivo, donde opera el equipo de VK Video.
A menudo, la supresión de ruido y la dereverberación se resuelven actualmente de forma secuencial: primero una red neuronal elimina el ruido extraño, luego una segunda lucha contra el eco y la acústica de la sala. Tal canalización consume más memoria y tiempo de procesamiento que un único modelo que maneja ambas tareas simultáneamente. La combinación de tareas en una arquitectura permite que dispositivos con recursos limitados — teléfonos inteligentes, portátiles, auriculares — procesen el habla localmente sin enviar la secuencia de audio a un servidor, reduciendo así tanto la carga de infraestructura como la latencia de respuesta del sistema.
Qué significa esto
El proyecto demuestra hacia dónde se dirige la industria del procesamiento del habla: en lugar de una cadena de redes neuronales especializadas — un único modelo de banda completa compacto que puede ejecutarse directamente en el dispositivo del usuario, en lugar de enviar audio a través de un servidor para obtener un sonido limpio en una llamada o transmisión.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.