Habr AI→ original

VK y HSE crearon un modelo de IA ligero para supresión de ruido y derreverberación en tiempo real

El desarrollador Zakhar Kondaurov, con apoyo de VK y la Escuela de Ingeniería-Matemática de HSE, creó un modelo ligero que maneja tanto la supresión de ruido como la derreverberación de audio en tiempo real a la frecuencia de muestreo completa de 48 kHz. La mayoría de las soluciones existentes manejan estas tareas por separado y funcionan peor en audio de banda completa, lo que dificulta el procesamiento de voz localmente en dispositivos de baja potencia.

Procesado por IA desde Habr AI; editado por Hamidun News
VK y HSE crearon un modelo de IA ligero para supresión de ruido y derreverberación en tiempo real
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Zakhar Kondaurov, desarrollador en la Escuela de Ingeniería y Matemáticas de la Universidad Estatal de Educación Superior, trabajando bajo la dirección de Ivan Beskrovnyi, jefe del equipo de tecnologías de audio de VK Video, ha creado un modelo ligero que resuelve simultáneamente las tareas de supresión de ruido y dereverberación de señales de audio en tiempo real.

Por qué esta tarea es más compleja de lo que parece

La mayoría de la investigación en mejora del habla se limita solo a la supresión de ruido, aunque las arquitecturas modernas permiten resolver un problema más complejo: la supresión conjunta de ruido y dereverberación. La razón radica en un sesgo de la industria: hay significativamente más puntos de referencia y modelos listos para usar para la supresión de ruido que para tratar otras distorsiones de señal, incluida la reverberación, lo que dificulta comparar nuevas soluciones.

  • El autor del proyecto es Zakhar Kondaurov, participante de la Escuela de Ingeniería y Matemáticas de la Universidad Estatal de Educación Superior
  • El trabajo se realizó conjuntamente con VK bajo la dirección de Ivan Beskrovnyi, jefe del equipo de tecnologías de audio de VK Video
  • La mayoría de las soluciones existentes se entrenan con audio a una frecuencia de muestreo de 16 kHz, no a 48 kHz de banda completa
  • La supresión de ruido y la dereverberación se resuelven típicamente de forma secuencial utilizando dos redes neuronales diferentes

Lo que proporciona un modelo de banda completa

La limitación de 16 kHz reduce significativamente el rango de frecuencias en la señal procesada — los armónicos superiores del habla y los detalles finos del sonido se descartan simplemente. Un modelo entrenado en audio de banda completa a 48 kHz preserva considerablemente más información acústica, lo que es importante para servicios de voz como videollamadas y transmisiones en vivo, donde opera el equipo de VK Video.

A menudo, la supresión de ruido y la dereverberación se resuelven actualmente de forma secuencial: primero una red neuronal elimina el ruido extraño, luego una segunda lucha contra el eco y la acústica de la sala. Tal canalización consume más memoria y tiempo de procesamiento que un único modelo que maneja ambas tareas simultáneamente. La combinación de tareas en una arquitectura permite que dispositivos con recursos limitados — teléfonos inteligentes, portátiles, auriculares — procesen el habla localmente sin enviar la secuencia de audio a un servidor, reduciendo así tanto la carga de infraestructura como la latencia de respuesta del sistema.

Qué significa esto

El proyecto demuestra hacia dónde se dirige la industria del procesamiento del habla: en lugar de una cadena de redes neuronales especializadas — un único modelo de banda completa compacto que puede ejecutarse directamente en el dispositivo del usuario, en lugar de enviar audio a través de un servidor para obtener un sonido limpio en una llamada o transmisión.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…