VK et HSE ont créé un modèle d'IA léger pour la suppression du bruit et la déréverbération en temps réel
Le développeur Zakhar Kondaurov, avec le soutien de VK et de l'École d'Ingénierie-Mathématique de l'HSE, a créé un modèle léger qui gère à la fois la suppression du bruit et la déréverbération audio en temps réel à une fréquence d'échantillonnage complète de 48 kHz. La plupart des solutions existantes traitent ces tâches séparément et fonctionnent moins bien sur l'audio large bande, ce qui rend difficile le traitement de la parole localement sur les appareils à faible puissance.
Traité par IA depuis Habr AI ; édité par Hamidun News
Zakhar Kondaurov, développeur au sein de l'École d'Ingénierie et de Mathématiques de l'Université d'État de Recherche en Économie, travaillant sous la direction d'Ivan Beskrovnyi, chef de l'équipe des technologies audio de VK Video, a créé un modèle léger qui résout simultanément les tâches de suppression du bruit et de déréverbération des signaux audio en temps réel.
Pourquoi cette tâche est plus complexe qu'elle n'y paraît
La plupart des recherches dans l'amélioration de la parole sont limitées à la seule suppression du bruit, bien que les architectures modernes permettent de résoudre un problème plus complexe — la suppression conjointe du bruit et la déréverbération. La raison réside dans un biais de l'industrie : il existe significativement plus de points de repère et de modèles prêts à l'emploi pour la suppression du bruit que pour traiter d'autres distorsions de signal, y compris la réverbération, ce qui rend difficile la comparaison de nouvelles solutions.
- L'auteur du projet est Zakhar Kondaurov, participant à l'École d'Ingénierie et de Mathématiques de l'Université d'État de Recherche en Économie
- Le travail a été mené conjointement avec VK sous la direction d'Ivan Beskrovnyi, chef de l'équipe des technologies audio de VK Video
- La plupart des solutions existantes sont entraînées sur audio à une fréquence d'échantillonnage de 16 kHz, et non 48 kHz en bande complète
- La suppression du bruit et la déréverbération sont généralement résolues séquentiellement en utilisant deux réseaux de neurones différents
Ce qu'un modèle en bande complète fournit
La limitation de 16 kHz réduit considérablement la plage de fréquences du signal traité — les harmoniques supérieures de la parole et les fins détails du son sont simplement écartés. Un modèle entraîné sur audio en bande complète à 48 kHz préserve considérablement plus d'informations acoustiques, ce qui est important pour les services vocaux comme les appels vidéo et les diffusions en direct, où l'équipe de VK Video opère.
Souvent, la suppression du bruit et la déréverbération sont actuellement résolues séquentiellement : d'abord un réseau de neurones supprime le bruit extérieur, puis un second combat l'écho et l'acoustique de la pièce. Un tel pipeline consomme plus de mémoire et de temps de traitement qu'un seul modèle qui traite simultanément les deux tâches. Combiner les tâches dans une seule architecture permet aux appareils aux ressources limitées — smartphones, ordinateurs portables, casques — de traiter la parole localement sans envoyer le flux audio à un serveur, réduisant ainsi la charge d'infrastructure et la latence de réponse du système.
Ce que cela signifie
Le projet démontre la direction que prend l'industrie du traitement de la parole : au lieu d'une chaîne de réseaux de neurones spécialisés — un unique modèle en bande complète compact qui peut s'exécuter directement sur l'appareil de l'utilisateur, plutôt que d'envoyer l'audio via un serveur pour obtenir un son clair dans un appel ou une diffusion.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.