VK и НИУ ВШЭ создали лёгкую ИИ-модель для шумоподавления и дереверберации в реальном времени
Разработчик Захар Кондауров при поддержке VK и Инженерно-математической школы НИУ ВШЭ создал лёгковесную модель, которая одновременно справляется с шумоподавлением и дереверберацией аудио в реальном времени на полной частоте дискретизации 48 кГц. Большинство существующих решений закрывают эти задачи по отдельности и хуже работают на full-band звуке, что мешает обрабатывать речь локально на слабых устройствах.
AI-обработка оригинала Habr AI; редакция Hamidun News
Разработчик Захар Кондауров в рамках проекта Инженерно-математической школы НИУ ВШЭ и VK, под руководством руководителя команды звуковых технологий VK Видео Ивана Бескровного, создал лёгковесную модель, которая одновременно решает задачи шумоподавления и дереверберации аудиосигнала в реальном времени.
Почему эта задача сложнее, чем кажется
Большинство исследований в области speech enhancement ограничиваются только подавлением шума, хотя современные архитектуры позволяют решать более сложную задачу — совместное шумоподавление и дереверберацию. Причина в перекосе индустрии: бенчмарков и готовых моделей для подавления шума заметно больше, чем для борьбы с другими искажениями сигнала, включая реверберацию, и сравнивать новые решения попросту не с чем.
- Автор проекта — Захар Кондауров, участник Инженерно-математической школы НИУ ВШЭ
- Работа велась совместно с VK под руководством Ивана Бескровного, руководителя команды звуковых технологий VK Видео
- Большинство существующих решений обучены на аудио с частотой дискретизации 16 кГц, а не на full-band 48 кГц
- Шумоподавление и дереверберацию сегодня чаще всего решают последовательно двумя разными нейросетями
Что даёт full-band модель
Ограничение на 16 кГц сильно сужает диапазон частот в обрабатываемом сигнале — верхние гармоники речи и мелкие детали звука просто отбрасываются. Модель, обученная на full-band аудио с частотой 48 кГц, сохраняет заметно больше акустической информации, что важно для голосовых сервисов вроде видеозвонков и трансляций, где как раз работает команда VK Видео.
Зачастую шумоподавление и дереверберацию сегодня решают последовательно: сначала одна нейросеть убирает посторонний шум, затем вторая борется с эхом и гулкостью помещения. Такая цепочка расходует больше памяти и времени обработки, чем единая модель, справляющаяся с обеими задачами сразу. Совмещение задач в одной архитектуре позволяет устройствам с ограниченными ресурсами — смартфонам, ноутбукам, гарнитурам — обрабатывать речь локально, не отправляя аудиопоток на сервер, а значит снижать и нагрузку на инфраструктуру, и задержку ответа системы.
Что это значит
Проект показывает, куда движется индустрия обработки речи: вместо цепочки узкоспециализированных нейросетей — одна компактная full-band модель, которую можно запускать прямо на устройстве пользователя, а не гонять аудио через сервер ради чистого звука в звонке или трансляции.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.