Habr AI→ оригинал

VK и НИУ ВШЭ создали лёгкую ИИ-модель для шумоподавления и дереверберации в реальном времени

Разработчик Захар Кондауров при поддержке VK и Инженерно-математической школы НИУ ВШЭ создал лёгковесную модель, которая одновременно справляется с шумоподавлением и дереверберацией аудио в реальном времени на полной частоте дискретизации 48 кГц. Большинство существующих решений закрывают эти задачи по отдельности и хуже работают на full-band звуке, что мешает обрабатывать речь локально на слабых устройствах.

AI-обработка оригинала Habr AI; редакция Hamidun News
VK и НИУ ВШЭ создали лёгкую ИИ-модель для шумоподавления и дереверберации в реальном времени
Источник: Habr AI. Коллаж: Hamidun News.
◐ Слушать статью

Разработчик Захар Кондауров в рамках проекта Инженерно-математической школы НИУ ВШЭ и VK, под руководством руководителя команды звуковых технологий VK Видео Ивана Бескровного, создал лёгковесную модель, которая одновременно решает задачи шумоподавления и дереверберации аудиосигнала в реальном времени.

Почему эта задача сложнее, чем кажется

Большинство исследований в области speech enhancement ограничиваются только подавлением шума, хотя современные архитектуры позволяют решать более сложную задачу — совместное шумоподавление и дереверберацию. Причина в перекосе индустрии: бенчмарков и готовых моделей для подавления шума заметно больше, чем для борьбы с другими искажениями сигнала, включая реверберацию, и сравнивать новые решения попросту не с чем.

  • Автор проекта — Захар Кондауров, участник Инженерно-математической школы НИУ ВШЭ
  • Работа велась совместно с VK под руководством Ивана Бескровного, руководителя команды звуковых технологий VK Видео
  • Большинство существующих решений обучены на аудио с частотой дискретизации 16 кГц, а не на full-band 48 кГц
  • Шумоподавление и дереверберацию сегодня чаще всего решают последовательно двумя разными нейросетями

Что даёт full-band модель

Ограничение на 16 кГц сильно сужает диапазон частот в обрабатываемом сигнале — верхние гармоники речи и мелкие детали звука просто отбрасываются. Модель, обученная на full-band аудио с частотой 48 кГц, сохраняет заметно больше акустической информации, что важно для голосовых сервисов вроде видеозвонков и трансляций, где как раз работает команда VK Видео.

Зачастую шумоподавление и дереверберацию сегодня решают последовательно: сначала одна нейросеть убирает посторонний шум, затем вторая борется с эхом и гулкостью помещения. Такая цепочка расходует больше памяти и времени обработки, чем единая модель, справляющаяся с обеими задачами сразу. Совмещение задач в одной архитектуре позволяет устройствам с ограниченными ресурсами — смартфонам, ноутбукам, гарнитурам — обрабатывать речь локально, не отправляя аудиопоток на сервер, а значит снижать и нагрузку на инфраструктуру, и задержку ответа системы.

Что это значит

Проект показывает, куда движется индустрия обработки речи: вместо цепочки узкоспециализированных нейросетей — одна компактная full-band модель, которую можно запускать прямо на устройстве пользователя, а не гонять аудио через сервер ради чистого звука в звонке или трансляции.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…