Apple ML Research→ оригинал

Apple ML Research предложила компактные модели для исправления ошибок распознавания речи

Исследователи Apple ML Research в статье «Revisiting ASR Error Correction with Specialized Models» предложили заменить громоздкие LLM компактными seq2seq-моделями для исправления ошибок распознавания речи. Модели обучаются на ошибках из реальных и синтетических аудиозаписей, а синтетика генерируется каскадом «текст в речь → распознавание речи». Ключевой вывод — важнее совпадение разнообразия ошибок с реальным распределением, чем просто объём данных.

AI-обработка оригинала Apple ML Research; редакция Hamidun News
Apple ML Research предложила компактные модели для исправления ошибок распознавания речи
Источник: Apple ML Research. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи Apple ML Research в статье «Revisiting ASR Error Correction with Specialized Models» предложили заменить громоздкие большие языковые модели компактными seq2seq-моделями для исправления ошибок автоматического распознавания речи (ASR).

Почему LLM не идеальны для исправления ошибок ASR

Большинство существующих методов исправления ошибок ASR опираются на текстовые модели, которые ничего не знают о специфических паттернах ошибок именно распознавания речи. В последнее время для этой задачи стали применять большие языковые модели, но у них есть два серьёзных минуса: они добавляют задержку в ответ и склонны к галлюцинациям — то есть могут «исправить» текст так, что он больше не соответствует тому, что реально было сказано в аудио.

Как устроено предложенное решение

Авторы статьи вернулись к идее компактных seq2seq-моделей, обученных на ошибках ASR из реальных и синтетических аудиозаписей. Чтобы масштабировать объём обучающих данных, они строят синтетические корпуса через каскад «синтез речи → распознавание речи» (TTS, затем снова ASR): текст сначала озвучивается синтезатором речи, а затем полученный звук прогоняется через распознаватель, который на выходе даёт реалистичные ошибки для обучения модели-корректора.

  • Метод — компактные seq2seq-модели вместо больших LLM для коррекции ошибок ASR
  • Синтетические обучающие данные генерируются каскадом TTS → ASR
  • Ключевой фактор качества — совпадение разнообразия ошибок с реальным распределением, а не просто объём данных
  • Предложен отдельный подход к декодированию — correction-first decoding

Ключевой вывод исследования: важнее не количество синтетических данных, а то, насколько точно распределение сгенерированных ошибок совпадает с реальными ошибками распознавания речи. Также авторы предлагают отдельную стратегию декодирования — correction-first decoding, при которой этап исправления ошибок выносится в начало процесса обработки.

Что это значит

Работа показывает встречное движение в индустрии голосовых интерфейсов: вместо того чтобы решать проблему ошибок ASR подключением всё более крупных LLM, Apple исследует путь узкоспециализированных компактных моделей — они дешевле в инференсе и менее склонны к галлюцинациям, что критично для голосовых ассистентов, работающих в реальном времени на устройствах с ограниченными ресурсами.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…