arXiv cs.CL→ оригинал

Мультиязычные транскрипты и дистилляция помогли ИИ точнее определять эмоции в речи

Учёные представили мультимодальный метод определения тональности речи: аудио объединяется с автоматически сгенерированными и переведёнными на несколько языков транскриптами через кросс-модальные трансформеры. Знания такой «учительской» модели затем переносятся дистилляцией в модель, которая работает только с аудио. Эксперименты на большом датасете показали значительный прирост точности классификации тональности.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Мультиязычные транскрипты и дистилляция помогли ИИ точнее определять эмоции в речи
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Группа исследователей предложила мультимодальный метод анализа тональности речи, который объединяет аудио и автоматически сгенерированные многоязычные транскрипты через кросс-модальные трансформеры, а также способ переноса этих знаний в аудио-модель без транскриптов методом дистилляции. Статья опубликована в arXiv 7 июля 2026 года.

Почему определить тональность речи сложно

Автоматическое распознавание тональности — позитивной или негативной — по речи требует одновременно анализа интонаций голоса и интерпретации произнесённых слов. Существующие решения обычно опираются только на аудио-модели (audio foundation models), и остаётся неясным, учитывают ли они оба аспекта одновременно.

Как работает предложенный метод

Авторы объединили аудио и текстовую информацию через кросс-модальные трансформеры. Текстовые транскрипты автоматически создаются инструментом распознавания речи (ASR), а затем переводятся на несколько языков с помощью машинного перевода — так получаются множественные текстовые модальности.

  • Аудио и многоязычные текстовые признаки объединяются каскадной архитектурой из кросс-модальных трансформерных блоков, интегрирующих модальности одну за другой
  • Знания мультимодальной модели («учителя») переносятся методом дистилляции в одномодальную аудио-модель («ученика»)
  • Эксперименты на крупномасштабном датасете показали, что автоматически сгенерированная текстовая информация даёт значительный прирост точности в классификации тональности
  • Аблационное исследование подтвердило: полезны и автоматические транскрипты, и автоматические переводы
  • Аудио-модель можно улучшить дистилляцией без дополнительной вычислительной нагрузки на этапе инференса

Код для воспроизведения результатов выложен в открытый доступ на GitHub.

Что это значит

Метод показывает, что многоязычные текстовые транскрипты, сгенерированные автоматически, полезны для анализа эмоций в речи даже тогда, когда финальная модель работает только с аудио. Это значит, что подобные системы можно применять там, где транскрипт при инференсе недоступен, например в реальном времени, сохраняя качество, «унаследованное» от более тяжёлой мультимодальной модели.

Частые вопросы

Зачем нужны переводы транскрипта на другие языки, если модель и так

понимает язык записи? Согласно аблационному исследованию авторов, автоматические переводы транскриптов на несколько языков наравне с самими транскриптами дают дополнительный прирост точности классификации тональности — полезны оказались оба источника.

Нужен ли модели текст во время реального использования?

Нет — благодаря дистилляции знаний от мультимодального «учителя» к аудио-модели «ученику» итоговая модель определяет тональность речи только по аудио, без транскриптов и без дополнительной вычислительной нагрузки.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…