Apple ML Research→ оригинал

Apple ML Research представила метод генерации видео со звуком по тексту Text-to-Sounding-Video

Исследователи Apple ML Research представили работу по направлению Text-to-Sounding-Video — генерации видео с синхронизированным звуком напрямую из текста. Авторы называют две нерешённые проблемы: интерференцию видео- и аудиосигнала при общем текстовом условии и неясный оптимальный механизм слияния признаков разных модальностей.

AI-обработка оригинала Apple ML Research; редакция Hamidun News
Apple ML Research представила метод генерации видео со звуком по тексту Text-to-Sounding-Video
Источник: Apple ML Research. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи Apple ML Research представили работу по генерации видео с синхронизированным звуком по текстовому описанию — направлению, которое в статье называют Text-to-Sounding-Video (T2SV).

Что такое Text-to-Sounding-Video

T2SV — это задача одновременной генерации видеоряда и звуковой дорожки из одного текстового описания, при этом обе модальности, и видео, и звук, должны быть согласованы именно с этим текстовым условием, а не только друг с другом. Раньше исследователи в основном работали над совместным обучением видео и аудио, но, по словам авторов, две ключевые проблемы в этой области до сих пор не решены.

Какие проблемы решают исследователи

Первая проблема — узкое место в текстовом условии (text conditioning). Если для генерации видео и звука используется один и тот же общий текстовый промпт, в статье это обозначено как TV=TA, между модальностями возникает интерференция: сигнал для видео и сигнал для звука начинают мешать друг другу. Дополнительно усложняет ситуацию разрыв между подробными, насыщенными деталями описаниями, на которых обучают модель, и короткими лаконичными промптами, которые реально пишут пользователи при запросе.

Вторая проблема — отсутствие ясности в том, какой механизм слияния (fusion) признаков разных модальностей оптимален для взаимодействия видео и аудио между собой. Авторы отмечают, что для устранения первой из этих проблем — узкого места в текстовом условии — они предлагают новый подход к обработке условий и взаимодействию модальностей.

  • Направление исследования называется Text-to-Sounding-Video (T2SV)
  • Цель — генерация видео и звука одновременно из одного текстового описания
  • Названы две ключевые нерешённые проблемы: интерференция модальностей при общем тексте и неясный механизм fusion
  • Отдельно отмечен разрыв между подробными тренировочными описаниями и короткими пользовательскими промптами

Почему это сложная задача

В отличие от обычной генерации видео без звука, T2SV требует, чтобы модель одновременно удерживала смысл текста в двух разных модальностях сразу — зрительной и звуковой — и при этом не позволяла одному сигналу заглушать другой. Именно поэтому, как отмечают авторы, простое использование общего текстового описания для обеих модальностей оказывается недостаточным решением: оно провоцирует ту самую интерференцию, о которой говорится в статье. Проблема усугубляется ещё и тем, что реальные пользователи почти никогда не пишут настолько подробные и структурированные промпты, на каких обучалась модель, — а значит, решение, которое хорошо работает на тренировочных данных, не обязательно так же хорошо сработает на коротком запросе конечного пользователя.

Именно этот разрыв между тем, как модель обучают, и тем, как её реально используют, авторы называют одним из главных препятствий на пути к качественной генерации видео со звуком.

Что это значит

Работа Apple ML Research фиксирует конкретные технические барьеры на пути к по-настоящему согласованной генерации видео со звуком по тексту — и то, что крупная исследовательская лаборатория явно называет фундаментальные проблемы нерешёнными, показывает, что до удобных массовых инструментов текст-в-видео-со-звуком индустрии предстоит пройти ещё несколько шагов.

Частые вопросы

Что означает термин Text-to-Sounding-Video?

Это генерация видео вместе с синхронизированным звуком напрямую из текстового описания, при этом оба выходных сигнала, видео и аудио, должны соответствовать именно тексту, а не только совпадать по времени друг с другом.

Какие проблемы мешают такой генерации сегодня?

Авторы называют две: интерференцию между видео- и аудиосигналом при использовании общего текстового условия, дополнительно осложнённую разрывом между подробными тренировочными описаниями и короткими пользовательскими промптами, а также отсутствие ясного оптимального механизма слияния признаков разных модальностей.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…