The Decoder→ оригинал

Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena

Alibaba вывела модель синтеза речи Qwen Audio 3.0 TTS Plus на первое место рейтинга Speech Arena от Artificial Analysis. Модель озвучивает текст на 16 языках и даёт управлять стилем речи обычными словами или тегами вроде [angry]. Слабое место — скорость: всего 16 символов в секунду, заметно медленнее конкурентов Sonic 3.5 и Simba 3.2.

AI-обработка оригинала The Decoder; редакция Hamidun News
Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena
Источник: The Decoder. Коллаж: Hamidun News.
◐ Слушать статью

Alibaba в июле 2026 года вывела модель синтеза речи Qwen Audio 3.0 TTS Plus на первое место рейтинга Speech Arena от Artificial Analysis — она озвучивает текст на 16 языках и позволяет задавать стиль речи обычными словами или тегами вроде [angry].

Первое место в Speech Arena

Qwen Audio 3.0 TTS Plus возглавила Speech Arena — публичный leaderboard систем text-to-speech, который ведёт аналитическая компания Artificial Analysis. Рейтинг сравнивает голосовые модели по качеству синтеза, и новая модель Alibaba обошла соперников в общем зачёте.

  • Разработчик — Alibaba, модель Qwen Audio 3.0 TTS Plus
  • Первое место в рейтинге Speech Arena от Artificial Analysis
  • Поддержка 16 языков
  • Управление стилем речи: описание на естественном языке или теги вроде [angry]
  • Скорость генерации — 16 символов в секунду, медленнее Sonic 3.5 и Simba 3.2

Как задать эмоцию голосу

Стилем речи в Qwen Audio 3.0 TTS Plus можно управлять двумя способами: описанием на естественном языке или служебными тегами. Например, тег [angry] заставляет модель звучать раздражённо. Такой контроль над интонацией отличает современные TTS-модели от роботизированного синтеза прошлого поколения, где голос звучал ровно и безэмоционально.

Поддержка 16 языков расширяет применение: одну и ту же модель можно использовать для озвучки контента, голосовых ассистентов и дубляжа на разных рынках без смены движка.

Почему модель медленнее конкурентов

Qwen Audio 3.0 TTS Plus генерирует речь со скоростью 16 символов в секунду — заметно медленнее прямых соперников Sonic 3.5 и Simba 3.2. Для офлайн-задач вроде подготовки аудиокниг или заранее записанной озвучки это некритично: файл всё равно рендерится один раз. А вот в сценариях реального времени — голосовых агентах и живых диалогах — такая скорость означает ощутимую задержку между вводом текста и звуком.

Получается характерный размен: Alibaba выигрывает по качеству синтеза, которое и оценивает Speech Arena, но проигрывает по скорости. Для одних задач важнее естественность голоса, для других — минимальная задержка.

Первое место в

Speech Arena при скорости всего 16 символов в секунду — так результат Qwen Audio 3.0 TTS Plus описывает рейтинг Artificial Analysis, о чём сообщает издание The Decoder.

Что это значит

Лидерство Qwen Audio 3.0 TTS Plus показывает, что гонка TTS-моделей сместилась от простого «разборчиво прочитать текст» к контролю над эмоцией и стилем на многих языках. Но универсального победителя пока нет: качество и скорость остаются взаимным разменом, и выбор модели зависит от того, что для задачи важнее.

Частые вопросы

Сколько языков поддерживает Qwen Audio 3.0 TTS Plus?

Модель озвучивает текст на 16 языках. Дополнительно она позволяет управлять стилем и эмоцией речи через описание на естественном языке или служебные теги вроде [angry].

Чем Qwen Audio 3.0 TTS Plus уступает конкурентам?

Скоростью синтеза. Модель генерирует 16 символов в секунду — по данным Artificial Analysis, это заметно медленнее конкурентов Sonic 3.5 и Simba 3.2, что критично для сценариев реального времени.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…