The Decoder→ original

Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena

Alibaba вывела модель синтеза речи Qwen Audio 3.0 TTS Plus на первое место рейтинга Speech Arena от Artificial Analysis. Модель озвучивает текст на 16 языках и даёт управлять стилем речи обычными словами или тегами вроде [angry]. Слабое место — скорость: всего 16 символов в секунду, заметно медленнее конкурентов Sonic 3.5 и Simba 3.2.

Traité par IA depuis The Decoder ; édité par Hamidun News
Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena
Source : The Decoder. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, Alibaba a hissé son modèle de synthèse vocale Qwen Audio 3.0 TTS Plus à la première place du classement SpeechArena d'Artificial Analysis — il vocalise du texte en 16 langues et permet de définir le style de parole avec des mots ordinaires ou des balises comme [angry].

Première place sur SpeechArena

Qwen Audio 3.0 TTS Plus a pris la tête de SpeechArena — le classement public des systèmes de synthèse vocale (text-to-speech) tenu par la société d'analyse Artificial Analysis. Le classement compare les modèles vocaux selon la qualité de la synthèse, et le nouveau modèle d'Alibaba a devancé ses concurrents au classement général.

  • Développeur : Alibaba, modèle Qwen Audio 3.0 TTS Plus
  • Première place au classement SpeechArena d'Artificial Analysis
  • Prise en charge de 16 langues
  • Contrôle du style de parole : description en langage naturel ou balises comme [angry]
  • Vitesse de génération : 16 caractères par seconde, plus lente que Sonic 3.5 et Simba 3.2

Comment donner une émotion à la voix

Le style de parole de Qwen Audio 3.0 TTS Plus peut être contrôlé de deux manières : par une description en langage naturel ou par des balises de service. Par exemple, la balise [angry] fait sonner le modèle de façon irritée. Ce contrôle sur l'intonation distingue les modèles TTS modernes de la synthèse robotique de la génération précédente, où la voix sonnait plate et sans émotion.

La prise en charge de 16 langues élargit son champ d'application : un même modèle peut être utilisé pour la narration de contenu, les assistants vocaux et le doublage sur différents marchés sans changer de moteur.

Pourquoi le modèle est plus lent que ses concurrents

Qwen Audio 3.0 TTS Plus génère la parole à une vitesse de 16 caractères par seconde — nettement plus lente que ses concurrents directs Sonic 3.5 et Simba 3.2. Pour des tâches hors ligne comme la préparation d'un livre audio ou d'une narration préenregistrée, cela n'est pas critique : le fichier n'est de toute façon rendu qu'une seule fois. Mais dans les scénarios en temps réel — agents vocaux et dialogues en direct — cette vitesse se traduit par un délai perceptible entre la saisie du texte et le son.

Il en résulte un compromis caractéristique : Alibaba l'emporte sur la qualité de synthèse, qui est justement ce qu'évalue SpeechArena, mais perd du terrain sur la vitesse. Pour certaines tâches, le naturel de la voix compte davantage ; pour d'autres, c'est la latence minimale.

Première place sur

SpeechArena avec une vitesse de seulement 16 caractères par seconde — c'est ainsi que le classement d'Artificial Analysis décrit le résultat de Qwen Audio 3.0 TTS Plus, comme le rapporte le média The Decoder.

Ce que cela signifie

La domination de Qwen Audio 3.0 TTS Plus montre que la course aux modèles TTS est passée du simple « lire le texte de façon intelligible » au contrôle de l'émotion et du style dans de nombreuses langues. Mais il n'y a pas encore de vainqueur universel : la qualité et la vitesse restent un compromis mutuel, et le choix du modèle dépend de ce qui compte le plus pour la tâche.

Questions fréquentes

Combien de langues

Qwen Audio 3.0 TTS Plus prend-il en charge ?

Le modèle vocalise du texte en 16 langues. Il permet en outre de contrôler le style et l'émotion de la parole via une description en langage naturel ou des balises de service comme [angry].

En quoi

Qwen Audio 3.0 TTS Plus est-il inférieur à ses concurrents ?

Par sa vitesse de synthèse. Le modèle génère 16 caractères par seconde — selon Artificial Analysis, c'est nettement plus lent que ses concurrents Sonic 3.5 et Simba 3.2, ce qui est critique pour les scénarios en temps réel.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…