Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena
Alibaba вывела модель синтеза речи Qwen Audio 3.0 TTS Plus на первое место рейтинга Speech Arena от Artificial Analysis. Модель озвучивает текст на 16 языках и даёт управлять стилем речи обычными словами или тегами вроде [angry]. Слабое место — скорость: всего 16 символов в секунду, заметно медленнее конкурентов Sonic 3.5 и Simba 3.2.
Traité par IA depuis The Decoder ; édité par Hamidun News
En juillet 2026, Alibaba a hissé son modèle de synthèse vocale Qwen Audio 3.0 TTS Plus à la première place du classement SpeechArena d'Artificial Analysis — il vocalise du texte en 16 langues et permet de définir le style de parole avec des mots ordinaires ou des balises comme [angry].
Première place sur SpeechArena
Qwen Audio 3.0 TTS Plus a pris la tête de SpeechArena — le classement public des systèmes de synthèse vocale (text-to-speech) tenu par la société d'analyse Artificial Analysis. Le classement compare les modèles vocaux selon la qualité de la synthèse, et le nouveau modèle d'Alibaba a devancé ses concurrents au classement général.
- Développeur : Alibaba, modèle Qwen Audio 3.0 TTS Plus
- Première place au classement SpeechArena d'Artificial Analysis
- Prise en charge de 16 langues
- Contrôle du style de parole : description en langage naturel ou balises comme [angry]
- Vitesse de génération : 16 caractères par seconde, plus lente que Sonic 3.5 et Simba 3.2
Comment donner une émotion à la voix
Le style de parole de Qwen Audio 3.0 TTS Plus peut être contrôlé de deux manières : par une description en langage naturel ou par des balises de service. Par exemple, la balise [angry] fait sonner le modèle de façon irritée. Ce contrôle sur l'intonation distingue les modèles TTS modernes de la synthèse robotique de la génération précédente, où la voix sonnait plate et sans émotion.
La prise en charge de 16 langues élargit son champ d'application : un même modèle peut être utilisé pour la narration de contenu, les assistants vocaux et le doublage sur différents marchés sans changer de moteur.
Pourquoi le modèle est plus lent que ses concurrents
Qwen Audio 3.0 TTS Plus génère la parole à une vitesse de 16 caractères par seconde — nettement plus lente que ses concurrents directs Sonic 3.5 et Simba 3.2. Pour des tâches hors ligne comme la préparation d'un livre audio ou d'une narration préenregistrée, cela n'est pas critique : le fichier n'est de toute façon rendu qu'une seule fois. Mais dans les scénarios en temps réel — agents vocaux et dialogues en direct — cette vitesse se traduit par un délai perceptible entre la saisie du texte et le son.
Il en résulte un compromis caractéristique : Alibaba l'emporte sur la qualité de synthèse, qui est justement ce qu'évalue SpeechArena, mais perd du terrain sur la vitesse. Pour certaines tâches, le naturel de la voix compte davantage ; pour d'autres, c'est la latence minimale.
Première place sur
SpeechArena avec une vitesse de seulement 16 caractères par seconde — c'est ainsi que le classement d'Artificial Analysis décrit le résultat de Qwen Audio 3.0 TTS Plus, comme le rapporte le média The Decoder.
Ce que cela signifie
La domination de Qwen Audio 3.0 TTS Plus montre que la course aux modèles TTS est passée du simple « lire le texte de façon intelligible » au contrôle de l'émotion et du style dans de nombreuses langues. Mais il n'y a pas encore de vainqueur universel : la qualité et la vitesse restent un compromis mutuel, et le choix du modèle dépend de ce qui compte le plus pour la tâche.
Questions fréquentes
Combien de langues
Qwen Audio 3.0 TTS Plus prend-il en charge ?
Le modèle vocalise du texte en 16 langues. Il permet en outre de contrôler le style et l'émotion de la parole via une description en langage naturel ou des balises de service comme [angry].
En quoi
Qwen Audio 3.0 TTS Plus est-il inférieur à ses concurrents ?
Par sa vitesse de synthèse. Le modèle génère 16 caractères par seconde — selon Artificial Analysis, c'est nettement plus lent que ses concurrents Sonic 3.5 et Simba 3.2, ce qui est critique pour les scénarios en temps réel.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.