Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena
Alibaba вывела модель синтеза речи Qwen Audio 3.0 TTS Plus на первое место рейтинга Speech Arena от Artificial Analysis. Модель озвучивает текст на 16 языках и даёт управлять стилем речи обычными словами или тегами вроде [angry]. Слабое место — скорость: всего 16 символов в секунду, заметно медленнее конкурентов Sonic 3.5 и Simba 3.2.
Procesado por IA desde The Decoder; editado por Hamidun News
En julio de 2026, Alibaba llevó su modelo de síntesis de voz Qwen Audio 3.0 TTS Plus al primer puesto del ranking SpeechArena de Artificial Analysis: narra texto en 16 idiomas y permite definir el estilo de habla con palabras comunes o etiquetas como [angry].
Primer puesto en SpeechArena
Qwen Audio 3.0 TTS Plus lideró SpeechArena, el ranking público de sistemas de texto a voz que mantiene la empresa de análisis Artificial Analysis. El ranking compara modelos de voz por calidad de síntesis, y el nuevo modelo de Alibaba superó a sus rivales en la clasificación general.
- Desarrollador: Alibaba, modelo Qwen Audio 3.0 TTS Plus
- Primer puesto en el ranking SpeechArena de Artificial Analysis
- Compatibilidad con 16 idiomas
- Control del estilo de habla: descripción en lenguaje natural o etiquetas como [angry]
- Velocidad de generación: 16 caracteres por segundo, más lenta que Sonic 3.5 y Simba 3.2
Cómo dar emoción a la voz
El estilo de habla en Qwen Audio 3.0 TTS Plus se puede controlar de dos maneras: con una descripción en lenguaje natural o con etiquetas de servicio. Por ejemplo, la etiqueta [angry] hace que el modelo suene irritado. Este control sobre la entonación distingue a los modelos TTS modernos de la síntesis robótica de la generación anterior, donde la voz sonaba plana y sin emoción.
La compatibilidad con 16 idiomas amplía su aplicación: el mismo modelo puede usarse para narrar contenido, asistentes de voz y doblaje en distintos mercados sin cambiar de motor.
Por qué el modelo es más lento que sus competidores
Qwen Audio 3.0 TTS Plus genera voz a una velocidad de 16 caracteres por segundo, notablemente más lenta que sus rivales directos Sonic 3.5 y Simba 3.2. Para tareas offline, como preparar un audiolibro o una narración pregrabada, esto no es crítico: el archivo se renderiza una sola vez de todos modos. Pero en escenarios en tiempo real —agentes de voz y diálogos en vivo— esa velocidad implica un retraso perceptible entre la entrada de texto y el sonido.
El resultado es un compromiso característico: Alibaba gana en calidad de síntesis, que es justo lo que evalúa SpeechArena, pero pierde en velocidad. Para algunas tareas importa más la naturalidad de la voz; para otras, la latencia mínima.
Primer puesto en
SpeechArena con una velocidad de solo 16 caracteres por segundo: así describe el ranking de Artificial Analysis el resultado de Qwen Audio 3.0 TTS Plus, según informa el medio The Decoder.
Qué significa esto
El liderazgo de Qwen Audio 3.0 TTS Plus muestra que la carrera de los modelos TTS ha pasado de simplemente "leer el texto de forma inteligible" a controlar la emoción y el estilo en muchos idiomas. Pero todavía no hay un ganador universal: la calidad y la velocidad siguen siendo un compromiso mutuo, y la elección del modelo depende de qué es más importante para cada tarea.
Preguntas frecuentes
¿Cuántos idiomas admite Qwen Audio 3.0 TTS Plus?
El modelo narra texto en 16 idiomas. Además, permite controlar el estilo y la emoción del habla mediante una descripción en lenguaje natural o etiquetas de servicio como [angry].
¿En qué es inferior
Qwen Audio 3.0 TTS Plus frente a sus competidores?
En la velocidad de síntesis. El modelo genera 16 caracteres por segundo; según Artificial Analysis, esto es notablemente más lento que sus competidores Sonic 3.5 y Simba 3.2, algo crítico para escenarios en tiempo real.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.