The Decoder→ المصدر

Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena

Alibaba вывела модель синтеза речи Qwen Audio 3.0 TTS Plus на первое место рейтинга Speech Arena от Artificial Analysis. Модель озвучивает текст на 16 языках и даёт управлять стилем речи обычными словами или тегами вроде [angry]. Слабое место — скорость: всего 16 символов в секунду, заметно медленнее конкурентов Sonic 3.5 и Simba 3.2.

معالج بواسطة الذكاء الاصطناعي من The Decoder؛ بتحرير Hamidun News
Qwen Audio 3.0 TTS Plus от Alibaba возглавила рейтинг синтеза речи Speech Arena
المصدر: The Decoder. كولاج: Hamidun News.
◐ استمع للمقال

في يوليو 2026، دفعت Alibaba نموذجها لتركيب الكلام Qwen Audio 3.0 TTS Plus إلى المركز الأول في تصنيف SpeechArena الصادر عن Artificial Analysis — وهو يحوّل النص إلى صوت بـ16 لغة ويتيح تحديد أسلوب الكلام بكلمات عادية أو بوسوم مثل [angry].

المركز الأول في SpeechArena

تصدّر Qwen Audio 3.0 TTS Plus تصنيف SpeechArena — وهو التصنيف العام لأنظمة تحويل النص إلى كلام الذي تديره شركة التحليلات Artificial Analysis. يقارن التصنيف النماذج الصوتية من حيث جودة التركيب، وقد تفوّق نموذج Alibaba الجديد على منافسيه في الترتيب العام.

  • المطوّر: Alibaba، النموذج Qwen Audio 3.0 TTS Plus
  • المركز الأول في تصنيف SpeechArena الصادر عن Artificial Analysis
  • دعم 16 لغة
  • التحكم في أسلوب الكلام: وصف بلغة طبيعية أو وسوم مثل [angry]
  • سرعة التوليد: 16 حرفًا في الثانية، أبطأ من Sonic 3.5 و Simba 3.2

كيف يمكن إضفاء العاطفة على الصوت

يمكن التحكم في أسلوب الكلام في Qwen Audio 3.0 TTS Plus بطريقتين: عبر وصف بلغة طبيعية أو عبر وسوم خدمية. فعلى سبيل المثال، يجعل الوسم [angry] النموذج يبدو منفعلًا. هذا النوع من التحكم في التنغيم يميّز نماذج TTS الحديثة عن التركيب الآلي الجامد لجيل سابق، حيث كان الصوت يبدو رتيبًا وخاليًا من العاطفة.

يوسّع دعم 16 لغة نطاق الاستخدام: يمكن استخدام النموذج نفسه لتعليق المحتوى صوتيًا، والمساعدين الصوتيين، والدبلجة في أسواق مختلفة دون تغيير المحرك.

لماذا النموذج أبطأ من منافسيه

يولّد Qwen Audio 3.0 TTS Plus الكلام بسرعة 16 حرفًا في الثانية — وهي أبطأ بشكل ملحوظ من منافسيه المباشرين Sonic 3.5 و Simba 3.2. بالنسبة للمهام غير المتصلة، مثل إعداد كتاب صوتي أو تعليق مسجّل مسبقًا، لا يُعدّ ذلك أمرًا حاسمًا: فالملف يُصيَّر مرة واحدة على أي حال. أما في سيناريوهات الوقت الفعلي — كالوكلاء الصوتيين والحوارات المباشرة — فإن هذه السرعة تعني تأخيرًا ملموسًا بين إدخال النص وصدور الصوت.

والنتيجة مفاضلة مميزة: تفوز Alibaba من حيث جودة التركيب، وهي بالضبط ما يقيّمه SpeechArena، لكنها تخسر من حيث السرعة. بالنسبة لبعض المهام تكون طبيعية الصوت أهم، وبالنسبة لأخرى يكون الحد الأدنى من زمن الاستجابة هو الأهم.

المركز الأول في

SpeechArena بسرعة لا تتجاوز 16 حرفًا في الثانية — هكذا يصف تصنيف Artificial Analysis نتيجة Qwen Audio 3.0 TTS Plus، بحسب ما ذكرته صحيفة The Decoder.

ما الذي يعنيه هذا

تُظهر ريادة Qwen Audio 3.0 TTS Plus أن سباق نماذج TTS تحوّل من مجرد «قراءة النص بوضوح» إلى التحكم في العاطفة والأسلوب بلغات عديدة. لكن لا يوجد بعد فائز شامل: تبقى الجودة والسرعة مفاضلة متبادلة، ويعتمد اختيار النموذج على ما هو الأهم بالنسبة للمهمة.

أسئلة شائعة

كم لغة يدعمها Qwen Audio 3.0 TTS Plus?

يحوّل النموذج النص إلى صوت بـ16 لغة. كما يتيح أيضًا التحكم في أسلوب الكلام وعاطفته عبر وصف بلغة طبيعية أو وسوم خدمية مثل [angry].

فيمَ يتراجع Qwen Audio 3.0 TTS Plus أمام منافسيه?

في سرعة التركيب. يولّد النموذج 16 حرفًا في الثانية — وبحسب Artificial Analysis، فهذا أبطأ بشكل ملحوظ من منافسيه Sonic 3.5 و Simba 3.2، وهو أمر حاسم في سيناريوهات الوقت الفعلي.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…