المنسوخات متعددة اللغات والتقطير يساعدان الذكاء الاصطناعي على كشف العاطفة بشكل أفضل في الكلام
قدم العلماء طريقة متعددة الأسلوب لكشف المشاعر في الكلام: يتم دمج الصوت مع النصوص المولدة تلقائياً والمترجمة متعددة اللغات عبر محولات متعددة الأسلوب المتقاطعة. يتم نقل معرفة نموذج "المعلم" هذا بعد ذلك عن طريق التقطير إلى نموذج يعمل مع الصوت فقط. أظهرت التجارب على مجموعة بيانات كبيرة تحسناً كبيراً في دقة تصنيف المشاعر.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
اقترحت مجموعة من الباحثين طريقة متعددة الوسائط لتحليل مشاعر الكلام تجمع بين الصوت والنصوص المُولدة تلقائياً بلغات متعددة من خلال محولات المجال المتقاطع، بالإضافة إلى طريقة لنقل هذه المعرفة إلى نموذج صوتي فقط باستخدام تقطير المعرفة. تم نشر البحث على أرخايف بتاريخ 7 يوليو 2026.
لماذا تحديد مشاعر الكلام صعب
يتطلب التعرف الآلي على المشاعر الإيجابية أو السلبية في الكلام تحليلاً متزامناً لنبرات الصوت وتفسير الكلمات المنطوقة. تعتمد الحلول الموجودة عادة فقط على نماذج الصوت الأساسية، ويبقى غير واضح ما إذا كانت تأخذ في الاعتبار كلا الجانبين في نفس الوقت.
كيفية عمل الطريقة المقترحة
دمج المؤلفون معلومات الصوت والنص من خلال محولات المجال المتقاطع. يتم إنشاء نصوص النصوص تلقائياً بواسطة أداة التعرف على الكلام (ASR)، ثم ترجمتها إلى عدة لغات باستخدام الترجمة الآلية — مما ينتج عنه وسائط نصية متعددة.
- يتم دمج ميزات الصوت والنص متعددة اللغات من خلال معمارية متسلسلة من كتل المحولات متعددة الوسائط التي تدمج الوسائط واحدة تلو الأخرى
- يتم نقل المعرفة من النموذج متعدد الوسائط ("المعلم") من خلال التقطير إلى نموذج صوتي أحادي الوسيط ("الطالب")
- أظهرت التجارب على مجموعة بيانات واسعة النطاق أن معلومات النص المُولدة تلقائياً توفر مكاسب دقة كبيرة في تصنيف المشاعر
- أكدت دراسات الاستئصال أن كلاً من النصوص التلقائية والترجمات التلقائية مفيدة
- يمكن تحسين النموذج الصوتي من خلال التقطير دون زيادة إضافية في العبء الحسابي في وقت الاستدلال
الكود الخاص باستنساخ النتائج متاح بشكل مفتوح على جيتهاب.
ما يعنيه هذا
توضح الطريقة أن نصوص النصوص متعددة اللغات، المُولدة تلقائياً، مفيدة لتحليل المشاعر في الكلام حتى عندما يعمل النموذج النهائي فقط مع الصوت. هذا يعني أنه يمكن نشر مثل هذه الأنظمة حيث لا تتوفر نصوص أثناء الاستدلال، على سبيل المثال في السيناريوهات الفورية، مع الحفاظ على الجودة "الموروثة" من النموذج متعدد الوسائط الأثقل.
الأسئلة الشائعة
لماذا يتم الحاجة إلى ترجمات النص إلى لغات أخرى إذا كان النموذج يفهم
لغة التسجيل على أي حال؟ وفقاً لدراسات الاستئصال الخاصة بالمؤلفين، فإن الترجمات التلقائية للنصوص إلى عدة لغات، جنباً إلى جنب مع النصوص نفسها، توفر دفعة إضافية لدقة تصنيف المشاعر — أثبتت كلا المصدرين فائدتهما.
هل يحتاج النموذج إلى نص أثناء الاستخدام الفعلي؟
لا — بفضل تقطير المعرفة من النموذج "المعلم" متعدد الوسائط إلى نموذج الصوت "الطالب"، يحدد النموذج النهائي مشاعر الكلام من الصوت وحده، بدون نصوص وبدون زيادة إضافية في العبء الحسابي.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.