SAMPA: نظام قائم على Whisper لكشف حدود نغمة الكلام البرتغالي
طور الباحثون SAMPA — تعديل لـ Whisper large-v3 للكلام البرتغالي. يحدد النظام تلقائياً حدود النغمة بين وحدات الكلام، وتم تدريبه على تسجيلات من مجموعة بيانات NURC-SP، وأظهر نتائج قوية: F1 = 0.731 في الاختبار الرئيسي و F1 = 0.796 في مجموعة بيانات MuPe-Diversidades.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
طور الباحثون SAMPA — نظامًا يعتمد على نموذج Whisper لكشف حدود النبر الموسيقي تلقائيًا (نقاط الفصل بين الوحدات الكلامية) في الكلام البرتغالي البرازيلي. اختبر النظام دقة F1=0.731، وفي اختبار عبر مجموعات البيانات على MuPe-Diversidades حقق F1=0.796.
كيفية عمل SAMPA
يُبنى النظام على Whisper large-v3 — نموذج تحويل الكلام إلى نص متعدد اللغات من OpenAI. قام المؤلفون بضبطه على التسجيلات البرتغالية من مجموعة بيانات NURC-SP (أرشيف الكلام الشفوي البرتغالي البرازيلي) وقاموا بتدريب النموذج على إدراج علامات خاصة في مواقع حدود النبر الموسيقي. تم تدريب النظام على تسجيلات من متحدثين مختلفين وأسلوب كلام مختلف وظروف تسجيل مختلفة، مما ساعده على التعامل مع الأمثلة الجديدة أيضًا.
الجوانب الرئيسية للنهج:
- النموذج الأساسي: Whisper large-v3 من OpenAI
- الضبط الدقيق: مجموعة بيانات NURC-SP مع تسجيلات معلنة يدويًا
- الدقة في الاختبار الرئيسي: F1=0.731
- الدقة في مجموعة بيانات MuPe-Diversidades المستقلة: F1=0.796
- يستخدم النموذج إشارات مورفوتركيبية وداخلية ونبرية
لماذا هذا مهم للبرتغالية
بالنسبة للغة الإنجليزية، معالجة النبر الموسيقي متطورة جيدًا بفضل وفرة البيانات المعلنة وسنوات من البحث. لكن البرتغالية اعتمدت تاريخيًا في الأساس على القواعد والطرق التقليدية للتعلم الآلي — وهذا أقل دقة ومرونة من نهج الشبكات العصبية.
يوضح SAMPA أن نموذجًا كبيرًا مدربًا مسبقًا يمكن تكييفه بشكل فعال مع لغة أخرى باستخدام مجموعة صغيرة نسبيًا من التسجيلات المعلنة. هذا يفتح الباب أمام حلول مماثلة للغات أخرى خارج الإنجليزية — يمكن للروسية والإسبانية والماندرين وغيرها الحصول على أنظمة مماثلة من خلال تكييف Whisper.
ماذا يعني هذا
الكشف الصحيح عن حدود النبر الموسيقي مهم لمعالجة الكلام البرتغالي العملية: يبدو تركيب الكلام الطبيعي مقنعًا أكثر عندما يتم وضع الفترات الزمنية والنبرات بشكل صحيح؛ يصبح الوسم التلقائي للنصوص ممكنًا دون تحرير يدوي؛ يتم تسريع تحليل الوثائق الشفوية وأرشيفات الكلام.
يوضح البحث أن مبدأ التعلم بالنقل يعمل بفعالية — بدلاً من تدريب نموذج من الصفر، قام المؤلفون بتكييف Whisper موجود بالفعل، وهو أسرع بكثير ويتطلب بيانات أقل. يمكن أن يصبح هذا نموذجًا لتطوير معالجة الكلام في لغات ومناطق أخرى.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.