Apple ML Research→ المصدر

اقترحت Apple ML Research نماذج مدمجة لتصحيح أخطاء التعرف على الكلام

اقترح باحثو Apple ML Research في ورقة "Revisiting ASR Error Correction with Specialized Models" استبدال نماذج LLM الضخمة بنماذج seq2seq مدمجة لتصحيح أخطاء التعرف على الكلام. تُدرب النماذج على الأخطاء من التسجيلات الصوتية الحقيقية والاصطناعية، مع توليد البيانات الاصطناعية بواسطة سلسلة "نص إلى كلام → التعرف على الكلام". الاستنتاج الرئيسي—تطابق تنوع الأخطاء مع التوزيع الحقيقي أكثر أهمية من مجرد حجم البيانات.

معالج بواسطة الذكاء الاصطناعي من Apple ML Research؛ بتحرير Hamidun News
اقترحت Apple ML Research نماذج مدمجة لتصحيح أخطاء التعرف على الكلام
المصدر: Apple ML Research. كولاج: Hamidun News.
◐ استمع للمقال

اقترح الباحثون في Apple ML Research في الورقة البحثية "Revisiting ASR Error Correction with Specialized Models" استبدال نماذج اللغة الكبيرة الضخمة بنماذج seq2seq مدمجة لتصحيح الأخطاء في التعرف الآلي على الكلام (ASR).

لماذا نماذج اللغة الكبيرة ليست مثالية لتصحيح أخطاء ASR

تعتمد معظم الطرق الحالية لتصحيح أخطاء ASR على نماذج نصية لا تعرف شيئاً عن الأنماط المحددة لأخطاء التعرف على الكلام. مؤخراً، بدأ استخدام نماذج اللغة الكبيرة لهذه المهمة، لكنها تحمل عيبين خطيرين: تضيف تأخيراً في الاستجابة وتميل إلى الهلوسة — أي أنها قد تصحح النص بطريقة لا تعود تطابق ما قيل فعلياً في الملف الصوتي.

كيف تعمل الحل المقترح

عاد مؤلفو الورقة إلى فكرة نماذج seq2seq مدمجة تم تدريبها على أخطاء ASR من التسجيلات الصوتية الحقيقية والاصطناعية. لتوسيع نطاق حجم بيانات التدريب، يقومون ببناء مجموعات بيانات اصطناعية من خلال سلسلة من "تركيب الكلام → التعرف على الكلام" (TTS، ثم ASR مرة أخرى): يتم نطق النص أولاً بواسطة مركب الكلام، وبعد ذلك يتم تمرير الصوت الناتج عبر معترف يولد أخطاء واقعية لتدريب نموذج التصحيح.

  • الطريقة — نماذج seq2seq مدمجة بدلاً من نماذج اللغة الكبيرة لتصحيح أخطاء ASR
  • يتم توليد البيانات التدريبية الاصطناعية من خلال سلسلة TTS → ASR
  • عامل الجودة الرئيسي — مطابقة تنوع الأخطاء للتوزيع الحقيقي، وليس فقط حجم البيانات
  • يتم اقتراح نهج فك تشفير منفصل — فك التشفير القائم على التصحيح أولاً

النتيجة الرئيسية للبحث هي أن كمية البيانات الاصطناعية أقل أهمية من دقة مطابقة توزيع الأخطاء المولدة مع أخطاء التعرف الحقيقية على الكلام. يقترح المؤلفون أيضاً استراتيجية فك تشفير منفصلة — فك التشفير القائم على التصحيح أولاً، حيث يتم نقل مرحلة تصحيح الأخطاء إلى بداية خط أنابيب المعالجة.

ماذا يعني هذا

يوضح العمل حركة مضادة في صناعة واجهات الكلام: بدلاً من حل مشكلة أخطاء ASR بربط نماذج لغة كبيرة أكبر فأكبر، تستكشف Apple مسار النماذج المدمجة المتخصصة بشدة — فهي أرخص للاستدلال وأقل عرضة للهلوسة، وهو أمر حاسم للمساعدات الصوتية التي تعمل في الوقت الفعلي على الأجهزة ذات الموارد المحدودة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…