Apple ML Research→ المصدر

أبل تؤكد: نماذج الانتشار الكلامية تتسع مثل النماذج الانحدارية الذاتية

نشرت Apple ML Research دراسة حول قوانين التوسع لنماذج لغة الكلام باستخدام الانتشار المستمر (CD SLM). تتسع نماذج CD بنفس القدر من القابلية للتنبؤ مثل النماذج الانحدارية الذاتية: تنخفض الخسارة مع زيادة الحوسبة. تم إدخال مقياس pJSD جديد لقياس صحيح للجودة اللغوية للكلام بدون نص وسيط.

معالج بواسطة الذكاء الاصطناعي من Apple ML Research؛ بتحرير Hamidun News
أبل تؤكد: نماذج الانتشار الكلامية تتسع مثل النماذج الانحدارية الذاتية
المصدر: Apple ML Research. كولاج: Hamidun News.
◐ استمع للمقال

أثبتت Apple ML Research أن الشبكات العصبية للكلام تتسع بشكل يمكن التنبؤ به بنفس الطريقة التي تتسع بها نماذج النص، وذلك بفضل مقياس pJSD الجديد، على الرغم من أن أنظمة الكلام لا تزال متخلفة عن أنظمة النص من حيث الجودة.

لماذا نماذج الكلام متخلفة عن نماذج النص

نماذج اللغة التي تعمل مباشرة مع الصوت بدون تمثيل نصي وسيط — ما يسمى بـ SLM الخاصة بالكلام فقط — تتخلف حالياً بشكل كبير عن الأنظمة النصية والمتعددة الأنماط. يبدو هذا متناقضاً: واجهات الصوت مطلوبة، بيانات الصوت وفيرة، لكن التقدم بطيء.

النهج السائد — SLM الانحدار التلقائي المنفصل (AR SLM) — يحول أولاً الإشارات الصوتية المستمرة إلى رموز منفصلة، بطريقة مشابهة لكيفية عمل نماذج النص مع الكلمات. المشكلة هي أن الكلام مختلف بشكل أساسي عن اللغة المكتوبة: التقطيع حتماً يفقد التفاصيل الصوتية التي تحمل معنى دلالياً. لتعويض هذه الخسائر، تتطلب نماذج AR موارد حسابية ضخمة وبيانات تدريب ضخمة جداً — مما يجعلها مكلفة وصعبة التوسع.

كيفية تجنب الانتشار المستمر للقيود

الانتشار المستمر (CD) يقدم نهجاً مختلفاً بشكل جذري: العمل مباشرة مع التمثيلات المستمرة لإشارات الصوت، متجنباً بالكامل التقطيع. هذا يلغي فقدان المعلومات في الإدخال وقد يجعل التدريب أكثر كفاءة.

ومع ذلك، ظل السؤال الرئيسي قائماً: هل تطيع نماذج CD قوانين التوسع؟ أصبحت هذه القوانين نفسها أساس نماذج اللغة الكبيرة الحديثة — تتنبأ بكيفية تحسن الجودة مع زيادة المعاملات وتوسع حجم البيانات. بدون توسع يمكن التنبؤ به، الاستثمار في موارد كبيرة في الهندسة المعمارية محفوف بالمخاطر: لا توجد ضمانات بأن الاستثمارات ستؤتي ثمارها.

حققت Apple في نوعي المقاييس. النتائج الرئيسية:

  • تُظهر CD SLM قوانين توسع واضحة لخسارة التحقق
  • مقياس pJSD (الجودة اللغوية) ينخفض بشكل يمكن التنبؤ به مع زيادة الحساب
  • تم تحديد نسبة مثالية بين عدد الرموز وعدد المعاملات — نظير كلام لقانون Chinchilla لنماذج LLM النصية
  • يتطابق سلوك التوسع لنماذج CD بشكل وثيق مع سلوك نماذج AR

لماذا نحتاج إلى مقياس pJSD الجديد

المقاييس القياسية — في المقام الأول الخسارة — تقيس دقة إعادة إنتاج النموذج للتوزيع التدريبي، لكنها تعكس بشكل ضعيف ما إذا كان الكلام موضوعياً من وجهة نظر لغوية. قدمت Apple اختلاف Jensen-Shannon للفونيم (pJSD).

يحسب المقياس التباعد بين توزيع الفونيمات في الكلام الذي توليده النموذج والكلام البشري الحقيقي. كلما اقتربت القيمة من الصفر، كلما كان الكلام "أشبه بالبشر" بالمعنى اللغوي. بشكل حاسم، pJSD قابل للتطبيق على كلا الهندستين المعمارية — AR و CD — مما يسمح بمقارنة عادلة لنهج مختلفة بشكل أساسي على مقياس واحد.

"لتقييم الجودة اللغوية لنماذج اللغة الخاصة بالكلام بشكل كمي، نقدم مقياس pJSD — اختلاف

Jensen-Shannon على مستوى الفونيم"، كما تنص ورقة Apple ML Research.

ما يعنيه هذا

تلغي أبحاث Apple عدم اليقين الرئيسي في ذكاء اللغات الطبيعية الصوتي: الانتشار المستمر يتسع بشكل يمكن التنبؤ به وقابل للمقارنة مع النهج الانحداري التلقائي. هذا يعطي الباحثين والشركات تبريراً للاستثمار طويل الأجل في معمارية CD. ستكون أنظمة الذكاء الاصطناعي الصوتي من الجيل القادم قادرة على العمل بدون نص وسيط — مما قد يجعل التفاعل الصوتي أكثر طبيعية وكفاءة حسابية.

ما هي الشبكة العصبية للكلام؟

هذا نموذج لغة يعمل مباشرة مع الصوت بدون تمثيل نصي وسيط — نموذج لغة الكلام فقط (speech-only SLM).

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…