يظهر العلماء كيف يشكل ترميز الموضع RoPE "بصمة" رؤوس الاهتمام في LLMs
حلل العلماء سبعة نماذج مُدربة مسبقاً بثلاثة أنظمة ترميز موضع — RoPE و learned-absolute و ALiBi. اتضح أن نوع الترميز يتنبأ تقريباً بشكل مثالي بالبنية الرياضية ("البصمة الطيفية") لرؤوس الاهتمام المسؤولة عن الاستقراء — آلية التعلم في السياق. اثبتت القسمة حسب الأنواع أنها دقيقة في كل شريحة بيانات تم اختبارها.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.LG؛ بتحرير Hamidun News
نشرت مجموعة من الباحثين ورقة على أرخايف شرح كيفية تحديد مخططات الترميز الموضعي — RoPE و learned-absolute و ALiBi — للبنية الرياضية لرؤوس الانتباه "استحثاث" في المحولات، وهي الآلية الكامنة وراء قدرة النموذج على التعلم في السياق.
ما الذي تم قياسه بالضبط
يتم وصف درجة الانتباه قبل softmax من خلال شكل ثنائي الخطوط مع مصفوفة مدروسة M = W_q^T W_k. بما أن هذه المصفوفة عادة ما تكون غير متماثلة، فإنها تحتوي على طيف معقد من القيم الذاتية — وهو بالضبط هذا الطيف الذي استخدمه المؤلفون كـ "بصمة" لكيفية هيكلة رأس الانتباه داخلياً. تم التحقق من صحة العمل على سبعة نماذج مدربة مسبقاً مع ثلاثة مخططات ترميز موضعي مختلفة، مع التركيز على رؤوس "previous-token" و "induction" — آليات مسؤولة عن العثور على الرموز السابقة المتشابهة والتنبؤ بالرمز التالي عن طريق القياس.
- تم فحص سبعة نماذج مدربة مسبقاً وثلاثة مخططات ترميز موضعي — RoPE و learned-absolute و ALiBi
- كان تجميع النماذج حسب نوع الترميز دقيقاً في كل قسم تم فحصه (p = 0.029)
- على نقاط تفتيش Pythia، تظهر بصمة طيفية "دورانية" في نفس الوقت مع تشكيل السلوك الاستحثاثي، وليس قبله
- على نماذج لعبة بطبقتين، يتجاوز التعلم قيد قناة الطيف، لكن مع تأخير (q_BH ≤ 0.016)
- فرض تماثل المصفوفة يبطئ تدريب نماذج ترميز learned-absolute 2.9 مرة
ما الذي أظهرته تجربة الحظر
في الرؤوس باستخدام RoPE، تبين أن الطيف كان "دورانياً" — إلغاء مكون المرحلة عطّل بالكامل الاستحثاث في رأس محدد مسبقاً عبر جميع نماذج RoPE الثلاثة. في النماذج مع ترميز learned-absolute و ALiBi، حيث يتم حساب الموضع خارج مصفوفة الانتباه بدلاً من الداخل، تصرف الطيف بشكل مختلف — "جوهري"، بدون دوران واضح. وفي الوقت نفسه، على نماذج اللعبة، أظهر المؤلفون: إذا كنت تحظر صراحة على رأس استخدام قناة الطيف، فإن التعلم يجد ببساطة حلاً بديلاً ويستعيد القدرة على الاستحثاث، فقط مع تشكيل متأخر.
ما يعنيه هذا
تُظهر الورقة أن اختيار نظام الترميز الموضعي ليس تفصيلاً تقنياً، بل عامل يحدد ما هي "لغة" داخلية يستخدمها النموذج لحل مهمة التعلم في السياق. من حيث قابلية تفسير LLM، هذا يعني أن التحليل الطيفي لمصفوفات الانتباه يمكن استخدامه كأداة تشخيصية، لكن "البصمة" الطيفية نفسها هي نتيجة التدريب، وليست قيداً قاسياً على ما يمكن للنموذج تعلمه.
الأسئلة الشائعة
ما هي رؤوس الاستحثاث في المحولات؟
هي رؤوس انتباه تجد رمزاً في السياق مشابهاً للرمز الحالي وتتنبأ بالرمز التالي عن طريق القياس مع ما جاء بعد رمز مشابه من قبل — وهي آلية أساسية مسؤولة عن قدرة النموذج على التعلم مباشرة في سياق المطالبة (التعلم في السياق).
أي نظام ترميز موضعي أثبت أنه أكثر مرونة؟
RoPE — الوحيد من بين الأنظمة الثلاثة حيث يمكن لرأس الانتباه نقل المعلومات بشكل اتجاهي عبر قناة المرحلة حتى لو كانت مصفوفة الأوزان متماثلة؛ مع ترميز learned-absolute يتم فقدان هذه القدرة، مما يبطئ التدريب عندما يتم فرض التماثل بشكل مصطنع 2.9 مرة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.