اقترحت Apple ML Research نموذج MemoryLLM — «ذاكرة» قابلة للتفسير للمحوّلات
نشرت Apple ML Research ورقة عن MemoryLLM — وهي طريقة تفصل كتل feed-forward (FFN) عن آلية self-attention في المحوّلات. وتقترح النظر إلى FFN بوصفه «ذاكرة استرجاع عصبية»: إذ يصل كل token إلى خلايا داخل معلمات الشبكة. وتبحث الدراسة مدى أهمية هذه الذاكرة لمهام مختلفة وكيف تخزّن النماذج المعرفة بدقة.
معالج بواسطة الذكاء الاصطناعي من Apple ML Research؛ بتحرير Hamidun News
نشرت Apple ML Research ورقة بحثية بعنوان Memory LLM، تصف طريقة لتحليل كتل الانتشار الأمامي (feed-forward network، FFN) في نماذج اللغة القائمة على بنية المحوّلات (transformer): إذ تُعامَل كتلة FFN باعتبارها "ذاكرة استرجاع عصبية مستقلة عن السياق"، وتبحث الورقة في كيفية وصول الرموز المُدخَلة (tokens) إلى خلايا هذه الذاكرة، ومدى أهميتها بالنسبة لمهام مختلفة.
لماذا تُسمّى كتلة FFN "ذاكرة" النموذج
تُبنى نماذج اللغة الكبيرة على بنية المحوّلات (transformer). وتتضمن كل طبقة كتلتين رئيسيتين: آلية الانتباه الذاتي (self-attention)، التي تقارن الرموز فيما بينها، وكتلة الانتشار الأمامي (feed-forward network، FFN)، التي ظل دورها غامضًا لفترة طويلة. يقترح مؤلفو Memory LLM اعتبار كتلة FFN قاعدة بيانات عصبية: تخزّن معاملات الشبكة المعرفة، بينما "تستعلم" الرموز المُدخَلة عن المعلومة المطلوبة وفق مبدأ "المفتاح - القيمة" (key-value). ومن هنا جاء المصطلح: "ذاكرة استرجاع عصبية موجّهة نحو الرموز ومستقلة عن السياق": إذ تعالج كتلة FFN كل رمز بمعزل عن محيطه، دون استخدام معلومات عن الكلمات المجاورة. وقد سبق أن نوقش تفسير مشابه لكتلة FFN في أعمال أكاديمية سابقة، لكن Memory LLM يحوّله إلى أداة تحليلية ملموسة.
ما الذي تدرسه Memory LLM بالتحديد
الفكرة المحورية هي الفصل (decoupling): إذ يفصل المؤلفون كتلة FFN عن آلية self-attention لدراسة المكوّنَين كل على حدة. ففي بنية المحوّلات القياسية، تعمل هاتان الكتلتان معًا، مما يصعّب التمييز بين إسهام كل منهما. وفي إطار المنهج المقترح، تُدرَس النقاط التالية:
- كيف تصل رموز مُدخَلة محددة إلى "خلايا" محددة داخل معاملات كتلة FFN؛
- إلى أي مدى تُعد ذاكرة FFN مهمة بالنسبة لمهام لاحقة (downstream) مختلفة — التصنيف، والتوليد، والإجابة عن الأسئلة؛
- ما إذا كان سلوك FFN يخضع لوصف قابل للتفسير، أم أنه لا يزال بمثابة "صندوق أسود".
ويتيح هذا الفصل طرح أسئلة أدق: أين بالضبط في المعاملات تُخزَّن حقيقة معينة، وكيف يصل النموذج إلى القواعد النحوية أو المعرفة بالعالم، وهل تتغير "طوبوغرافيا الذاكرة" بحسب المهمة.
لماذا يحتاج المختصون إلى ذلك
تُعد قابلية التفسير واحدة من أبرز المشكلات المركزية التي لم تُحل بعد في الذكاء الاصطناعي الحديث. فنماذج اللغة تحقق نتائج مبهرة، لكن آلية قراراتها ليست شفافة. وهذا يخلق مخاطر عند تطبيقها في مجالات حساسة: الطب، والقانون، والتمويل. وإذا أمكن وصف كتلة FFN بوصفها ذاكرة قابلة للتحكم، فإن ذلك يفتح عدة اتجاهات عملية:
- التعديل الدقيق للمعرفة — حذف الحقائق القديمة أو تصحيح الأخطاء دون إعادة تدريب النموذج بالكامل؛
- ضبط دقيق (fine-tuning) أكثر كفاءة — فمعرفة المعاملات المسؤولة عن معارف محددة تتيح إعادة تدريب الأجزاء اللازمة فقط من الشبكة؛
- التحقق من السلوك — التأكد من أن النموذج يعتمد على بيانات صحيحة، لا على شوائب ناتجة عن مجموعة بيانات التدريب.
ماذا يعني هذا
تندرج Memory LLM ضمن التوجّه نحو قابلية التفسير الآلي (mechanistic interpretability)، الذي تطوّره Anthropic وDeepMind ومجموعات أكاديمية كبرى. وإذا ثبت أن فصل كتلة FFN عن self-attention قابل للتكرار وقابل للتطبيق عمليًا، فقد يصبح جزءًا من مجموعة أدوات تحليل نماذج اللغة.
ما هي Memory LLM؟
Memory LLM هي ورقة بحثية تصف طريقة لتحليل كتل الانتشار الأمامي (FFN) في نماذج اللغة القائمة على بنية المحوّلات: إذ تُعامَل كتلة FFN باعتبارها "ذاكرة استرجاع عصبية مستقلة عن السياق"، تصل إلى خلاياها الرموز المُدخَلة.
فيمَ يتمثّل فصل كتلة FFN عن self-attention؟
الفصل هو عزل كتلة FFN عن آلية self-attention بهدف دراسة المكوّنَين كل على حدة. ففي بنية المحوّلات القياسية، تعمل هاتان الكتلتان معًا، مما يصعّب التمييز بين إسهام كل منهما؛ وتدرس Memory LLM كتلة FFN المفصولة بوصفها ذاكرة موجّهة نحو الرموز، بمعزل عن self-attention.
ما الاتجاهات العملية التي يفتحها هذا المنهج؟
إذا أمكن تفسير سلوك كتلة FFN بوصفه ذاكرة قابلة للتحكم، فإن ذلك يفتح المجال أمام التعديل الدقيق للمعرفة دون إعادة تدريب النموذج بالكامل، وأمام ضبط دقيق (fine-tuning) أكثر كفاءة لأجزاء محددة من الشبكة، وأمام التحقق من أن النموذج يعتمد على بيانات صحيحة لا على شوائب ناتجة عن مجموعة بيانات التدريب.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.