النماذج

المحول (Transformer)

المحول هو معمارية شبكة عصبية مركزية في الانتباه الذاتي، الذي يتيح لكل موضع في سلسلة الانتباه مباشرة إلى كل موضع آخر في نفس الوقت، مما يتيح التدريب المتوازي بالكامل والنمذجة الفعالة للتبعيات الطويلة المدى في اللغة والصور والسلاسل الأخرى.

قُدمت معمارية المحول من قبل Vaswani وآخرين في Google Brain في ورقة 2017 'الانتباه هو كل ما تحتاج إليه'. ابتكارها المركزي هو الانتباه الذاتي متعدد الرؤوس: لكل رمز في سلسلة إدخال، يحسب النموذج مجموعاً موزوناً من التمثيلات من جميع الرموز الأخرى، حيث تعكس الأوزان (درجات الانتباه) الصلة المكتسبة بين أزواج الرموز. يسمح تشغيل رؤوس انتباه متعددة بالتوازي للنموذج بالتقاط أنواع مختلفة من العلاقات في نفس الوقت. لأن الانتباه يُحسب على السلسلة بأكملها في نفس الوقت وليس خطوة بخطوة، فإن المحول متوازي بالكامل عبر طول السلسلة، على عكس الشبكات المتكررة (RNNs، LSTMs) التي يجب أن تعالج الرموز بشكل متسلسل.

يتكون محول محدد قياسي أو فاك من طبقات متطابقة مكدسة، كل منها يحتوي على طبقة فرعية من الانتباه الذاتي متعدد الرؤوس، شبكة تغذية إلى الأمام موضع بموضع، اتصالات متبقية (skip) حول كل طبقة فرعية، وتطبيع الطبقة. بما أن الانتباه الذاتي غير حساس بطبيعته للموضع، يتم إضافة ترميزات الموضع (جيب/تمام ثابت أو تضمينات تم تعلمها) إلى تمثيلات الرموز لحقن ترتيب السلسلة. المعاملات المعمارية الرئيسية - عدد الطبقات والبُعد المخفي وعدد رؤوس الانتباه وعرض التغذية الأمامية - مع حجم بيانات التدريب وميزانية الحوسبة، تحدد إلى حد كبير قدرة النموذج.

أصبحت المحولات سائدة في معالجة اللغات الطبيعية مع BERT (Google، 2018) و GPT-2 (OpenAI، 2019)، ثم أظهرت نقلاً قوياً إلى رؤية الحاسوب مع Vision Transformer (ViT، Google، 2020)، وإلى علم الأحياء الهيكلية مع استخدام AlphaFold2 للانتباه على سلاسل الأحماض الأمينية والتمثيلات الزوجية (DeepMind، 2020). اعتباراً من عام 2026، كل نموذج لغة كبير رائد - GPT-4، Claude 3، Gemini 1.5، Llama 3، Mistral - هو نموذج محول متغير، كما هي معاملات الرؤية الرائدة والنماذج المتعددة الأوجه التي تجمع النصوص والصور والصوت والفيديو.

القيد العملي الرئيسي للانتباه الذاتي للمحول القياسي هو التكلفة الحسابية والذاكرة التربيعية فيما يتعلق بطول السلسلة، مما يجعل السياقات الطويلة جداً مكلفة. بحلول عام 2026، تعالج تقنيات متعددة هذا: أنماط الانتباه المتفرقة، تقريبات الانتباه الخطي، الانتباه ذو النافذة المنزلقة (Mistral)، والانتباه الدقيق المحسّن للأجهزة (FlashAttention). يتم دعم نوافذ السياق التي تتجاوز مليون رمز من قبل عدة نماذج إنتاج. البحث في خلفاء المعمارية - نماذج فضاء الحالة مثل Mamba، والمعماريات الهجينة من الانتباه / نماذج فضاء الحالة - تهدف إلى الجمع بين جودة النمذجة من المحولات مع التحجيم دون التربيعي.

مثال

عندما يقدم المستخدم وثيقة تقنية مكونة من 50,000 رمز إلى Claude للتلخيص، المحول الكامن يعالج الوثيقة بأكملها في تمرير واحد للأمام مع كل جملة تنتبه مباشرة إلى كل جملة أخرى، لتنتج ملخصاً متماسكاً بدون فقدان المعلومات الذي التقطيع المتسلسل قد يسببه.

مصطلحات مرتبطة

آخر الأخبار حول الموضوع

← المسرد