نشرت Habr الجزء الثاني من دليل Activation Steering—repeng, pyreft والمتجه الدقيق
تم نشر جزء ثان من سلسلة حول Activation Steering على Habr—تقنية للتحكم في سلوك نموذج اللغة من خلال تعديل مباشر لتفعيلاتها الداخلية. في الجزء الأول، قام المؤلفون بتنفيذ steering أساسي بثلاث طرق: عبر PyTorch hooks الخام، عبر nnsight، وعبر pyvene، لكنهم واجهوا مشاكل—تم عكس المتجه، كان التأثير معتدلاً، واختفى على بعض الـ prompts. في الجزء الثاني، يتم تحليل repeng و pyreft وطرق أخرى يجب أن تجد المتجه بدقة أكبر.
معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
نشر مؤلف مدونة تقنية على Habr الجزء الثاني من دليل حول activation steering—تقنية للتحكم في سلوك نموذج اللغة عن طريق تغيير تفعيلاته الداخلية مباشرة—ويشرح كيفية العثور على متجه التحكم بدقة أكبر باستخدام مكتبات repeng و pyreft.
ما لم ينجح في الجزء الأول
في الجزء الأول من الدليل، الذي كان بعنوان "اسحبه إلى حيث تحتاج: Tutorial Activation Steering"، قام المؤلف بتنفيذ الفكرة الأساسية للتحكم بثلاث طرق—من خلال PyTorch hooks الخام، من خلال مكتبة nnsight ومن خلال مكتبة pyvene. فكرة التحكم نفسها هي إضافة متجه خاص إلى تفعيلات الشبكة العصبية الوسيطة وتحويل ردتها في الاتجاه المطلوب دون تعديل أوزان النموذج.
- ثلاث طرق من الجزء الأول: PyTorch hooks الخام، مكتبة nnsight، مكتبة pyvene
- عملت الطريقة الأساسية—استجاب النموذج لمتجه التحكم
- لكن النتيجة كانت بعيدة عن المثالية: اتضح أن المتجه كان معكوساً، والتأثير كان معتدلاً وعلى بعض الاستفسارات لم يكن هناك تأثير على الإطلاق
"هل عملت قاعدتنا؟ نعم—رأينا ذلك. هل كان طبيعياً؟ لا—ورأينا ذلك أيضاً: اتضح أن المتجه كان معكوساً، والتأثير كان معتدلاً وعلى بعض الاستفسارات لم يكن هناك تأثير"، يكتب مؤلف دليل activation steering على
Habr.
أي الأدوات يتم تجربتها في الجزء الثاني
في الجزء الثاني من الدليل، ينتقل المؤلف من أدوات القابلية للتفسير العامة إلى المكتبات المصممة خصيصاً للعثور على متجه تحكم أكثر دقة—repeng و pyreft وطرق أخرى. موضوع الجزء الثاني هو بالضبط كيفية إصلاح أوجه القصور الموجودة في الجزء الأول وكيفية تنفيذها في Python.
الفرق في النهج أساسي: إذا كانت nnsight و pyvene مكتبات عامة للعمل مع حالات النموذج الداخلية، فإن repeng و pyreft تم إنشاؤها خصيصاً لمهمة العثور على متجه تحكم، مما يعني أنها قد تعطي نتائج أكثر قابلية للتنبؤ بها حيث أعطت الطريقة الأساسية متجهاً معكوساً أو تأثيراً ضعيفاً.
مجرد حقيقة أن المؤلف احتاج إلى جزء ثانٍ من الدليل يظهر: تنفيذ التحكم "بشكل مباشر" من خلال PyTorch hooks الخام ليس كافياً للحصول على نتائج مستقرة—تتطلب المنهجية معالجة منفصلة خصيصاً للبحث عن المتجهات، وليس فقط لتطبيقها على تفعيلات النموذج.
ما يعنيه هذا
يظل activation steering منطقة حيث يتم تنفيذ الفكرة الأساسية—إزاحة التفعيلات الداخلية للنموذج في الاتجاه المطلوب—من خلال مجموعة متزايدة باستمرار من الأدوات؛ يؤثر اختيار المكتبة بشكل مباشر على مدى قابلية التنبؤ والدقة لتحكم النموذج.
الأسئلة الشائعة
ما المشاكل التي واجهتها الطريقة الأساسية لـ
Activation Steering؟
في الجزء الأول من الدليل، اتضح أن متجه التحكم الموجود باستخدام الطريقة الأساسية كان معكوساً، أعطى تأثيراً معتدلاً فقط ولم يعمل على الإطلاق على بعض الاستفسارات.
أي الأدوات تم استخدامها في الجزء الأول من الدليل؟
ثلاث طرق: PyTorch hooks الخام، مكتبة nnsight ومكتبة pyvene—الكل أساسي، دون تخصص في العثور على متجه التحكم.
كيف يختلف repeng و pyreft عن الأدوات في الجزء الأول؟
تم إنشاؤها خصيصاً للبحث وضبط متجه التحكم، وليس للعمل العام مع تفعيلات النموذج الداخلية مثل nnsight و pyvene—هذا هو موضوع الجزء الثاني من الدليل.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.