فتحت Anthropic نافذة في تفكير Claude: أداة Jacobian Lens تمسك بالمفاهيم الخفية
قدمت Anthropic أداة Jacobian Lens — أداة قابلية التفسير التي تفتح الصندوق الأسود للـ LLMs. تظهر الأداة المفاهيم التي تنشط في الطبقات الوسيطة من Claude عند الإجابة على سؤال. من المبتذل إلى غير المعتاد: ينشئ النموذج تمثيلات خفية للأفكار غير المرئية في الإخراج الطبيعي. هذا يعطي منظورًا ساذجًا لكيفية 'تفكير' LLMs.
معالج بواسطة الذكاء الاصطناعي من MIT Technology Review؛ بتحرير Hamidun News
طورت Anthropic تقنية Jacobian lens، التي توفر أوضح رؤية حتى الآن لما يحدث داخل Claude عندما تجيب على الأسئلة أو تؤدي المهام.
ما الذي يجدونه
عندما تجيب Claude على سؤال، يعرض Jacobian lens التفعيل في الطبقات الوسيطة. تتراوح النتائج من اليومية (تفعيل طبقة مرتبطة بالأرقام عند حل الرياضيات) إلى غير العادية (المفاهيم المخفية التي لا تظهر في الإخراج الصريح).
كيفية عملها
بدلاً من مراجعة الأوزان والتفعيلات بشكل عمياوي، تستخدم الأداة رياضيات جاكوبيان (مصفوفة المشتقات) لتتبع كيف تؤثر التغييرات في الإدخال على التمثيلات الوسيطة. هذا يسمح:
- برؤية المفاهيم المجردة التي ينشطها النموذج
- بتتبع مسار المنطق من الإدخال إلى الإخراج
- بفهم سلاسل المنطق غير الصحيحة التي تؤدي إلى إجابات خاطئة
الأهمية بالنسبة للأمان
اكتشاف المفاهيم المخفية مهم لأمان الذكاء الاصطناعي: إذا رأينا أن النموذج ينشط مفاهيم خطرة، حتى لو كانت الإجابة النهائية آمنة، يمكننا إصلاحها.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.