MIT Technology Review→ المصدر

فتحت Anthropic نافذة في تفكير Claude: أداة Jacobian Lens تمسك بالمفاهيم الخفية

قدمت Anthropic أداة Jacobian Lens — أداة قابلية التفسير التي تفتح الصندوق الأسود للـ LLMs. تظهر الأداة المفاهيم التي تنشط في الطبقات الوسيطة من Claude عند الإجابة على سؤال. من المبتذل إلى غير المعتاد: ينشئ النموذج تمثيلات خفية للأفكار غير المرئية في الإخراج الطبيعي. هذا يعطي منظورًا ساذجًا لكيفية 'تفكير' LLMs.

معالج بواسطة الذكاء الاصطناعي من MIT Technology Review؛ بتحرير Hamidun News
فتحت Anthropic نافذة في تفكير Claude: أداة Jacobian Lens تمسك بالمفاهيم الخفية
المصدر: MIT Technology Review. كولاج: Hamidun News.
◐ استمع للمقال

طورت Anthropic تقنية Jacobian lens، التي توفر أوضح رؤية حتى الآن لما يحدث داخل Claude عندما تجيب على الأسئلة أو تؤدي المهام.

ما الذي يجدونه

عندما تجيب Claude على سؤال، يعرض Jacobian lens التفعيل في الطبقات الوسيطة. تتراوح النتائج من اليومية (تفعيل طبقة مرتبطة بالأرقام عند حل الرياضيات) إلى غير العادية (المفاهيم المخفية التي لا تظهر في الإخراج الصريح).

كيفية عملها

بدلاً من مراجعة الأوزان والتفعيلات بشكل عمياوي، تستخدم الأداة رياضيات جاكوبيان (مصفوفة المشتقات) لتتبع كيف تؤثر التغييرات في الإدخال على التمثيلات الوسيطة. هذا يسمح:

  • برؤية المفاهيم المجردة التي ينشطها النموذج
  • بتتبع مسار المنطق من الإدخال إلى الإخراج
  • بفهم سلاسل المنطق غير الصحيحة التي تؤدي إلى إجابات خاطئة

الأهمية بالنسبة للأمان

اكتشاف المفاهيم المخفية مهم لأمان الذكاء الاصطناعي: إذا رأينا أن النموذج ينشط مفاهيم خطرة، حتى لو كانت الإجابة النهائية آمنة، يمكننا إصلاحها.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…