KDnuggets→ المصدر

معايرة النماذج اللغوية: ثلاث طرق لمواءمة الثقة والدقة

غالبًا ما تكون النماذج اللغوية مفرطة الثقة: تقول «احتمال 90%»، لكنها تكون صحيحة فعليًا في 55% من الحالات. المعايرة تصحح ذلك من دون إعادة التدريب. ثلاث طرق post-hoc — Platt Scaling وIsotonic Regression وTemperature Scaling — تعدّل احتمالات الإخراج بعد التدريب. Temperature Scaling هو الأكثر شيوعًا: معامل واحد، وبضعة أسطر من الشيفرة، ويتوقف النموذج عن المبالغة في ثقته.

معالج بواسطة الذكاء الاصطناعي من KDnuggets؛ بتحرير Hamidun News
معايرة النماذج اللغوية: ثلاث طرق لمواءمة الثقة والدقة
المصدر: KDnuggets. كولاج: Hamidun News.
◐ استمع للمقال

غالباً ما "تكذب" نماذج اللغة مع ثقتها: تقول "أنا متأكد بنسبة 90%", لكنها تخطئ نصف الوقت. المعايرة هي مجموعة من التقنيات التي تزيل هذه الفجوة دون تغيير أوزان النموذج. تغطي المقالة ثلاثة من أكثر الأساليب اللاحقة شيوعاً.

لماذا المعايرة السيئة خطيرة

نموذج معايرة جيد يعني: إذا كان يعين "احتمال 70%" لحدث ما، فعملياً يجب أن يحدث مثل هذا الحدث في حوالي 70% من الحالات المتشابهة. يبدو هذا معقولاً، لكن في الممارسة العملية معظم LLMs الحديثة واثقة بشكل زائد — فهي تبالغ بشكل منهجي في دقتها الخاصة، خاصة في السيناريوهات البعيدة عن بيانات التدريب. المشكلة ليست مجردة. في المنتجات حيث يتم اتخاذ القرارات بناءً على احتمالات النموذج — التشخيص الطبي وتسجيل الائتمان والخبرة القانونية والخوارزميات التجارية — تؤدي الثقة غير الصحيحة مباشرة إلى قرارات خاطئة. يرى المستخدم "ثقة 90%" ويثق بإجابة صحيحة فقط 55% من الوقت.

يمكن قياس الفجوة بطريقتين. ECE (خطأ المعايرة المتوقع) — مقياس رقمي واحد يحسب متوسط الانحراف المطلق بين الاحتمالات المتنبأ بها والترددات الفعلية عبر الفئات. مخطط الموثوقية — أداة مرئية: المحور X هو الاحتمالات المتنبأ بها، والمحور Y هي الدقة الفعلية. المعايرة المثالية هي خط قطري مستقيم. الانحراف السفلي يعني الثقة الزائدة؛ الانحراف العلوي يعني نقص الثقة.

ثلاث طرق معايرة لاحقة

يتم تطبيق جميع الأساليب الثلاثة بعد تدريب الشبكة العصبية. لا تغير الأوزان ولكنها تصحح احتمالات الإخراج في مرحلة الاستدلال باستخدام تدريب إضافي صغير على بيانات التحقق. هذا يجعلها مريحة: لا حاجة للوصول إلى تدريب النموذج، لا حاجة لعلامات إضافية.

  • Platt Scaling — يدرب الانحدار اللوجستي على logits الخام للنموذج. سريع وبسيط، يتطلب بيانات قليلة. يفترض تشويهاً سيجمويدياً — يعمل بشكل جيد إذا كان النموذج يبالغ أو يقلل من تقدير الثقة بشكل موحد عبر النطاق كله. الضعف: يتعامل بشكل سيء مع الأنماط غير الخطية.
  • Isotonic Regression — طريقة غير معاملية بدون افتراضات حول شكل التشويه. يبني دالة تحويل رتيبة من شكل عشوائي، يتعامل بشكل أفضل مع أنماط الثقة الزائدة المعقدة غير الخطية. يتطلب أمثلة تحقق أكثر بكثير — وإلا فإن مخاطر الإفراط في التجهيز.
  • Temperature Scaling — الطريقة الأكثر شيوعاً لـ LLMs. يقسم جميع logits على ثابت واحد T مكتسب (درجة الحرارة). T > 1 — الاحتمالات "غير واضحة", النموذج يصبح أقل قاطعية. T < 1 — تزداد الثقة. معامل واحد، محسّن لـ NLL على التحقق. التنفيذ يستغرق حوالي عشرة أسطر من الرمز.

كيفية اختيار الطريقة المناسبة

Temperature Scaling — الخيار الافتراضي لمعظم مهام LLM. يعمل فقط مع احتمالات الإخراج — لا حاجة لوصول الأوزان. يتطلب اختيار T بضع مئات من الأمثلة فقط. لا يعيد تشكيل توزيع الاحتمال، فقط يقيسه.

يجب النظر في Isotonic Regression عندما يكون التشويه غير خطي والعينة التحقق كبيرة — من بضعة آلاف من الأمثلة. يمكنه التقاط الأنماط المعقدة التي قد يفتقدها Temperature Scaling. يتطلب مخاطر الإفراط في التجهيز تقسيم train/val/test دقيق.

Platt Scaling يحتل موضع وسط: أكثر مرونة قليلاً من Temperature Scaling وأبسط من Isotonic Regression. يكون منطقياً عندما تكون البيانات غير كافية لـ Isotonic لكن هناك حاجة إلى مرونة أكثر مما توفره درجة الحرارة.

قيد رئيسي لجميع الأساليب الثلاثة: يلزم مجموعة تحقق منفصلة لم تُستخدم في تقييم النموذج. المعايرة على نفس المجموعة خطأ يؤدي إلى الإفراط في تجهيز دالة المعايرة.

ماذا يعني هذا

للفرق التي تنشر LLMs في الإنتاج، المعايرة هي خطوة إلزامية قبل النشر في أي سيناريوهات عالية المخاطر. Temperature Scaling يتطلب جهداً ضئيلاً ويمكنه تقليل عدد التنبؤات الثقة غير الصحيحة بشكل كبير — بدون إفراط في التجهيز، بدون وصول إلى الأوزان، بدون زيادة ملحوظة في الكمون. هذه واحدة من تلك الحالات النادرة حيث يؤثر تحسن تقني صغير مباشرة على ثقة المستخدم في المنتج.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…