LangChain Blog→ المصدر

علمت LangChain نظام LangSmith لمواءمة أحكام LLM-as-a-Judge بشكل أفضل مع تفضيلات الإنسان

نشرت LangChain تحليلاً للمقيمين ذوي الضبط الذاتي في LangSmith الذين يكيفون أحكام LLM-as-a-Judge مع تفضيلات الإنسان الحقيقية. تعتمد الطريقة على التعلم من عدد قليل من الأمثلة وتحل المشكلة الأساسية في التقييم المؤتمت — الفجوة بين ما يعتبره نموذج القاضي إجابة جيدة وما يفضله المُعلِّمون البشريون بالفعل.

معالج بواسطة الذكاء الاصطناعي من LangChain Blog؛ بتحرير Hamidun News
علمت LangChain نظام LangSmith لمواءمة أحكام LLM-as-a-Judge بشكل أفضل مع تفضيلات الإنسان
المصدر: LangChain Blog. كولاج: Hamidun News.
◐ استمع للمقال

نشرت LangChain تحليلاً في مدونتها حول كيفية تنظيم المقيّمين الذين يتعلمون بأنفسهم في منصتها LangSmith، والذين يعدّلون أحكام LLM-as-a-Judge لتطابق تفضيلات الناس الفعلية. تطوّر المادة موضوع الشعبية المتزايدة لـ LLM-as-a-Judge—طريقة يقيّم فيها نموذج واحد جودة إجابات نموذج آخر—وتعتمد على البحث حول التعلم بقليل من الأمثلة.

ما هو LLM-as-a-Judge

LLM-as-a-Judge هي طريقة للتقييم التلقائي لجودة إجابات نموذج اللغة، والتي بدلاً من الوسم اليدوي من قبل الأشخاص، يتم استخدام نموذج LLM آخر (غالباً ما يكون أقوى)، وتعيين نقاط أو مقارنة أزواج الإجابات. اكتسبت هذه الطريقة شعبية سريعة في السنوات الأخيرة كطريقة لتقليل التكلفة وتسريع تقييم النموذج—من الاختبارات العامة مثل MT-Bench و Chatbot Arena إلى خطوط الأنابيب الداخلية للتقييم في الشركات التي تطوّر منتجات LLM.

ما هي مشكلة الاختلاف مع الناس

الخطر الرئيسي لـ LLM-as-a-Judge هو الفجوة بين ما يعتبره نموذج القاضي إجابة "جيدة" وما يفضله الناس فعلياً: للمقيّمين تحيزات معروفة—على سبيل المثال، الاتجاه إلى تقييم الإجابات الأطول أعلى أو الإجابات التي تكون أولى في زوج المقارنة. تصف LangChain منهجاً للمقيّمين الذين يتعلمون بأنفسهم في LangSmith—منصتها للتتبع والاختبار وتصحيح تطبيقات LLM في الإنتاج—التي تستخدم تقنية التعلم بقليل من الأمثلة لتعديل تدريجي لأحكام نموذج القاضي لمطابقة التقييمات الفعلية للأشخاص بمرور الوقت.

  • LangSmith هي منصة LangChain للتتبع والاختبار وتقييم تطبيقات LLM في الإنتاج.
  • تعتمد الطريقة على التعلم بقليل من الأمثلة—تكييف سلوك المقيّم من خلال عدة أمثلة توضيحية بدلاً من إعادة تدريب كاملة للنموذج.
  • الهدف هو تقليل الفجوة بين الأحكام التلقائية لـ LLM-as-a-Judge والتفضيلات الفعلية للمشروحين البشريين.

لماذا هذا مهم لفريق تطوير منتجات LLM

كلما اعتمدت الشركات بشكل أكبر على التقييم المؤتمت بدلاً من الوسم اليدوي المكلف، كانت دقة المقيّمين تؤثر مباشرة على إصدارات النموذج أو المحفز التي تصل في النهاية إلى الإنتاج. قد يفقد القاضي LLM المعايرة بشكل سيء انحدار الجودة أو، على العكس من ذلك، يرفض التغيير الناجح—وهذا مكلف في دورة التطوير التكراري لمنتجات الذكاء الاصطناعي. تنافس LangSmith في هذا المجال مع منصات أخرى للمراقبة وتقييم تطبيقات LLM—مثل Weights & Biases Weave و Arize و Braintrust—وتصبح دقة المقيّمين المدمجين أحد الحجج الرئيسية عند اختيار أداة.

فكرة المعايرة بقليل من الأمثلة تصدى لاتجاه أوسع من الأبحاث—التعلم بالتعزيز من ردود الفعل البشرية (RLHF)، الذي يقوم عليه كيفية ضبط المختبرات الرئيسية مثل OpenAI و Anthropic نماذجهم لتتوافق مع تفضيلات الإنسان. الفرق هو أنه هنا نفس المنطق—"ضبط النموذج لما يفضله الناس فعلياً"—ينطبق ليس على النموذج التوليدي نفسه، بل على نموذج قاضي مساعد يقيّم هذا النموذج التوليدي.

ما يعنيه هذا

المقيّمون الذين يتعلمون بأنفسهم هم محاولة الصناعة لإغلاق الضعف الرئيسي لـ LLM-as-a-Judge: الثقة في أحكام نموذج قد يرتكب أخطاء بنفس القدر الذي ترتكبه النماذج التي يقيّمها.

كلما تم تطبيق LLM-as-a-Judge على نطاق أوسع—من تقييم روبوتات المحادثة إلى تصنيف إجابات وكلاء الذكاء الاصطناعي في المهام متعددة الخطوات—كلما أصبح كل تحيز منهجي للمقيّم أكثر تكلفة: فهو يتراكم بصمت ويشوّه أي إصدارات من المنتج تعتبرها الفريق "تحسن" بينما في الواقع قد لا يلاحظها المستخدمون أو حتى يعتبرونها انحداراً.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…