Habr AI→ المصدر

نفس معيار LLM أعطى 28% و76% — الفرق يكمن فقط في طريقة طرح الأسئلة

اختبر مطور نماذج LLM باللغة الروسية على مستندات شركاتية — سياسات وأوامر وفواتير واعتمادات. كان على النموذج أن يجد المستند الصحيح بين المستندات المشابهة، ويستشهد بسطر معين، ولا يفشل عند تغيير تاريخ. أظهر نفس النموذج في المعيار من 28% إلى 76% — كانت النتيجة تعتمد ليس على اختيار النموذج، بل على كيفية تنظيم الاستعلامات إليه.

معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
نفس معيار LLM أعطى 28% و76% — الفرق يكمن فقط في طريقة طرح الأسئلة
المصدر: Habr AI. كولاج: Hamidun News.
◐ استمع للمقال

طور مبرمج اختبر نماذج اللغات الروسية على المستندات الشركات نتائج تتراوح من 28% إلى 76% على نفس المعيار لنفس النموذج — يتم شرح الفرق حصراً بالطريقة التي تتم بها صياغة الأسئلة.

كيف يتم تنظيم المعيار

قام المؤلف بتجميع معيار لنماذج اللغات الروسية على أنواع حقيقية من مستندات الشركات — السياسات والأوامر والفواتير والاتفاقيات. كانت مهمة النماذج هي العثور على المستند الضروري من بين مستندات مماثلة، والاستشهاد بسطر معين فيه، وعدم "الفشل" عند تغيير تاريخ واحد فقط في أحد المستندات.

  • نطاق النتائج لنفس النموذج على معيار واحد — من 28% إلى 76%
  • نوع البيانات — مستندات الشركات: السياسات والأوامر والفواتير والاتفاقيات
  • المهارات المختبرة — العثور على المستند الصحيح من بين المستندات المماثلة والإشارة الدقيقة للسطر والمرونة في مواجهة التغييرات في تفصيل واحد (التاريخ)
  • سبب الاختلاف — ليس النموذج نفسه بل كيفية تنظيم الطلبات الموجهة إليه

من أين جاء الفارق بـ 48 نقطة مئوية

النتيجة الرئيسية للتجربة هي أن النتيجة النهائية تبين أنها تعتمد بشدة على كيفية تنظيم الطلبات الموجهة للنموذج بدلاً من النموذج المستخدم. بعبارة أخرى يمكن "إفشال" نفس النموذج في المعيار أو جعله ينجح بشكل أفضل بمقدار ثلاث مرات تقريباً — ببساطة بتغيير كيفية تقديم السؤال وسياق المستند إليه.

لماذا يهم هذا لتطبيقات LLM في المؤسسات

تقوم الشركات بشكل متزايد ببناء أنظمة بحث وومعالجة مستندات داخلية على LLMs — ما تسميه الصناعة RAG (الجيل المعزز بالاسترجاع): نادراً ما يتم تخزين الاتفاقيات والأوامر والفواتير في شكل مناسب للنموذج وفي الممارسة العملية يجب على النموذج تحديد المستند الضروري من بين عدة مستندات مماثلة ثم الاستشهاد بالسطر الدقيق. هذا بالضبط ما اختبره معيار المؤلف.

إذا كان الاختلاف في النتائج يُشرح بصيغة الطلب بدلاً من اختيار النموذج فإن فرق الفريق الذي ينفذ LLMs في العمليات الداخلية قد تحقق تأثيراً أكبر من الاستثمار في تنظيم مناسب للاستعلامات والسياق من الانتقال إلى نموذج أكبر أو أكثر تكلفة. هذا واضح بشكل خاص في المرونة في مواجهة التغييرات "الصغيرة": عندما يتم تغيير تاريخ واحد فقط في أحد المستندات ويستمر النموذج في الاستشهاد بالإصدار القديم أو يفقد المستند المطلوب من بين المستندات المماثلة — عادة ما تؤدي هذه الأعطال إلى تقويض الثقة في أنظمة LLM داخل الشركات حتى لو كان النموذج يعمل بشكل معقول في المتوسط.

ماذا يعني هذا

يُظهر المعيار على مستندات الشركات الحقيقية: مقارنة النماذج "بشكل مباشر" دون تحديد طريقة تقديم الأسئلة غير موثوقة منهجياً وللتنفيذ العملي لـ LLMs في سير عمل المستندات من الأهم عدم السعي للبحث عن نموذج أكثر قوة بل كمال كيفية طرح الأسئلة عليه.

الأسئلة الشائعة

ماذا بالضبط اختبر المعيار؟

تم اختبار النماذج على القدرة على العثور على المستند الصحيح من بين المستندات المتشابهة مع بعضها — السياسات والأوامر والفواتير والاتفاقيات — والاستشهاد بسطر معين وعدم فقدان الدقة إذا تم تغيير تاريخ واحد فقط في أحد المستندات.

لماذا أعطى نفس المعيار نتائج مختلفة جداً؟

لأن النتيجة تبين أنها حساسة ليس للنموذج نفسه بل لكيفية تنظيم الطلبات الموجهة إليه — يربط مؤلف التجربة بشكل مباشر الفارق من 28% إلى 76% على وجه التحديد بكيفية تقديم الأسئلة بدلاً من تغيير النموذج.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…