arXiv cs.AI→ المصدر

AgentLens: تقييم وكلاء الأكواد ينتقل من النتيجة إلى العملية

قدم الباحثون AgentLens — معيار قياسي جديد لوكلاء الأكواد. بخلاف الاختبارات القياسية التي تحسب فقط النجاح/الفشل، يحلل AgentLens المسار بالكامل: كيفية اتباع الوكيل للتعليمات واستخدام الأدوات والتحقق من الكود والاستعادة من الأخطاء. يتم استخدام النظام بالفعل لتشخيص سلوك الوكلاء ومقارنة الإصدارات والكشف عن الانحدارات في الإنتاج.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
AgentLens: تقييم وكلاء الأكواد ينتقل من النتيجة إلى العملية
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

قدم الباحثون AgentLens — معيار لتقييم وكلاء الكود في يوليو 2026. على عكس الاختبارات القياسية التي تختزل النتائج إلى اجتياز/عدم اجتياز بسيط، يحلل AgentLens مسار العمل الكامل للوكيل: كيفية اتباع التعليمات، استخدام الأدوات المتاحة، اختبار الكود، التعافي من الأخطاء والتواصل مع المستخدم.

لماذا النهج القديم غير كافٍ

يعمل معيار نموذجي لوكلاء الكود بطريقة بسيطة جداً: بالنظر إلى المهمة—تم حلها أو لا. يتم تقليل النتيجة إلى قيمة ثنائية واحدة: 1 أو 0، نجح أو فشل. هذا مناسب للتصنيف السريع للنماذج، لكنه لا يعكس تماماً تجربة المستخدم الحقيقية.

الأشخاص الذين يعملون مع وكلاء الكود في الإنتاج يرون الكثير. يتفاعلون مع الوكيل طوال عملية عمله، يتابعون منطقه، يرون الأخطاء التي يرتكبها، يراقبون كيف يتعافى ويغير الاستراتيجية. يطرحون أسئلة توضيحية، يطلبون إعادة كتابة الكود، يشيرون إلى الأخطاء.

لا تلتقط المعايير القياسية أي من هذا. لا توضح لماذا اختار الوكيل هذا النهج المعين، ما هي الخطوات الوسيطة التي بدت منطقية له، أين عَلِق. قد تكون النتيجة النهائية صحيحة من الناحية التقنية، لكن الطريق إليها قد يكون طويلاً وغير فعال وممتلئاً بمحاولات فاشلة.

كيفية عمل AgentLens

يجمع AgentLens بين عدة نهج تقييم في نظام واحد:

  • التحقق الرسمي — فحوصات موضوعية حيث يكون ذلك ممكناً (بناء جملة الكود والمنطق ونتائج اختبارات الوحدة)
  • تقييمات المسار المكتوبة بواسطة LLM — تحلل النماذج المدربة بشكل خاص مسار الوكيل بالكامل، وتقيم كل خطوة وقرار
  • المقارنات جنباً إلى جنب — يعرض النظام مقارنة مرئية بين إصدارات الوكلاء، مع تسليط الضوء على اختلافات السلوك

نتيجة كل تشغيل ليست ببساطة درجة من 1 إلى 10، بل شرح نصي مفصل باللغة الطبيعية. يصف النظام: لماذا تلقى الوكيل تلك الدرجة بالذات، ما هي القرارات التي كانت منطقية وصحيحة، أين أخطأ، كيف تعافى من الأخطاء، هل كان فعالاً في استخدام الأدوات.

حيث يتم استخدام AgentLens

أثبت المعيار أنه مفيد ليس فقط لترتيب النماذج المختلفة. يستخدمه المطورون لثلاثة أغراض رئيسية:

  • تشخيص السلوك — فهم عميق لحيث يرتكب الوكيل أخطاء منهجياً، أي فئات من المهام أصعب بالنسبة له، أي أدوات يستخدمها بشكل ناقص
  • مقارنة إصدار وكيله الخاص — تتبع ما إذا تحسنت الجودة بين الإصدارات أو حدث انحدار في بعض الجوانب
  • المراقبة التلقائية — خطوط الأنابيب الاختبارية الليلية تمسك بالمشاكل قبل أن تصل إلى أنظمة الإنتاج

ما يعنيه هذا

يرمز AgentLens إلى اتجاه أوسع في مجتمع الذكاء الاصطناعي: ينتقل تقييم وكلاء الكود من مقاييس بسيطة إلى تحليل شامل لعملية العمل بأكملها. بدلاً من نعم/لا بسيط، يوفر النظام الآن الصورة الكاملة: ما هي القرارات التي اتخذها الوكيل، لماذا، ما الذي نجح وما الذي لم ينجح.

هذا يساعد المطورين ليس فقط على تحسين النتائج النهائية، بل أيضاً على فهم أفضل لكيفية تفكير أنظمة الذكاء الاصطناعي، وأنواع المهام التي تأتي بسهولة لهم، وأيها تسبب مشاكل.

تم إطلاق المعيار كمصدر مفتوح على GitHub، مما يسمح للباحثين والمطورين في جميع أنحاء العالم باستخدامه لمشاريعهم.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…