SAAG: метод трёхэтапной диагностики ошибок вызова функций у AI-агентов
На arXiv в июле 2026 года вышла работа SAAG — каскадный метод оценки вызова функций AI-агентами. Вместо одного балла «верно/неверно» он разбивает проверку на три стадии: соответствие реестру инструментов, структурную полноту вызова и обоснованность аргументов. По каждой стадии — своя диагностика, которая ещё и подсказывает модели, что чинить, не раскрывая правильный ответ. На локальных моделях менее 4 млрд параметров подход снижает галлюцинацию значений аргументов.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
في يوليو 2026، ظهرت على arXiv ورقة بحثية بعنوان SAAG (Structured Agent Assessment and Grounding) — وهي طريقة تقييم متتابعة (كاسكيدية) تُقسّم فحص استدعاء الوظائف لدى وكيل الذكاء الاصطناعي إلى ثلاث مراحل متتالية، وتُصدر لكل مرحلة تشخيصًا منفصلاً للخطأ بدلاً من درجة ثنائية واحدة.
ما الخلل في التقييم الثنائي
يرى مؤلفو SAAG أن تقييم استدعاء الوظائف بالمطابقة التامة (exact-match) يخفي أنواعًا مختلفة نوعيًا من الإخفاقات. فقد يختار النموذج الوظيفة الصحيحة لكنه يهلوس (hallucinate) في قيم الوسائط (arguments) — أو قد يستوفي شكليًا مخطط الاستدعاء بينما يختار الأداة لسبب خاطئ.
تختزل المعايير القياسية (benchmarks) الحالية كل هذه الحالات في درجة واحدة "صحيح/خاطئ". والنتيجة أن المهندس يرى أن الوكيل أخطأ لكنه لا يفهم في أي مرحلة بالضبط: في اختيار الأداة، أم في بنية الاستدعاء، أم في تعويض الوسائط. وبالنسبة للوكلاء الذين يستدعون وظائف خارجية في بيئة الإنتاج، يكون هذا العمى حاسمًا — فمن دون تقسيم إلى مراحل، لا يوجد ما يمكن إصلاحه بشكل دقيق ومحدد.
كيف تعمل SAAG
تُقسّم SAAG الفحص إلى ثلاث مراحل متتالية، تُنتج كل منها تشخيصها القابل للتفسير الخاص بها. ووفقًا لملخص العمل على arXiv، تسير المراحل بشكل تتابعي (كاسكيدي) — من العام إلى الخاص.
- المرحلة 1 — registry conformance: هل تتوافق الأداة المستدعاة مع سجل الوكلاء المتاحين
- المرحلة 2 — structural completeness: هل بنية الاستدعاء صحيحة، وهل جميع الحقول الإلزامية موجودة
- المرحلة 3 — argument grounding: هل قيم الوسائط مستندة إلى البيانات المصدرية أم أنها مُختلقة
- بُني المعيار القياسي على مجموعة بيانات function-calling الخاصة بشركة Glaive
- سجلات بثلاثة أحجام — 5 و10 و15 وكيلاً
الميزة الرئيسية هي الإصلاح الذاتي التكراري (self-repair). فعند حدوث خطأ، تشير إشارة مرحلة معينة إلى النموذج بما يجب إصلاحه تحديدًا، لكن دون الكشف عن الإجابة الصحيحة (ground-truth)، تجنبًا لأي تسريب أو تكيّف مصطنع مع الإجابة.
ما الذي أظهرته الاختبارات
تُحسّن التغذية الراجعة المُهيكَلة على مراحل بشكل مطّرد دقة الوسائط وتقلل من هلوسة قيمها — مقارنة بتمريرة واحدة دون تغذية راجعة، ومقارنة بتغذية راجعة ثنائية غير مفيدة من نوع "صحيح/خاطئ". أُجريت الاختبارات على ثلاثة نماذج محلية أقل من 4 مليارات معامل (parameters).
في الوقت نفسه، يصف المؤلفون التحسن النهائي في الجودة من طرف إلى طرف (مقياس F1) بأنه متواضع ويعتمد على النموذج المحدد. أي أن التشخيص المرحلي يساعد بشكل ملحوظ على مستوى الوسائط، لكنه لا يُحدث قفزة دراماتيكية في الدقة الإجمالية لجميع النماذج وجميع أحجام السجلات دفعة واحدة.
"التقييم التشخيصي المرحلي هو عدسة ضرورية لفهم وتحسين موثوقية استدعاء
وظائف الوكلاء"، بحسب ما جاء في ملخص العمل على arXiv.
ما الذي يعنيه هذا
بالنسبة للفرق التي تبني وكلاء ذكاء اصطناعي على نماذج محلية صغيرة، لا تقدّم SAAG مجرد حكم "نجح/فشل"، بل خريطة تحدد أين بالضبط ينكسر استدعاء الأداة. وهذا يجعل تصحيح أخطاء الوكلاء أكثر دقة واستهدافًا — خصوصًا حيث يهم تقليل هلوسة الوسائط دون إعادة تدريب النموذج ودون تسريب الإجابات المرجعية.
الأسئلة الشائعة
ما هي SAAG؟
SAAG (Structured Agent Assessment and Grounding) هي طريقة تشخيصية لتقييم استدعاء الوظائف لدى وكلاء الذكاء الاصطناعي، مقسّمة إلى ثلاث مراحل: التوافق مع السجل، والاكتمال البنيوي، وتأصيل الوسائط. وهي تُصدر إشارة منفصلة لكل مرحلة بدلاً من درجة إجمالية واحدة.
بم تختلف SAAG عن المعايير القياسية المعتادة؟
تُعطي المعايير القياسية المعتادة درجة ثنائية "صحيح/خاطئ" ولا تُظهر في أي مرحلة أخطأ الوكيل. تفصل SAAG الأخطاء حسب المراحل، وتسمح إضافة إلى ذلك للنموذج بتصحيحها بشكل تكراري دون الاطلاع على الإجابة الصحيحة.
على أي النماذج جُربت SAAG؟
جُربت الطريقة على ثلاثة نماذج محلية أقل من 4 مليارات معامل، على معيار قياسي مبني على مجموعة بيانات Glaive بسجلات من 5 و10 و15 وكيلاً متاحًا.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.