AWS Machine Learning Blog→ المصدر

أداة AWS Strands Evals تحدد تلقائياً أسباب فشل وكلاء الذكاء الاصطناعي وتقترح إصلاحات

أطلقت AWS أداة Strands Evals، وهي إطار عمل لتشخيص تلقائي لفشل وكلاء الذكاء الاصطناعي. تحلل الأداة آثار التنفيذ الفعلية، وتصنف الأخطاء (الاختيار غير الصحيح للأداة والهلوسة وخطأ التخطيط)، وتبني سلاسل السببية وتشير فوراً إلى ما يجب إصلاحه—نموذج النظام أو تعريف الأداة.

معالج بواسطة الذكاء الاصطناعي من AWS Machine Learning Blog؛ بتحرير Hamidun News
أداة AWS Strands Evals تحدد تلقائياً أسباب فشل وكلاء الذكاء الاصطناعي وتقترح إصلاحات
المصدر: AWS Machine Learning Blog. كولاج: Hamidun News.
◐ استمع للمقال

أطلقت AWS Strands Evals — أداة للتشخيص الآلي لأعطال وكلاء الذكاء الاصطناعي. على عكس أطر التقييم القياسية، فهي لا تسجل فقط حقيقة الفشل، بل تحدد السبب الجذري وتقترح إصلاحات محددة — في فرض النظام أو تحديد الأداة أو منطق التنسيق.

المشكلة: الوكلاء ينهارون بصمت

وكلاء الذكاء الاصطناعي هم أنظمة معقدة متعددة الخطوات. يستدعون أدوات ويصلون إلى واجهات برمجة تطبيقات خارجية ويفسرون النتائج ويتخذون القرارات بشكل مستقل حول الخطوة التالية. عندما يحدث خطأ ما، يصبح التصحيح بمثابة تحقيق بوليسي: أعطى الوكيل إجابة غير صحيحة — لكن أين بالضبط انكسر؟ في فرض النظام؟ في تحديد الأداة؟ في منطق التخطيط؟ في كيفية معالجة استجابة واجهة برمجة التطبيقات الخارجية؟ تسجل أطر التقييم التقليدية الجودة النهائية — "فشل الوكيل في الاختبار" — لكن لا تشرح السبب.

يتعين على المطورين مراجعة مئات سطور السجلات يدويًا وبناء الفرضيات والتجربة من خلال المحاولة والخطأ. مع الوكلاء المعقدين مع سلاسل من 10–15 خطوة، يمكن لهذا التصحيح أن يمتد لأيام. يحل Strands Evals هذه المشكلة بإضافة التشخيص الآلي إلى عملية التقييم مع توصيات محددة.

ما الذي يمكن لـ Strands Evals أن يفعله

تعمل الأداة من خلال وظائف الكاشف التي تحلل تتبعات تنفيذ الوكيل الفعلية وتعيد تشخيصاً منظماً. القدرات الرئيسية:

  • تصنيف الأعطال — تصنف نوع الخطأ: اختيار الأداة الخاطئ وفشل اتباع التعليمات والهلوسة وخطأ في منطق التخطيط والمعالجة غير الصحيحة للاستجابات
  • درجات الثقة — تحصل كل فئة على درجة ثقة حتى يفهم المطور موثوقية التشخيص
  • السلاسل السببية — يوضح النظام السبب الجذري الذي أدى إلى أي أعراض هابطة في سلسلة إجراءات الوكيل
  • توصيات الإصلاح — يشير الكاشف مباشرة إلى ما يجب إصلاحه وأين: في فرض النظام أو في تحديد الأداة أو في منطق التنسيق
"مخرجات منظمة مع أعطال مصنفة وسلاسل سببية وتوصيات الإصلاح — لكل دورة اختبار،" — يصف فريق AWS ML

Blog الأداة.

كيفية الدمج في eval-pipeline

يندمج Strands Evals في عملية التقييم الموجودة دون إعادة هيكلة عميقة للبنية التحتية. يستدعي المطور وظائف الكاشف في كل دورة اختبار ويحصل على تشخيص آلي جنباً إلى جنب مع مقاييس الجودة العادية — الدقة و F1 ومعدل إنجاز المهام. تكون القيمة العملية ملحوظة بشكل خاص عند العمل مع مجموعات اختبار كبيرة.

بدلاً من تحليل مئات التتبعات يدويًا، يرى الفريق صورة مجمعة. إذا تركزت 70% من أخطاء فئة "اختيار الأداة الخاطئ" حول استعلامات من نوع معين — فالمشكلة على الأرجح في فرض النظام وليس في تطبيق الأداة نفسها. هذه تصحيحات مختلفة بشكل أساسي مع مستويات جهد مختلفة: تعديل عدة أسطر من الفرض مقابل إعادة هيكلة كود الأداة.

بالنسبة للفرق التي تقوم باختبار الانحدار للوكلاء، تتيح الأداة أيضاً تتبع الديناميكيات: أي فئات خطأ تنمو بعد تحديث الفرض وأي منها تختفي.

السياق: Strands SDK

Strands هو SDK وكيل مفتوح المصدر من AWS تم الإعلان عنه في 2025. يتيح لك بناء أنظمة الوكيل بناءً على نماذج Amazon Bedrock وغيرها من LLM، يدعم الأنماط متعددة الوكلاء ويدمج الأدوات من خلال معيار MCP. Strands Evals هو مكون التقييم في هذا الإطار الذي تقوم AWS بتطويره بنشاط. بينما تنتقل أنظمة الوكيل من النماذج الأولية إلى الإنتاج، تصبح أدوات التشخيص جزءاً حاسماً من مكدس DevOps للذكاء الاصطناعي. يمكن للوكيل الذي يسيء تفسير المهمة أو يختار الأداة الخاطئة ليس فقط أن يعطي إجابة غير صحيحة بل ينفذ إجراء غير مرغوب فيه مع عواقب حقيقية.

ماذا يعني هذا

يغلق Strands Evals أحد الفجوات الرئيسية في العمل مع وكلاء الذكاء الاصطناعي في الإنتاج: الانقطاع بين "حدث خطأ ما" و "إليك بالضبط ما يجب إصلاحه وكيفية إصلاحه." بالنسبة للفرق التي تبني أنظمة الوكلاء على AWS، يقلل هذا من دورة التصحيح ويقلل الاعتماد على التحليل اليدوي للسجلات ويجعل عملية التقييم جزءاً كاملاً من خط أنابيب CI/CD.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…