Microsoft Research→ المصدر

قدمت مايكروسوفت ريسيرتش SkillOpt — مهارات قابلة للتدريب للوكلاء الذكيين

قدمت مايكروسوفت ريسيرتش SkillOpt — منهج يحول الضبط اليدوي لتعليمات وكلاء الذكاء الاصطناعي إلى عملية تدريب كاملة. في السابق، كانت تعديلات التعليمات تُجرى يدويًا دون ضمان تحسن أداء الوكيل. يجعل SkillOpt سلوك الوكيل أكثر قابلية للتنبؤ به دون تغيير أوزان النموذج.

معالج بواسطة الذكاء الاصطناعي من Microsoft Research؛ بتحرير Hamidun News
قدمت مايكروسوفت ريسيرتش SkillOpt — مهارات قابلة للتدريب للوكلاء الذكيين
المصدر: Microsoft Research. كولاج: Hamidun News.
◐ استمع للمقال

قدمت Microsoft Research SkillOpt — طريقة تحول التعديل اليدوي للمهارات (instructions) لعملاء ذكيين إلى عملية تعليم مُدارة دون تغيير أوزان النموذج.

مشكلة التعديلات اليدوية

يقوم عملاء الذكاء الاصطناعي بإنجاز المهام باتباع مجموعة من المهارات — تعليمات نصية تصف كيفية حل أنواع معينة من المهام: كيفية صياغة تقرير، كيفية التعامل مع طلب العميل، كيفية التنقل في عمليات متعددة الخطوات. عندما يرتكب العميل خطأ، يقوم المطورون عادةً بتعديل هذه التعليمات يدويًا: إعادة صياغة الخطوات، إضافة تحذيرات، إزالة الشروط غير الضرورية.

وفقًا لباحثي Microsoft، فإن هذا التعديل اليدوي لا يوفر ضمانًا بأن سلوك العميل سيتحسن فعلاً. يتم إجراء التغييرات بشكل مؤقت، غالبًا بناءً على مراجعة مثال أو مثالين فاشلة بدلاً من الاختبار المنهجي على نطاق واسع من السيناريوهات. نتيجة لذلك، قد يصلح تعديل واحد حالة معينة محددة بينما يقطع بصمت السلوك في عشرات الحالات الأخرى — ببساطة لأن أحداً لم يقس التأثير الكلي للتغيير.

كيفية عمل SkillOpt

يحول SkillOpt عملية تعديل المهارات نفسها، محولاً إياها إلى شيء مشابه لتدريب النموذج. بدلاً من تعديل يدوي واحد، تُعامل التعليمات كمعاملات قابلة للتعلم — تطبيق نفس المبدأ العام المستخدم في تحسين أوزان الشبكات العصبية: يتم اختبار التغييرات وتقييمها من حيث تأثيرها وقبولها أو رفضها بناءً على نتائج قابلة للقياس. يبقى نموذج اللغة الأساسي الأساسي دون تغيير — يتم تعديل طبقة النص من التعليمات فقط فوقه.

  • تم تطوير SkillOpt بواسطة فريق بحث Microsoft
  • تعليمات العميل (المهارات) تصبح معاملات قابلة للتعلم
  • تبقى أوزان نموذج اللغة الأساسية دون تغيير
  • الهدف من الطريقة هو جعل سلوك العميل أكثر موثوقية وقابلية للتنبؤ

لماذا هذا مهم لأنظمة العملاء الذكيين

كلما زادت المهام العملية المفوضة إلى عملاء ذكيين، زادت تكاليف كل خطأ غير متوقع. يعمل التعديل اليدوي للتعليمات بشكل جيد عندما يحل العميل مجموعة ضيقة من المهام البسيطة ويمكن التحقق من كل تعديل يدويًا. لكن مع نمو عدد المهارات وحالات الاستخدام، يتوقف هذا النهج عن التوسع — وهي بالضبط المشكلة التي يعالجها SkillOpt، وفقًا لبحث Microsoft، مما يوفر طريقة منهجية وقابلة للتكرار لتحسين تعليمات العميل.

كيف يختلف عن ضبط دقيق تقليدي

في التعلم الآلي الكلاسيكي، تحسين النموذج يعني دائماً العمل مع أوزانه: الضبط الدقيق، إعادة التدريب، التعلم المعزز. يقدم SkillOpt رافعة بديلة — تحسين ليس النموذج ذاته بل طبقة النص من التعليمات فوقه. هذا أرخص وأسرع بكثير من الضبط الدقيق الكلاسيكي لأنه لا يتطلب إعادة حساب أوزان النموذج، لكن بخلاف تعديلات المطالبات اليدوية الفردية، فإنه يستخدم مبادئ مستعارة من التدريب: التحقق من التأثير القابل للقياس والتحسين التكراري بدلاً من التعديلات الحدسية.

ما يعني هذا

إذا أصبح تعديل تعليمات العميل عملية قابلة للقياس وقابلة للتكرار بدلاً من الضبط اليدوي بالمحاولة والخطأ، يمكن للمطورين بسهولة أكبر استقرار سلوك عملاء الذكاء الاصطناعي مع تولي العملاء المزيد من المهام العملية. هذا يقلل أيضًا من خطر الانحدار الصامت: يقل احتمال أن يقطع تعديل المهارة الذي يمر الاختبار المنهجي سلوك العميل بصمت في سيناريوهات أخرى.

بالنسبة للفرق التي تقوم حالياً ببناء عملاء خاصة بهم على نماذج لغة كبيرة، هذه إشارة أخرى: يجب تصميم ونسخة مجموعة تعليمات العميل بعناية فائقة مثل الكود — مع الفحوصات ومقاييس الجودة وسجل واضح للتغييرات — وليس كملف نصي واحد يتم تحريره بشكل عشوائي.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…