MarkTechPost→ المصدر

Hugging Face و Lambda: كيف تُحلّل reasoning traces الخاصة بالوكلاء وتُجري لها fine-tuning

حللت MarkTechPost مجموعة البيانات lambda/hermes-agent-reasoning-traces على Hugging Face وقدمت pipeline كاملاً للعمل مع reasoning traces الخاصة بالوكلاء. يتضمن الشرح تحليل كتل think و tool_call و tool_response، وتحليلات لطول الحوارات والأخطاء، ومرئيات، وتجهيز البيانات لـ supervised fine-tuning، وحلقة تدريب تجريبية على مجموعة فرعية صغيرة، وأساسًا جاهزًا لبناء eval pipelines مخصصة.

معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
Hugging Face و Lambda: كيف تُحلّل reasoning traces الخاصة بالوكلاء وتُجري لها fine-tuning
المصدر: MarkTechPost. كولاج: Hamidun News.
◐ استمع للمقال

نشرت MarkTechPost تحليلاً عملياً لمجموعة بيانات lambda/hermes-agent-reasoning-traces، والتي تساعد على دراسة كيفية تفكير وكلاء الذكاء الاصطناعي واستدعاء الأدوات والاستجابة في الحوارات متعددة الخطوات. هذا ليس إطلاق نموذج جديد، بل خط أنابيب عمل جاهز: من تحليل الآثار الخام إلى التحليل والتصور وإعداد البيانات للضبط الدقيق.

ما بداخل مجموعة البيانات

يتمحور المحتوى حول مجموعة بيانات على Hugging Face من Lambda بتكوينين: kimi و glm-5.1. يحتوي الأول على 7646 مثالاً، والثاني على 7055. يحتوي كل مثال على قائمة الرسائل ووصف الأدوات المتاحة وفئة المهمة والفئة الفرعية والاستعلام الأصلي للمستخدم. الصيغة قريبة من ShareGPT: يحتوي الحوار على رسائل النظام والمستخدم والوكيل والأداة، لذا من سجل واحد يمكنك إعادة بناء تقريباً كل سير عمل الوكيل.

"كل مثال هو حوار وكيل حقيقي مع تفكير خطوة بخطوة ونتائج فعلية لاستدعاء الأدوات."

تكمن القيمة الرئيسية لمجموعة البيانات في أنها تحتوي ليس فقط على الإجابة النهائية، بل أيضاً على الخطوات الوسيطة. بالنسبة لتكوين kimi، يتم الإبلاغ عن متوسط طول 24.3 دورة لكل مثال و 13.9 استدعاء أداة؛ بالنسبة لـ glm-5.1 — 19.1 دورة و 9.7 استدعاءات. تحتوي مجموعة البيانات على تسع فئات في المجموع، بما في ذلك Terminal & Coding و Agent Tools و Repository Tasks و Browser Automation و File Operations. بمعنى آخر، تحتوي هذه المجموعة ليس على أسئلة بسيطة، بل على سيناريوهات حقيقية حيث يكتب الوكيل الكود ويستعرض الويب ويعمل مع الملفات ويستدعي وظائف خارجية.

كيفية عمل التحليل

يبدأ المؤلفون بفحص أساسي لانقسام التدريب باستخدام مكتبة datasets: يفحصون الحقول والفئات والأمثلة الفردية. بعد ذلك، يقومون بإنشاء محللين باستخدام التعبيرات العادية لاستخراج كتل التفكير واستدعاءات الوظائف واستجابات الأدوات بشكل منفصل. هذه الخطوة ضرورية لتقسيم مسار وكيل واحد إلى أجزاء مفهومة وتحليل التفكير الداخلي والإجراءات والرد النهائي بشكل منفصل.

  • يتم استخراج الأفكار واستدعاءات الأدوات والنص النهائي من رسائل الوكيل
  • يتم وضع علامات على أخطاء تحليل JSON بشكل منفصل لتجنب كسر خط الأنابيب
  • يتم حساب المقاييس المتوسطة عبر العينة: طول الحوار وعدد الاستدعاءات وتكرار الأخطاء
  • يتم بناء الرسوم البيانية للأدوات الشهيرة والاستدعاءات المتوازية وتوزيع الفئات

على عينة من 3000 مسار، يحسب الدليل المقاييس المتوسطة ويصورها من خلال matplotlib. كما يوضح كيفية عرض آثر واحد كامل بصيغة قابلة للقراءة: حيث كان استعلام المستخدم، حيث فكر الوكيل، أي أداة استدعاها وما أرجعته. بالنسبة للفرق التي تقيم الوكلاء، هذا مفيد بشكل خاص: بدلاً من درجة نهائية واحدة، يمكنك رؤية أنماط السلوك الفعلية والاستدعاءات غير الضرورية والأفكار الفارغة والأخطاء المتكررة في استجابات الأدوات.

التحضير للتدريب

في النصف الثاني، ينتقل المحتوى من التحليل إلى الممارسة الفعلية. يتم تحويل الحوارات إلى صيغة رسائل متوافقة مع نماذج الدردشة وخطوط الأنابيب التدريبية النموذجية، وإعادة تغليف استجابات الأدوات كسياق إدخال للخطوة التالية. ثم يأتي الترميز والحجاب: فقط رموز رسائل المساعد تدخل الخسارة، بينما يتم حجب كل شيء آخر.

هذا أساس مهم للضبط الدقيق الخاضع للإشراف، إذا كان الهدف هو تدريب النموذج على الاستجابة والتصرف بناءً على مسار تم قطعه بالفعل. يضيف المؤلفون أيضاً مشغل آثار صغير يسمح بتشغيل سلوك الوكيل خطوة بخطوة، ودورة تدريب توضيحية عبر TRL. يستخدم المثال محلل من Qwen2.

5 ومجموعة تدريب صغيرة، لذا فهو أكثر من نموذج من وصفة جاهزة للإنتاج. لكن هذا في الواقع ميزة للمحتوى: يمكنك تشغيله بسرعة وتغيير الإعدادات وإضافة مقاييسك الخاصة والحصول على مختبر أساسي لتحليل آثار الوكلاء بدون إعداد طويل وبنية تحتية غير ضرورية.

ماذا يعني هذا

يتحول السوق تدريجياً من تقييم الإجابة النهائية فقط إلى تحليل السلوك الكامل لوكلاء الذكاء الاصطناعي. تعطي هذه مجموعات البيانات والأدلة الفرق طريقة عملية للنظر ليس فقط إلى ما أجاب به النموذج، بل أيضاً إلى كيفية تفكيره بالضبط وأخطائه واستدعاؤه للأدوات والمجالات التي يجب أن يتم ضبطه بدقة فيها لاحقاً.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…