arXiv cs.CL→ المصدر

DeepSearch-Evolve: وكيل ويب بـ9 مليارات معلمة يتعلم دون إشراف ويحقق 61% على GAIA

نشر باحثون مسودة DeepSearch-World: يدرّب إطار التقطير الذاتي DeepSearch-Evolve وكلاء الويب من خبرتهم الخاصة من دون مساعدة نماذج معلّمة أقوى. ويستند إلى بيئة قابلة للتحقق تضم 420 ألف مهمة متعددة الخطوات. وحقق نموذج DeepSearch-World-9B نسبة 61.5% على GAIA و93.4% على HotpotQA، منافسًا أفضل الوكلاء المفتوحين. وستُتاح البيئة ومجموعة البيانات والنموذج والكود بشكل مفتوح.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
DeepSearch-Evolve: وكيل ويب بـ9 مليارات معلمة يتعلم دون إشراف ويحقق 61% على GAIA
المصدر: arXiv cs.CL. كولاج: Hamidun News.
◐ استمع للمقال

نشر الباحثون ورقة بحثية على arXiv في 9 يوليو 2026 من DeepSearch-World: يسمح إطار عمل autodestillation DeepSearch-Evolve لوكلاء الويب بالتعلم من تجربتهم الخاصة دون الاعتماد على نماذج معلمين أقوى. حققت نموذج مع 9 مليارات معامل 61.5% على GAIA و 93.4% على HotpotQA.

لماذا يكون تعلم الوكلاء من التجربة أمر صعب جداً

يحتوي اثنان من الأنماط السائدة لتدريب الوكلاء على نقاط ضعف أساسية. يدرب الضبط الدقيق الخاضع للإشراف (SFT) الوكيل على مسارات ثابتة مقطرة من معلم: ينسخ النموذج تجربة الآخرين دون تطوير ملكه. يسمح التعلم المعزز (RL) بشكل محتمل بتعلم الوكيل من أخطائه، لكن في التفاعلات الطويلة — عندما يتخذ الوكيل عشرات الخطوات على الإنترنت قبل الحصول على مكافأة نهائية — تصبح المكافأة نادرة جداً للتعلم الفعال.

حل المؤلفون المشكلة بطريقة مختلفة: قاموا بإنشاء بيئة قابلة للتحقق حيث يتلقى الوكيل تعليقات كثيفة في كل خطوة دون الاعتماد على حكم خارجي.

كيف تعمل بيئة DeepSearch-World

DeepSearch-World هي بيئة حتمية وقابلة للعودة مع أداتين: البحث وقراءة الصفحة. يعني الحتمية أن نفس الاستعلام يعيد دائماً نفس النتيجة — ظروف مثالية للتدريب والمقارنة بين الوكلاء.

الخصائص الرئيسية:

  • 420 ألف مهمة متعددة الخطوات تم إنشاؤها من خلال مسيرات عشوائية على رسم بياني للكيانات
  • ثلاثة سلوكيات معرفية مدمجة: التحقق من التقدم، التفكير المتجذر، استرجاع الفشل
  • قابلية العودة الكاملة لأي مسار الوكيل

المهام هي "متعددة الخطوات": للإجابة على سؤال، يجب على الوكيل البحث المتتالي عن عدة حقائق ذات صلة، كل منها بناء على السابق.

ما النتائج التي حققها النموذج بدون معلم

يمر إطار عمل DeepSearch-Evolve بشكل متكرر بأربع مراحل: توليد المسار → الفلترة → مزج البيانات → الضبط الدقيق. في كل تكرار، يختار الوكيل المسارات الناجحة ويضيفها إلى البيانات المتراكمة ويعيد التدريب — يتحسن تدريجياً بدون مساعدة خارجية.

أظهرت نموذج DeepSearch-World-9B بدون تقطير من GPT-4 أو نماذج حدود أخرى نتائج تنافسية بين الوكلاء المفتوحين:

  • 31.2% على BrowseComp — معيار ملاحة الويب الحقيقية من OpenAI
  • 61.5% على GAIA — اختبار عالمي لمساعدات الذكاء الاصطناعي
  • 93.4% على HotpotQA — البحث متعدد الخطوات عن الحقائق المرتبطة
"تفتح البيئات القابلة للتحقق الطريق نحو التطور الذاتي القابل للتوسع

للوكلاء ذوي آفاق التفاعل الطويلة".

يخطط المؤلفون لفتح البيئة وعدد 420 ألف مهمة ومجموعة التحقق ونقطة تفتيش النموذج والكود الكامل.

ماذا يعني هذا

تغلق الدراسة سؤالاً مهماً: هل تحتاج إلى نموذج حدود لتنمية وكيل قوي؟ اتضح — لا، إذا كانت بيئة التدريب منظمة بشكل صحيح. تسمح البيئة القابلة للتحقق مع المكافآت الكثيفة بتحسن الوكيل ذاتياً دون الاعتماد على نماذج تجارية مغلقة — خطوة مهمة نحو وكلاء الويب من الجيل القادم المفتوحين والقابلين للتوسع.

أسئلة مكررة

ما هو BrowseComp ولماذا 31.2% هو نتيجة جيدة؟

BrowseComp هو معيار من OpenAI لتقييم قدرة الوكلاء على العمل مع الإنترنت الحقيقي؛ المهام معقدة بقصد، والنتائج فوق 30% تعتبر تنافسية بين النماذج المفتوحة حتى 10 مليارات معامل.

متى سيتم إصدار مجموعة بيانات DeepSearch-World المفتوحة؟

أعلن المؤلفون عن فتح البيئة و 420 ألف مهمة ومجموعة التحقق والنموذج والكود، لكن لا يتم تحديد أي تاريخ محدد لإصدار عام في ورقة بحثية من 9 يوليو 2026.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…