arXiv cs.LG→ المصدر

Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN

Исследователи выложили на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks. Вместо «жёсткой копии» последних весов он сливает недавние версии online-сети по их важности для Q-функции. На играх Atari метод чаще всех конкурентов занимал первое место по итоговому качеству и обошёл DQN, Averaged DQN и PQN с обрезкой градиента.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.LG؛ بتحرير Hamidun News
Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN
المصدر: arXiv cs.LG. كولاج: Hamidun News.
◐ استمع للمقال

في يوليو 2026، نشر باحثون على arXiv طريقة MemoryMergeDQN — وهي طريقة جديدة لتحديث الشبكة الهدف (target network) في Deep Q-Networks، احتلت في ألعاب Atari المركز الأول من حيث جودة التدريب النهائية أكثر من أي من الطرق المنافسة.

ما الخلل في DQN القياسي؟

يحدّث DQN القياسي الشبكة الهدف عبر "نسخ صارم": يتم استبدال معاملات الشبكة الهدف دفعة واحدة بأحدث أوزان الشبكة online. هذا يعمل على استقرار التدريب على المدى القصير، لكن وفقًا لبيانات الورقة البحثية الأولية (preprint)، كل عملية استبدال من هذا النوع تغيّر بشكل حاد هدف الـbootstrap وتمحو التاريخ الحديث للمعاملات. والنتيجة هي فقدان بنية دالة القيمة التي كانت ستظل مفيدة لاحقًا، على المدى الطويل للتدريب.

كيف تعمل MemoryMergeDQN

تحتفظ MemoryMergeDQN بذاكرة قصيرة من النسخ الحديثة للشبكة online، وتبني الشبكة الهدف ليس عبر نسخ أحدث الأوزان، بل عبر دمجها حسب أهميتها للسلوك الحالي لدالة Q. تحصل المعاملات التي تظل ذات دلالة محلية لقيم Q الحالية على وزن أكبر، بينما يحافظ recency prior على النتيجة قريبة من أحدث الأوزان.

  • الآلية — تحديث الشبكة الهدف عبر دمج الأوزان، وليس النسخ الصارم
  • إشارة الأهمية — حساسية قيم Q (Q-value sensitivity)، وليس معلومات Fisher
  • مستوحاة من طريقة Fisher Weight Model Merging
  • تحتفظ بذاكرة قصيرة من النسخ الحديثة للشبكة online
  • يحافظ recency prior على الشبكة الهدف المدمجة قريبة من المعاملات الحالية

ماذا أظهرت الاختبارات على Atari

في ألعاب Atari، حققت MemoryMergeDQN أكبر عدد من المراكز الأولى من حيث الجودة النهائية بين جميع الطرق التي تم اختبارها. وقد قورنت بأربع مقاربات: DQN العادي، وAveragedDQN، وDQN مع تسوية الطبقات (layer normalization)، وPQN مع قص التدرج (gradient clipping). ويصف المؤلفون الطريقة بأنها "شديدة التنافسية": فقد تفوقت على DQN وAveragedDQN وPQN مع gradient clipping، وحققت مكسبًا ملحوظًا في عدة ألعاب حيث يكون الحفاظ على أوزان دالة القيمة المفيدة أمرًا مهمًا بشكل خاص.

"الدمج الانتقائي للأوزان الحديثة وتاريخ المعاملات يمكن أن يحسّن

استقرار وكلاء DQN وجودتهم النهائية"، كما جاء في استنتاجات الورقة البحثية الأولية على arXiv.

لماذا يهم هذا؟

يتبين أن تصميم تحديث الشبكة الهدف يشكل بحد ذاته رافعة للجودة، وليس مجرد تفصيل تقني. ويُظهر المؤلفون أن التعامل بعناية مع تاريخ المعاملات — بدلاً من إعادة ضبطه بالكامل مع كل نسخ صارم — يحافظ على بنية مفيدة لدالة القيمة على المدى الطويل للتدريب. وهذا ينقل التركيز من البنية ودالة الخسارة إلى الطريقة الدقيقة التي ترتبط بها الشبكة online والشبكة الهدف بين التحديثات.

ماذا يعني هذا

MemoryMergeDQN ليست بنية جديدة ولا دالة خسارة جديدة، بل هي طريقة مختلفة لنقل الأوزان إلى الشبكة الهدف. ويشير العمل إلى أن جزءًا من المكسب "المجاني" في reinforcement learning مخبأ في آلية تحديث الأهداف، وليس فقط في حجم الشبكة أو حجم البيانات.

أسئلة شائعة

بماذا تختلف MemoryMergeDQN عن AveragedDQN؟

تحسب AveragedDQN متوسط الشبكات الهدف الحديثة بشكل موحّد، بينما ترجّح MemoryMergeDQN الأوزان حسب أهميتها لدالة Q الحالية (Q-value sensitivity) وتضيف recency prior. وفي مقارنة مباشرة على Atari، تفوقت MemoryMergeDQN على AveragedDQN.

على ماذا تم اختبار الطريقة؟

قُيّمت الطريقة في بيئات Atari مقابل أربع مقاربات أساسية — DQN وAveragedDQN وDQN مع layer normalization وPQN مع gradient clipping. ومن حيث الجودة النهائية، احتلت MemoryMergeDQN المركز الأول في أكبر عدد من الألعاب.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…