Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN
Исследователи выложили на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks. Вместо «жёсткой копии» последних весов он сливает недавние версии online-сети по их важности для Q-функции. На играх Atari метод чаще всех конкурентов занимал первое место по итоговому качеству и обошёл DQN, Averaged DQN и PQN с обрезкой градиента.
AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Исследователи в июле 2026 года опубликовали на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks, который на играх Atari чаще любого из конкурирующих методов занимал первое место по итоговому качеству обучения.
Что не так со стандартным DQN?
Стандартный DQN обновляет target-сеть «жёсткой копией»: параметры целевой сети разом заменяются последними весами online-сети. Это стабилизирует обучение в короткой перспективе, но, по данным препринта, каждая такая замена резко меняет цель бутстрэпа и стирает недавнюю историю параметров. В результате теряется структура функции ценности, которая ещё пригодилась бы позже, на длинном горизонте обучения.
Как работает Memory Merge DQN
Memory Merge DQN хранит короткую память из недавних копий online-сети и строит target-сеть не копированием последних весов, а их слиянием по важности для текущего поведения Q-функции. Больший вес получают параметры, которые остаются локально значимыми для текущих Q-значений, а recency prior удерживает результат близко к самым свежим весам.
- Механизм — обновление target-сети через слияние весов, а не жёсткую копию
- Сигнал важности — чувствительность Q-значений (Q-value sensitivity), а не информация Фишера
- Вдохновлён методом Fisher Weight Model Merging
- Хранит короткую память недавних версий online-сети
- Recency prior держит слитую target близко к актуальным параметрам
Что показали тесты на Atari
На играх Atari Memory Merge DQN набрал наибольшее число первых мест по итоговому качеству среди всех протестированных методов. Его сравнивали с четырьмя подходами: обычным DQN, Averaged DQN, DQN со слоевой нормализацией (layer normalization) и PQN с обрезкой градиента (gradient clipping). Авторы называют метод «высококонкурентным»: он обошёл DQN, Averaged DQN и PQN с gradient clipping и дал заметный прирост в нескольких играх, где сохранение полезных весов функции ценности особенно важно.
«Избирательное слияние недавних весов и истории параметров может
улучшить стабильность и итоговое качество агентов DQN», — говорится в выводах препринта на arXiv.
Почему это важно?
Дизайн обновления target-сети сам по себе оказывается рычагом качества, а не технической деталью. Авторы показывают, что бережное отношение к истории параметров — вместо их полного сброса при каждой жёсткой копии — сохраняет полезную структуру функции ценности на длинном горизонте обучения. Это переносит фокус с архитектуры и функции потерь на то, как именно связаны online- и target-сети между обновлениями.
Что это значит
Memory Merge DQN — это не новая архитектура и не новый лосс, а другой способ переносить веса в target-сеть. Работа намекает, что часть «бесплатного» прироста в reinforcement learning спрятана в механике обновления целей, а не только в размере сети или объёме данных.
Частые вопросы
Чем Memory Merge DQN отличается от Averaged DQN?
Averaged DQN усредняет недавние target-сети равномерно, а Memory Merge DQN взвешивает веса по их важности для текущей Q-функции (Q-value sensitivity) и добавляет recency prior. В прямом сравнении на Atari Memory Merge DQN обошёл Averaged DQN.
На чём тестировали метод?
Метод оценивали в средах Atari против четырёх базовых подходов — DQN, Averaged DQN, DQN с layer normalization и PQN с gradient clipping. По итоговому качеству Memory Merge DQN занял первое место в наибольшем числе игр.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.