arXiv cs.LG→ оригинал

Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN

Исследователи выложили на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks. Вместо «жёсткой копии» последних весов он сливает недавние версии online-сети по их важности для Q-функции. На играх Atari метод чаще всех конкурентов занимал первое место по итоговому качеству и обошёл DQN, Averaged DQN и PQN с обрезкой градиента.

AI-обработка оригинала arXiv cs.LG; редакция Hamidun News
Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN
Источник: arXiv cs.LG. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи в июле 2026 года опубликовали на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks, который на играх Atari чаще любого из конкурирующих методов занимал первое место по итоговому качеству обучения.

Что не так со стандартным DQN?

Стандартный DQN обновляет target-сеть «жёсткой копией»: параметры целевой сети разом заменяются последними весами online-сети. Это стабилизирует обучение в короткой перспективе, но, по данным препринта, каждая такая замена резко меняет цель бутстрэпа и стирает недавнюю историю параметров. В результате теряется структура функции ценности, которая ещё пригодилась бы позже, на длинном горизонте обучения.

Как работает Memory Merge DQN

Memory Merge DQN хранит короткую память из недавних копий online-сети и строит target-сеть не копированием последних весов, а их слиянием по важности для текущего поведения Q-функции. Больший вес получают параметры, которые остаются локально значимыми для текущих Q-значений, а recency prior удерживает результат близко к самым свежим весам.

  • Механизм — обновление target-сети через слияние весов, а не жёсткую копию
  • Сигнал важности — чувствительность Q-значений (Q-value sensitivity), а не информация Фишера
  • Вдохновлён методом Fisher Weight Model Merging
  • Хранит короткую память недавних версий online-сети
  • Recency prior держит слитую target близко к актуальным параметрам

Что показали тесты на Atari

На играх Atari Memory Merge DQN набрал наибольшее число первых мест по итоговому качеству среди всех протестированных методов. Его сравнивали с четырьмя подходами: обычным DQN, Averaged DQN, DQN со слоевой нормализацией (layer normalization) и PQN с обрезкой градиента (gradient clipping). Авторы называют метод «высококонкурентным»: он обошёл DQN, Averaged DQN и PQN с gradient clipping и дал заметный прирост в нескольких играх, где сохранение полезных весов функции ценности особенно важно.

«Избирательное слияние недавних весов и истории параметров может

улучшить стабильность и итоговое качество агентов DQN», — говорится в выводах препринта на arXiv.

Почему это важно?

Дизайн обновления target-сети сам по себе оказывается рычагом качества, а не технической деталью. Авторы показывают, что бережное отношение к истории параметров — вместо их полного сброса при каждой жёсткой копии — сохраняет полезную структуру функции ценности на длинном горизонте обучения. Это переносит фокус с архитектуры и функции потерь на то, как именно связаны online- и target-сети между обновлениями.

Что это значит

Memory Merge DQN — это не новая архитектура и не новый лосс, а другой способ переносить веса в target-сеть. Работа намекает, что часть «бесплатного» прироста в reinforcement learning спрятана в механике обновления целей, а не только в размере сети или объёме данных.

Частые вопросы

Чем Memory Merge DQN отличается от Averaged DQN?

Averaged DQN усредняет недавние target-сети равномерно, а Memory Merge DQN взвешивает веса по их важности для текущей Q-функции (Q-value sensitivity) и добавляет recency prior. В прямом сравнении на Atari Memory Merge DQN обошёл Averaged DQN.

На чём тестировали метод?

Метод оценивали в средах Atari против четырёх базовых подходов — DQN, Averaged DQN, DQN с layer normalization и PQN с gradient clipping. По итоговому качеству Memory Merge DQN занял первое место в наибольшем числе игр.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…