arXiv cs.LG→ original

Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN

Исследователи выложили на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks. Вместо «жёсткой копии» последних весов он сливает недавние версии online-сети по их важности для Q-функции. На играх Atari метод чаще всех конкурентов занимал первое место по итоговому качеству и обошёл DQN, Averaged DQN и PQN с обрезкой градиента.

Traité par IA depuis arXiv cs.LG ; édité par Hamidun News
Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN
Source : arXiv cs.LG. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, des chercheurs ont publié sur arXiv la méthode MemoryMergeDQN — une nouvelle façon de mettre à jour le réseau cible (target network) dans les Deep Q-Networks qui, sur les jeux Atari, a obtenu la première place en qualité finale d'entraînement plus souvent que n'importe laquelle des méthodes concurrentes.

Qu'est-ce qui ne va pas avec le DQN standard ?

Le DQN standard met à jour le réseau cible par une « copie dure » : les paramètres du réseau cible sont remplacés d'un coup par les derniers poids du réseau online. Cela stabilise l'entraînement à court terme, mais, selon le préprint, chaque remplacement de ce type modifie brutalement la cible du bootstrap et efface l'historique récent des paramètres. Il en résulte une perte de structure de la fonction de valeur qui aurait encore été utile plus tard, sur l'horizon long de l'entraînement.

Comment fonctionne MemoryMergeDQN

MemoryMergeDQN conserve une courte mémoire des copies récentes du réseau online et construit le réseau cible non pas en copiant les derniers poids, mais en les fusionnant selon leur importance pour le comportement actuel de la fonction Q. Les paramètres qui restent localement significatifs pour les valeurs Q actuelles reçoivent un poids plus important, tandis qu'un recency prior maintient le résultat proche des poids les plus récents.

  • Mécanisme — mise à jour du réseau cible par fusion des poids, et non par copie dure
  • Signal d'importance — sensibilité des valeurs Q (Q-value sensitivity), et non information de Fisher
  • Inspiré de la méthode Fisher Weight Model Merging
  • Conserve une courte mémoire des versions récentes du réseau online
  • Un recency prior maintient le réseau cible fusionné proche des paramètres actuels

Ce qu'ont montré les tests sur Atari

Sur les jeux Atari, MemoryMergeDQN a obtenu le plus grand nombre de premières places en qualité finale parmi toutes les méthodes testées. Il a été comparé à quatre approches : le DQN classique, AveragedDQN, le DQN avec normalisation de couches (layer normalization) et PQN avec écrêtage de gradient (gradient clipping). Les auteurs qualifient la méthode de « hautement compétitive » : elle a surpassé DQN, AveragedDQN et PQN avec gradient clipping, et a apporté un gain notable dans plusieurs jeux où la préservation des poids utiles de la fonction de valeur est particulièrement importante.

«

La fusion sélective des poids récents et de l'historique des paramètres peut améliorer la stabilité et la qualité finale des agents DQN », indiquent les conclusions du préprint sur arXiv.

Pourquoi c'est important

La conception de la mise à jour du réseau cible s'avère être en soi un levier de qualité, et non un détail technique. Les auteurs montrent qu'un traitement soigné de l'historique des paramètres — plutôt qu'une remise à zéro complète à chaque copie dure — préserve une structure utile de la fonction de valeur sur l'horizon long de l'entraînement. Cela déplace l'attention de l'architecture et de la fonction de perte vers la manière précise dont le réseau online et le réseau cible sont reliés entre les mises à jour.

Ce que cela signifie

MemoryMergeDQN n'est ni une nouvelle architecture ni une nouvelle fonction de perte, mais une autre façon de transférer les poids vers le réseau cible. Ce travail suggère qu'une partie du gain « gratuit » en reinforcement learning se cache dans la mécanique de mise à jour des cibles, et pas seulement dans la taille du réseau ou le volume de données.

Questions fréquentes

En quoi MemoryMergeDQN diffère-t-il d'AveragedDQN ?

AveragedDQN fait la moyenne uniforme des réseaux cibles récents, tandis que MemoryMergeDQN pondère les poids selon leur importance pour la fonction Q actuelle (Q-value sensitivity) et ajoute un recency prior. Dans une comparaison directe sur Atari, MemoryMergeDQN a surpassé AveragedDQN.

Sur quoi la méthode a-t-elle été testée ?

La méthode a été évaluée dans des environnements Atari face à quatre approches de référence — DQN, AveragedDQN, DQN avec layer normalization et PQN avec gradient clipping. En qualité finale, MemoryMergeDQN a pris la première place dans le plus grand nombre de jeux.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…