Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN
Исследователи выложили на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks. Вместо «жёсткой копии» последних весов он сливает недавние версии online-сети по их важности для Q-функции. На играх Atari метод чаще всех конкурентов занимал первое место по итоговому качеству и обошёл DQN, Averaged DQN и PQN с обрезкой градиента.
Procesado por IA desde arXiv cs.LG; editado por Hamidun News
En julio de 2026, investigadores publicaron en arXiv el método MemoryMergeDQN, una nueva forma de actualizar la red objetivo (target network) en Deep Q-Networks que, en los juegos de Atari, ocupó el primer puesto en calidad final de entrenamiento con más frecuencia que cualquiera de los métodos competidores.
¿Qué falla en el DQN estándar?
El DQN estándar actualiza la red objetivo mediante una "copia dura": los parámetros de la red objetivo se reemplazan de golpe por los pesos más recientes de la red online. Esto estabiliza el entrenamiento a corto plazo, pero, según los datos del preprint, cada uno de estos reemplazos cambia bruscamente el objetivo del bootstrap y borra el historial reciente de parámetros. Como resultado, se pierde estructura de la función de valor que aún sería útil más adelante, en el horizonte largo del entrenamiento.
Cómo funciona MemoryMergeDQN
MemoryMergeDQN mantiene una memoria corta de copias recientes de la red online y construye la red objetivo no copiando los últimos pesos, sino fusionándolos según su importancia para el comportamiento actual de la función Q. Los parámetros que siguen siendo localmente relevantes para los valores Q actuales reciben mayor peso, mientras que un recency prior mantiene el resultado cerca de los pesos más recientes.
- Mecanismo: actualiza la red objetivo mediante fusión de pesos, no mediante copia dura
- Señal de importancia: sensibilidad de los valores Q (Q-value sensitivity), no información de Fisher
- Inspirado en el método Fisher Weight Model Merging
- Mantiene una memoria corta de versiones recientes de la red online
- Un recency prior mantiene la red objetivo fusionada cerca de los parámetros actuales
Qué mostraron las pruebas en Atari
En los juegos de Atari, MemoryMergeDQN obtuvo el mayor número de primeros puestos en calidad final entre todos los métodos probados. Se comparó con cuatro enfoques: DQN estándar, AveragedDQN, DQN con normalización de capas (layer normalization) y PQN con recorte de gradiente (gradient clipping). Los autores califican el método de "altamente competitivo": superó a DQN, AveragedDQN y PQN con gradient clipping, y ofreció una ganancia notable en varios juegos donde conservar los pesos útiles de la función de valor es especialmente importante.
"La fusión selectiva de pesos recientes e historial de parámetros
puede mejorar la estabilidad y la calidad final de los agentes DQN", se afirma en las conclusiones del preprint en arXiv.
Por qué es importante
El diseño de la actualización de la red objetivo resulta ser, en sí mismo, una palanca de calidad, y no un detalle técnico. Los autores muestran que tratar con cuidado el historial de parámetros —en lugar de reiniciarlo por completo en cada copia dura— conserva estructura útil de la función de valor a lo largo del horizonte largo de entrenamiento. Esto traslada el foco de la arquitectura y la función de pérdida a cómo, exactamente, están conectadas la red online y la red objetivo entre actualizaciones.
Qué significa esto
MemoryMergeDQN no es una arquitectura nueva ni una nueva función de pérdida, sino una forma distinta de transferir los pesos a la red objetivo. El trabajo sugiere que parte de la ganancia "gratuita" en reinforcement learning está escondida en la mecánica de actualización de los objetivos, y no solo en el tamaño de la red o el volumen de datos.
Preguntas frecuentes
¿En qué se diferencia MemoryMergeDQN de AveragedDQN?
AveragedDQN promedia de forma uniforme las redes objetivo recientes, mientras que MemoryMergeDQN pondera los pesos según su importancia para la función Q actual (Q-value sensitivity) y añade un recency prior. En una comparación directa en Atari, MemoryMergeDQN superó a AveragedDQN.
¿Con qué se probó el método?
El método se evaluó en entornos de Atari frente a cuatro enfoques base: DQN, AveragedDQN, DQN con layer normalization y PQN con gradient clipping. Por calidad final, MemoryMergeDQN ocupó el primer puesto en el mayor número de juegos.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.