Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN
Исследователи выложили на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks. Вместо «жёсткой копии» последних весов он сливает недавние версии online-сети по их важности для Q-функции. На играх Atari метод чаще всех конкурентов занимал первое место по итоговому качеству и обошёл DQN, Averaged DQN и PQN с обрезкой градиента.
Processado por IA de arXiv cs.LG; editado por Hamidun News
Em julho de 2026, pesquisadores publicaram no arXiv o método MemoryMergeDQN — uma nova forma de atualizar a rede-alvo (target network) em Deep Q-Networks que, nos jogos da Atari, ficou em primeiro lugar em qualidade final de treinamento com mais frequência do que qualquer um dos métodos concorrentes.
O que há de errado com o DQN padrão?
O DQN padrão atualiza a rede-alvo por meio de uma "cópia rígida": os parâmetros da rede-alvo são substituídos de uma vez pelos pesos mais recentes da rede online. Isso estabiliza o treinamento no curto prazo, mas, segundo o preprint, cada uma dessas substituições muda bruscamente o alvo do bootstrap e apaga o histórico recente de parâmetros. Como resultado, perde-se estrutura da função de valor que ainda seria útil mais adiante, no horizonte longo do treinamento.
Como funciona o MemoryMergeDQN
O MemoryMergeDQN mantém uma memória curta de cópias recentes da rede online e constrói a rede-alvo não copiando os pesos mais recentes, mas fundindo-os de acordo com a importância para o comportamento atual da função Q. Os parâmetros que permanecem localmente relevantes para os valores Q atuais recebem maior peso, enquanto um recency prior mantém o resultado próximo aos pesos mais recentes.
- Mecanismo — atualiza a rede-alvo por fusão de pesos, não por cópia rígida
- Sinal de importância — sensibilidade dos valores Q (Q-value sensitivity), não informação de Fisher
- Inspirado no método Fisher Weight Model Merging
- Mantém uma memória curta de versões recentes da rede online
- Um recency prior mantém a rede-alvo fundida próxima aos parâmetros atuais
O que os testes na Atari mostraram
Nos jogos da Atari, o MemoryMergeDQN obteve o maior número de primeiros lugares em qualidade final entre todos os métodos testados. Ele foi comparado a quatro abordagens: DQN comum, AveragedDQN, DQN com normalização de camadas (layer normalization) e PQN com recorte de gradiente (gradient clipping). Os autores chamam o método de "altamente competitivo": ele superou o DQN, o AveragedDQN e o PQN com gradient clipping, e trouxe um ganho notável em vários jogos em que preservar pesos úteis da função de valor é especialmente importante.
"A fusão seletiva de pesos recentes e do histórico de parâmetros pode
melhorar a estabilidade e a qualidade final dos agentes DQN", afirmam as conclusões do preprint no arXiv.
Por que isso importa
O design da atualização da rede-alvo se revela, por si só, uma alavanca de qualidade, e não um detalhe técnico. Os autores mostram que tratar o histórico de parâmetros com cuidado — em vez de zerá-lo por completo a cada cópia rígida — preserva estrutura útil da função de valor ao longo do horizonte longo de treinamento. Isso desloca o foco da arquitetura e da função de perda para a forma exata como a rede online e a rede-alvo se conectam entre as atualizações.
O que isso significa
O MemoryMergeDQN não é uma nova arquitetura nem uma nova função de perda, mas uma forma diferente de transferir pesos para a rede-alvo. O trabalho sugere que parte do ganho "gratuito" em reinforcement learning está escondida na mecânica de atualização dos alvos, e não apenas no tamanho da rede ou no volume de dados.
Perguntas frequentes
Qual a diferença entre MemoryMergeDQN e AveragedDQN?
O AveragedDQN faz a média uniforme das redes-alvo recentes, enquanto o MemoryMergeDQN pondera os pesos de acordo com sua importância para a função Q atual (Q-value sensitivity) e adiciona um recency prior. Em comparação direta na Atari, o MemoryMergeDQN superou o AveragedDQN.
Com que o método foi testado?
O método foi avaliado em ambientes da Atari contra quatro abordagens de referência — DQN, AveragedDQN, DQN com layer normalization e PQN com gradient clipping. Em qualidade final, o MemoryMergeDQN ficou em primeiro lugar no maior número de jogos.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.