arXiv cs.LG→ original

Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN

Исследователи выложили на arXiv метод Memory Merge DQN — новый способ обновлять target-сеть в Deep Q-Networks. Вместо «жёсткой копии» последних весов он сливает недавние версии online-сети по их важности для Q-функции. На играх Atari метод чаще всех конкурентов занимал первое место по итоговому качеству и обошёл DQN, Averaged DQN и PQN с обрезкой градиента.

Processado por IA de arXiv cs.LG; editado por Hamidun News
Memory Merge DQN: слияние весов target-сети вместо жёсткой замены в DQN
Fonte: arXiv cs.LG. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, pesquisadores publicaram no arXiv o método MemoryMergeDQN — uma nova forma de atualizar a rede-alvo (target network) em Deep Q-Networks que, nos jogos da Atari, ficou em primeiro lugar em qualidade final de treinamento com mais frequência do que qualquer um dos métodos concorrentes.

O que há de errado com o DQN padrão?

O DQN padrão atualiza a rede-alvo por meio de uma "cópia rígida": os parâmetros da rede-alvo são substituídos de uma vez pelos pesos mais recentes da rede online. Isso estabiliza o treinamento no curto prazo, mas, segundo o preprint, cada uma dessas substituições muda bruscamente o alvo do bootstrap e apaga o histórico recente de parâmetros. Como resultado, perde-se estrutura da função de valor que ainda seria útil mais adiante, no horizonte longo do treinamento.

Como funciona o MemoryMergeDQN

O MemoryMergeDQN mantém uma memória curta de cópias recentes da rede online e constrói a rede-alvo não copiando os pesos mais recentes, mas fundindo-os de acordo com a importância para o comportamento atual da função Q. Os parâmetros que permanecem localmente relevantes para os valores Q atuais recebem maior peso, enquanto um recency prior mantém o resultado próximo aos pesos mais recentes.

  • Mecanismo — atualiza a rede-alvo por fusão de pesos, não por cópia rígida
  • Sinal de importância — sensibilidade dos valores Q (Q-value sensitivity), não informação de Fisher
  • Inspirado no método Fisher Weight Model Merging
  • Mantém uma memória curta de versões recentes da rede online
  • Um recency prior mantém a rede-alvo fundida próxima aos parâmetros atuais

O que os testes na Atari mostraram

Nos jogos da Atari, o MemoryMergeDQN obteve o maior número de primeiros lugares em qualidade final entre todos os métodos testados. Ele foi comparado a quatro abordagens: DQN comum, AveragedDQN, DQN com normalização de camadas (layer normalization) e PQN com recorte de gradiente (gradient clipping). Os autores chamam o método de "altamente competitivo": ele superou o DQN, o AveragedDQN e o PQN com gradient clipping, e trouxe um ganho notável em vários jogos em que preservar pesos úteis da função de valor é especialmente importante.

"A fusão seletiva de pesos recentes e do histórico de parâmetros pode

melhorar a estabilidade e a qualidade final dos agentes DQN", afirmam as conclusões do preprint no arXiv.

Por que isso importa

O design da atualização da rede-alvo se revela, por si só, uma alavanca de qualidade, e não um detalhe técnico. Os autores mostram que tratar o histórico de parâmetros com cuidado — em vez de zerá-lo por completo a cada cópia rígida — preserva estrutura útil da função de valor ao longo do horizonte longo de treinamento. Isso desloca o foco da arquitetura e da função de perda para a forma exata como a rede online e a rede-alvo se conectam entre as atualizações.

O que isso significa

O MemoryMergeDQN não é uma nova arquitetura nem uma nova função de perda, mas uma forma diferente de transferir pesos para a rede-alvo. O trabalho sugere que parte do ganho "gratuito" em reinforcement learning está escondida na mecânica de atualização dos alvos, e não apenas no tamanho da rede ou no volume de dados.

Perguntas frequentes

Qual a diferença entre MemoryMergeDQN e AveragedDQN?

O AveragedDQN faz a média uniforme das redes-alvo recentes, enquanto o MemoryMergeDQN pondera os pesos de acordo com sua importância para a função Q atual (Q-value sensitivity) e adiciona um recency prior. Em comparação direta na Atari, o MemoryMergeDQN superou o AveragedDQN.

Com que o método foi testado?

O método foi avaliado em ambientes da Atari contra quatro abordagens de referência — DQN, AveragedDQN, DQN com layer normalization e PQN com gradient clipping. Em qualidade final, o MemoryMergeDQN ficou em primeiro lugar no maior número de jogos.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…