ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG
Исследователи представили ProGraph — двухслойную память для LLM-агентов. Она набрала 80,1% на новом бенчмарке multi-hop-памяти MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG. Вместо явного графа знаний ProGraph использует текстовые профили и совместно извлекаемые точные факты — даты, числа и объекты — без лишних вызовов API.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Pesquisadores apresentaram o ProGraph (Profile-Graph Memory) — uma arquitetura de memória de longo prazo em duas camadas para agentes LLM que saiu como preprint no arXiv em julho de 2026 e obteve 80,1% no novo benchmark MemHop e 78,4% no LoCoMo, superando Mem0, A-Mem, HippoRAG e RAG.
Por que era preciso um novo benchmark
O MemHop é um benchmark de 1000 perguntas com profundidade de conexão de 1 a 5 saltos (hops) em 10 cenários de redes sociais, com anotação de evidências em cada salto.
Segundo o preprint no arXiv, os testes de memória existentes em geral verificam apenas o single-hop recall e praticamente não medem as associações multi-hop — a ligação de fatos por meio de uma cadeia de entidades intermediárias.
O MemHop preenche essa lacuna e permite avaliar separadamente a profundidade do raciocínio do agente.
Como funciona o ProGraph
O ProGraph opera em duas camadas e não constrói um grafo de conhecimento explícito.
A primeira camada é o profile expansion: uma varredura por substrings de nomes de entidades que ocorrem naturalmente nos perfis de texto escritos pelo próprio modelo. É um substituto mínimo para a construção manual de um knowledge graph.
A segunda camada são os compression residuals: datas exatas, quantidades e objetos nomeados que são extraídos junto com cada atualização do perfil, sem chamadas adicionais de API (zero extra API cost).
Uma ablação completa em grade (full-grid ablation) mostrou que os mecanismos são especializados. Remover o profile expansion custa menos 22,6 pontos percentuais no MemHop; não extrair os compression residuals em conjunto custa menos 8,6 pontos no LoCoMo. Os efeitos cruzados dentro de uma mesma arquitetura permanecem abaixo de 3 pontos.
- Benchmark MemHop: 1000 perguntas, profundidade de 1 a 5 saltos, 10 cenários de redes sociais
- ProGraph: 80,1% no MemHop (no nível do baseline Full Context) e 78,4% no LoCoMo (+11,3 p.p. em relação ao Full Context)
- O profile expansion é responsável pelo multi-hop: −22,6 p.p. no MemHop quando removido
- Os compression residuals são responsáveis pela precisão: −8,6 p.p. no LoCoMo sem extração conjunta
- Supera Mem0, A-Mem, HippoRAG e RAG em ambos os benchmarks
Por que o resultado importa
O ProGraph superou o baseline Full Context em 11,3 pontos no LoCoMo e empatou com ele no MemHop — tudo isso sem manter todo o histórico na janela de contexto e sem construir um grafo explícito. Isso significa que o agente consegue responder a perguntas encadeadas apoiando-se em perfis comprimidos e resíduos de fatos, em vez de no histórico completo da conversa.
«A expansão por perfis garante o raciocínio multi-hop, enquanto os
resíduos de compressão garantem a precisão de recuperação», afirma o resumo do preprint no arXiv.
Os autores disponibilizaram em acesso aberto tanto o benchmark MemHop quanto a implementação do ProGraph e as implementações baseline dos concorrentes — ou seja, os números divulgados podem ser reproduzidos de forma independente.
O que isso significa
A memória para agentes LLM está migrando da abordagem de "enfiar todo o contexto" e dos pesados grafos de conhecimento para perfis de texto leves com fatos pontuais. O ProGraph mostra que um método barato é capaz de alcançar o contexto completo em perguntas profundas — e superá-lo onde importa a ligação de fatos por meio de várias etapas.
Perguntas frequentes
O que é o MemHop?
O MemHop é um benchmark para testar a memória multi-hop de agentes LLM: 1000 perguntas com profundidade de conexão de 1 a 5 saltos em 10 cenários de redes sociais, com anotação de evidências em cada etapa.
Em que o ProGraph se diferencia do Mem0 e do RAG?
O ProGraph usa duas camadas — varredura por nomes em perfis de texto e fatos exatos extraídos em conjunto (datas, números, objetos) — em vez de um grafo de conhecimento explícito. Nos benchmarks MemHop e LoCoMo, ele superou Mem0, A-Mem, HippoRAG e RAG.
É possível reproduzir os resultados?
Sim. Os autores publicaram o benchmark MemHop, a implementação do ProGraph e as implementações baseline, de modo que as medições podem ser repetidas de forma independente.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.