arXiv cs.AI→ original

ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG

Исследователи представили ProGraph — двухслойную память для LLM-агентов. Она набрала 80,1% на новом бенчмарке multi-hop-памяти MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG. Вместо явного графа знаний ProGraph использует текстовые профили и совместно извлекаемые точные факты — даты, числа и объекты — без лишних вызовов API.

Processado por IA de arXiv cs.AI; editado por Hamidun News
ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores apresentaram o ProGraph (Profile-Graph Memory) — uma arquitetura de memória de longo prazo em duas camadas para agentes LLM que saiu como preprint no arXiv em julho de 2026 e obteve 80,1% no novo benchmark MemHop e 78,4% no LoCoMo, superando Mem0, A-Mem, HippoRAG e RAG.

Por que era preciso um novo benchmark

O MemHop é um benchmark de 1000 perguntas com profundidade de conexão de 1 a 5 saltos (hops) em 10 cenários de redes sociais, com anotação de evidências em cada salto.

Segundo o preprint no arXiv, os testes de memória existentes em geral verificam apenas o single-hop recall e praticamente não medem as associações multi-hop — a ligação de fatos por meio de uma cadeia de entidades intermediárias.

O MemHop preenche essa lacuna e permite avaliar separadamente a profundidade do raciocínio do agente.

Como funciona o ProGraph

O ProGraph opera em duas camadas e não constrói um grafo de conhecimento explícito.

A primeira camada é o profile expansion: uma varredura por substrings de nomes de entidades que ocorrem naturalmente nos perfis de texto escritos pelo próprio modelo. É um substituto mínimo para a construção manual de um knowledge graph.

A segunda camada são os compression residuals: datas exatas, quantidades e objetos nomeados que são extraídos junto com cada atualização do perfil, sem chamadas adicionais de API (zero extra API cost).

Uma ablação completa em grade (full-grid ablation) mostrou que os mecanismos são especializados. Remover o profile expansion custa menos 22,6 pontos percentuais no MemHop; não extrair os compression residuals em conjunto custa menos 8,6 pontos no LoCoMo. Os efeitos cruzados dentro de uma mesma arquitetura permanecem abaixo de 3 pontos.

  • Benchmark MemHop: 1000 perguntas, profundidade de 1 a 5 saltos, 10 cenários de redes sociais
  • ProGraph: 80,1% no MemHop (no nível do baseline Full Context) e 78,4% no LoCoMo (+11,3 p.p. em relação ao Full Context)
  • O profile expansion é responsável pelo multi-hop: −22,6 p.p. no MemHop quando removido
  • Os compression residuals são responsáveis pela precisão: −8,6 p.p. no LoCoMo sem extração conjunta
  • Supera Mem0, A-Mem, HippoRAG e RAG em ambos os benchmarks

Por que o resultado importa

O ProGraph superou o baseline Full Context em 11,3 pontos no LoCoMo e empatou com ele no MemHop — tudo isso sem manter todo o histórico na janela de contexto e sem construir um grafo explícito. Isso significa que o agente consegue responder a perguntas encadeadas apoiando-se em perfis comprimidos e resíduos de fatos, em vez de no histórico completo da conversa.

«A expansão por perfis garante o raciocínio multi-hop, enquanto os

resíduos de compressão garantem a precisão de recuperação», afirma o resumo do preprint no arXiv.

Os autores disponibilizaram em acesso aberto tanto o benchmark MemHop quanto a implementação do ProGraph e as implementações baseline dos concorrentes — ou seja, os números divulgados podem ser reproduzidos de forma independente.

O que isso significa

A memória para agentes LLM está migrando da abordagem de "enfiar todo o contexto" e dos pesados grafos de conhecimento para perfis de texto leves com fatos pontuais. O ProGraph mostra que um método barato é capaz de alcançar o contexto completo em perguntas profundas — e superá-lo onde importa a ligação de fatos por meio de várias etapas.

Perguntas frequentes

O que é o MemHop?

O MemHop é um benchmark para testar a memória multi-hop de agentes LLM: 1000 perguntas com profundidade de conexão de 1 a 5 saltos em 10 cenários de redes sociais, com anotação de evidências em cada etapa.

Em que o ProGraph se diferencia do Mem0 e do RAG?

O ProGraph usa duas camadas — varredura por nomes em perfis de texto e fatos exatos extraídos em conjunto (datas, números, objetos) — em vez de um grafo de conhecimento explícito. Nos benchmarks MemHop e LoCoMo, ele superou Mem0, A-Mem, HippoRAG e RAG.

É possível reproduzir os resultados?

Sim. Os autores publicaram o benchmark MemHop, a implementação do ProGraph e as implementações baseline, de modo que as medições podem ser repetidas de forma independente.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…