arXiv cs.AI→ original

ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG

Исследователи представили ProGraph — двухслойную память для LLM-агентов. Она набрала 80,1% на новом бенчмарке multi-hop-памяти MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG. Вместо явного графа знаний ProGraph использует текстовые профили и совместно извлекаемые точные факты — даты, числа и объекты — без лишних вызовов API.

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

Investigadores han presentado ProGraph (Profile-Graph Memory), una arquitectura de memoria de largo plazo de dos capas para agentes LLM que se publicó como preprint en arXiv en julio de 2026 y obtuvo un 80,1% en el nuevo benchmark MemHop y un 78,4% en LoCoMo, superando a Mem0, A-Mem, HippoRAG y RAG.

Por qué se necesitaba un nuevo benchmark

MemHop es un benchmark de 1000 preguntas con profundidades de conexión de entre 1 y 5 saltos (hops) en 10 escenarios de redes sociales, con anotación de evidencias en cada salto.

Según el preprint publicado en arXiv, las pruebas de memoria existentes en su mayoría verifican solo el single-hop recall y apenas miden las asociaciones multi-hop, es decir, la vinculación de hechos a través de una cadena de entidades intermedias.

MemHop cierra esta brecha y permite evaluar por separado la profundidad del razonamiento del agente.

Cómo funciona ProGraph

ProGraph opera en dos capas y no construye un grafo de conocimiento explícito.

La primera capa es profile expansion: un recorrido por subcadenas de nombres de entidades que aparecen de forma natural en los perfiles de texto escritos por el propio modelo. Es un sustituto mínimo de la construcción manual de un knowledge graph.

La segunda capa son los compression residuals: fechas exactas, cantidades y objetos nombrados que se extraen junto con cada actualización del perfil, sin llamadas adicionales a la API (zero extra API cost).

Una ablation de rejilla completa (full-grid ablation) mostró que los mecanismos están especializados. Eliminar profile expansion supone menos 22,6 puntos porcentuales en MemHop; no extraer los compression residuals de forma conjunta supone menos 8,6 puntos en LoCoMo. Los efectos cruzados dentro de una misma arquitectura se mantienen por debajo de 3 puntos.

  • Benchmark MemHop: 1000 preguntas, profundidad de 1 a 5 saltos, 10 escenarios de redes sociales
  • ProGraph: 80,1% en MemHop (al nivel del baseline Full Context) y 78,4% en LoCoMo (+11,3 p.p. respecto a Full Context)
  • Profile expansion es responsable del multi-hop: −22,6 p.p. en MemHop al eliminarlo
  • Compression residuals son responsables de la precisión: −8,6 p.p. en LoCoMo sin extracción conjunta
  • Supera a Mem0, A-Mem, HippoRAG y RAG en ambos benchmarks

Por qué importa el resultado

ProGraph superó al baseline Full Context por 11,3 puntos en LoCoMo, y en MemHop quedó a su nivel, todo esto sin mantener todo el historial en la ventana de contexto y sin construir un grafo explícito. Esto significa que el agente es capaz de responder preguntas encadenadas apoyándose en perfiles comprimidos y en residuos de hechos, en lugar de en el historial completo de la conversación.

«El profile expansion proporciona el razonamiento multi-hop, y los

compression residuals, la precisión de recuperación», señala el resumen del preprint en arXiv.

Los autores han puesto en acceso abierto tanto el benchmark MemHop como la implementación de ProGraph y las implementaciones baseline de sus competidores, es decir, las cifras declaradas pueden reproducirse de forma independiente.

Qué significa esto

La memoria para agentes LLM se está desplazando del enfoque de «meter todo el contexto» y de los pesados grafos de conocimiento hacia perfiles de texto ligeros con hechos puntuales. ProGraph demuestra que un método barato es capaz de igualar al contexto completo en preguntas profundas, y de superarlo allí donde importa la conexión de hechos a través de varios pasos.

Preguntas frecuentes

¿Qué es MemHop?

MemHop es un benchmark para evaluar la memoria multi-hop de los agentes LLM: 1000 preguntas con profundidades de conexión de entre 1 y 5 saltos en 10 escenarios de redes sociales, con anotación de evidencias en cada paso.

¿En qué se diferencia ProGraph de Mem0 y RAG?

ProGraph usa dos capas: un recorrido por nombres en perfiles de texto y hechos exactos extraídos conjuntamente (fechas, números, objetos), en lugar de un grafo de conocimiento explícito. En los benchmarks MemHop y LoCoMo superó a Mem0, A-Mem, HippoRAG y RAG.

¿Se pueden reproducir los resultados?

Sí. Los autores publicaron el benchmark MemHop, la implementación de ProGraph y las implementaciones baseline, de modo que las mediciones pueden repetirse de forma independiente.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…