arXiv cs.AI→ original

ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG

Исследователи представили ProGraph — двухслойную память для LLM-агентов. Она набрала 80,1% на новом бенчмарке multi-hop-памяти MemHop и 78,4% на LoCoMo, обойдя Mem0, A-Mem, HippoRAG и RAG. Вместо явного графа знаний ProGraph использует текстовые профили и совместно извлекаемые точные факты — даты, числа и объекты — без лишних вызовов API.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
ProGraph: двухслойная память для LLM-агентов обошла Mem0, RAG и HippoRAG
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

Des chercheurs ont présenté ProGraph (Profile-Graph Memory) — une architecture de mémoire à long terme à deux couches pour agents LLM, publiée sous forme de préprint sur arXiv en juillet 2026, qui a obtenu 80,1 % sur le nouveau benchmark MemHop et 78,4 % sur LoCoMo, devançant Mem0, A-Mem, HippoRAG et RAG.

Pourquoi un nouveau benchmark était nécessaire

MemHop est un benchmark de 1000 questions dont la profondeur de connexion va de 1 à 5 sauts (hops), réparties sur 10 scénarios de réseaux sociaux, avec une annotation des preuves à chaque saut.

Selon le préprint publié sur arXiv, les tests de mémoire existants vérifient surtout le single-hop recall et mesurent à peine les associations multi-hop — c'est-à-dire la mise en relation de faits à travers une chaîne d'entités intermédiaires.

MemHop comble cette lacune et permet d'évaluer séparément la profondeur du raisonnement de l'agent.

Comment fonctionne ProGraph

ProGraph fonctionne sur deux couches et ne construit pas de graphe de connaissances explicite.

La première couche est le profile expansion : un parcours par sous-chaînes des noms d'entités qui apparaissent naturellement dans les profils textuels rédigés par le modèle lui-même. C'est un substitut minimal à la construction manuelle d'un knowledge graph.

La seconde couche est celle des compression residuals : dates exactes, quantités et objets nommés qui sont extraits en même temps que chaque mise à jour du profil, sans appel API supplémentaire (zero extra API cost).

Une ablation exhaustive (full-grid ablation) a montré que les mécanismes sont spécialisés. Retirer le profile expansion coûte moins 22,6 points de pourcentage sur MemHop ; ne pas extraire conjointement les compression residuals coûte moins 8,6 points sur LoCoMo. Les effets croisés au sein d'une même architecture restent inférieurs à 3 points.

  • Benchmark MemHop : 1000 questions, profondeur de 1 à 5 sauts, 10 scénarios de réseaux sociaux
  • ProGraph : 80,1 % sur MemHop (au niveau de la référence Full Context) et 78,4 % sur LoCoMo (+11,3 points par rapport à Full Context)
  • Le profile expansion est responsable du multi-hop : −22,6 points sur MemHop en cas de suppression
  • Les compression residuals sont responsables de la précision : −8,6 points sur LoCoMo sans extraction conjointe
  • Devance Mem0, A-Mem, HippoRAG et RAG sur les deux benchmarks

Pourquoi ce résultat compte

ProGraph a devancé la référence Full Context de 11,3 points sur LoCoMo, et l'a égalée sur MemHop — tout cela sans conserver tout l'historique dans la fenêtre de contexte et sans construire de graphe explicite. Cela signifie que l'agent est capable de répondre à des questions en chaîne en s'appuyant sur des profils compressés et des résidus de faits, plutôt que sur l'historique complet de la conversation.

«

Le profile expansion assure le raisonnement multi-hop, tandis que les compression residuals assurent la précision de récupération », indique le résumé du préprint sur arXiv.

Les auteurs ont mis en libre accès à la fois le benchmark MemHop, l'implémentation de ProGraph et les implémentations de référence des concurrents — les chiffres annoncés peuvent donc être reproduits de manière indépendante.

Ce que cela signifie

La mémoire des agents LLM s'éloigne de l'approche consistant à « tout entasser dans le contexte » et des graphes de connaissances lourds, au profit de profils textuels légers contenant des faits ciblés. ProGraph montre qu'une méthode peu coûteuse est capable de rattraper le contexte complet sur des questions profondes — et de le dépasser là où la mise en relation de faits sur plusieurs étapes compte vraiment.

Questions fréquentes

Qu'est-ce que MemHop ?

MemHop est un benchmark destiné à évaluer la mémoire multi-hop des agents LLM : 1000 questions dont la profondeur de connexion va de 1 à 5 sauts, réparties sur 10 scénarios de réseaux sociaux, avec une annotation des preuves à chaque étape.

En quoi ProGraph diffère-t-il de Mem0 et de RAG ?

ProGraph utilise deux couches — un parcours par noms dans des profils textuels et des faits exacts extraits conjointement (dates, chiffres, objets) — au lieu d'un graphe de connaissances explicite. Sur les benchmarks MemHop et LoCoMo, il a devancé Mem0, A-Mem, HippoRAG et RAG.

Les résultats peuvent-ils être reproduits ?

Oui. Les auteurs ont publié le benchmark MemHop, l'implémentation de ProGraph et les implémentations de référence, de sorte que les mesures peuvent être reproduites de manière indépendante.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…