New Computer Améliore la Précision de la Recherche en Mémoire de l'Agent de 50% avec LangSmith
New Computer est une startup construisant un assistant IA personnel avec mémoire à long terme. L'équipe a augmenté la précision de recherche de 50% en utilisant l'outil d'observabilité LangSmith. Le secret réside dans le mode de comparaison des tests : il aidait à détecter les régressions avant que les changements n'atteignent la production et à corriger rapidement les prompts. Ainsi, l'agent est devenu deux fois plus fiable pour trouver le contexte pertinent des conversations passées.
Traité par IA depuis LangChain Blog ; édité par Hamidun News
La startup New Computer a réalisé une augmentation de 50% de la précision du rappel du système de mémoire de son agent d'IA en utilisant l'outil d'observabilité LangSmith. Le succès repose non sur une nouvelle architecture, mais sur une méthodologie disciplinée de test de prompts.
Pourquoi les Agents d'IA ont Besoin de Mémoire à Long Terme
Le produit de New Computer est un assistant d'IA personnel qui se souvient réellement de l'utilisateur : ses préférences, conversations passées, habitudes et contexte de vie. Cette approche distingue fondamentalement l'assistant d'un chatbot régulier, qui recommence à zéro à chaque fois.
Mettant en œuvre la mémoire à long terme n'est techniquement pas trivial. Vous ne pouvez pas simplement sauvegarder tout ce qui a été dit et l'envoyer au contexte du modèle à chaque fois : le volume de données augmente et le coût des requêtes rend cette approche non viable. À la place, les systèmes de mémoire sont construits sur un principe de recherche : de la base de données accumulée, seuls les fragments pertinents sont extraits.
C'est là que surgit la métrique de rappel (complétude de recherche) : à quelle fréquence le système trouve exactement les souvenirs nécessaires maintenant. Un rappel faible signifie que l'agent « oublie » les détails importants même lorsqu'ils existent dans la base de données. Pour un assistant personnel, c'est un problème critique.
Ce Que LangSmith a Fourni
LangSmith est un outil d'observabilité de LangChain : il enregistre chaque étape du travail d'une application LLM, permet de créer des ensembles de données de test et compare les versions du système dans une interface visuelle. L'équipe de New Computer a construit un processus itératif autour de plusieurs fonctions :
- Vue de Comparaison — correspondance visuelle de deux exécutions : voir quels scénarios se sont améliorés et lesquels ont régressé
- Suivi des régressions — détection automatique des cas où la nouvelle version du système fonctionne moins bien que la précédente
- Cycle d'itération rapide — a modifié le prompt → a exécuté le test → a comparé les résultats → a accepté ou annulé
- Enregistrement des conversations — l'historique complet des requêtes a aidé à identifier les modèles où la recherche en mémoire échouait
L'idée clé : sans comparaison structurée, les régressions sont restées invisibles. Quand un prompt améliorait certains scénarios, il en cassait d'autres silencieusement. LangSmith a rendu ces cassures visibles immédiatement — avant que les changements n'atteignent la production.
De l'Intuition aux Résultats Mesurables
Avant de mettre en œuvre LangSmith, l'équipe opérait selon le principe « on a essayé — ça semble mieux ». Les évaluations subjectives n'ont pas permis de comparer les versions avec assurance : trop de variables, trop peu de données mesurables. Après le passage à des tests comparatifs, chaque modification de prompt a traversé un ensemble de scénarios de test. Les résultats ont été enregistrés, comparés à la version précédente — et seulement après une amélioration confirmée les changements ont été acceptés.
La régression est devenue un problème diagnosticable et gérable au lieu de « quelque chose de cassé » aléatoire. Le résultat — une amélioration de 50% du rappel : l'agent est devenu 1,5 fois plus susceptible de trouver des souvenirs pertinents de conversations passées. Pour un assistant personnel dont la valeur est mesurée par la qualité de la mémoire — c'est une amélioration fondamentale du produit.
Ce Que Cela Signifie
Le cas de New Computer démontre : la qualité du produit d'IA aujourd'hui est déterminée non seulement par l'architecture ou le choix du modèle de base, mais par le système d'observabilité. Les équipes qui voient leurs régressions en temps réel itèrent plus rapidement — et cela se convertit directement en métriques. Des outils comme LangSmith déplacent le développement d'applications LLM du mode « ça semble fonctionner » au mode d'améliorations mesurables et reproductibles.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.