New Computer Aumentó la Precisión de Búsqueda de Memoria del Agente en 50% con LangSmith
New Computer es una startup que construye un asistente de IA personal con memoria a largo plazo. El equipo mejoró la precisión de búsqueda en un 50% utilizando la herramienta de observabilidad LangSmith. El secreto está en el modo de comparación de pruebas: ayudaba a detectar regresiones antes de que los cambios llegaran a producción y corregir rápidamente los prompts. Como resultado, el agente se volvió dos veces más confiable para encontrar el contexto relevante de conversaciones pasadas.
Procesado por IA desde LangChain Blog; editado por Hamidun News
La startup New Computer logró un aumento del 50% en la precisión de recuperación del sistema de memoria de su agente de IA utilizando la herramienta de observabilidad LangSmith. El éxito se basa no en una nueva arquitectura, sino en una metodología disciplinada de prueba de prompts.
Por Qué los Agentes de IA Necesitan Memoria a Largo Plazo
El producto de New Computer es un asistente de IA personal que realmente recuerda al usuario: sus preferencias, conversaciones pasadas, hábitos y contexto de vida. Este enfoque distingue fundamentalmente al asistente de un chatbot regular, que comienza de cero cada vez.
Implementar memoria a largo plazo es técnicamente no trivial. No puede simplemente guardar todo lo dicho y enviarlo al contexto del modelo cada vez: el volumen de datos crece y el costo de las solicitudes hace que este enfoque sea inviable. En su lugar, los sistemas de memoria se construyen sobre un principio de búsqueda: de la base de datos acumulada, se extraen solo fragmentos relevantes. Aquí es donde surge la métrica de recall (completitud de búsqueda): con qué frecuencia el sistema encuentra exactamente los recuerdos necesarios en este momento. El recall bajo significa que el agente "olvida" detalles importantes incluso cuando existen en la base de datos. Para un asistente personal, esto es un problema crítico.
Lo Que Proporcionó LangSmith
LangSmith es una herramienta de observabilidad de LangChain: registra cada paso del trabajo de una aplicación LLM, permite crear conjuntos de datos de prueba y comparar versiones del sistema en una interfaz visual. El equipo de New Computer construyó un proceso iterativo en torno a varias funciones:
- Vista de Comparación — emparejamiento visual de dos ejecuciones: ver qué escenarios mejoraron y cuáles se degradaron
- Seguimiento de regresión — detección automática de casos donde la nueva versión del sistema funciona peor que la anterior
- Ciclo de iteración rápida — cambió el prompt → ejecutó la prueba → comparó resultados → aceptó o revirtió
- Registro de conversación — el historial completo de consultas ayudó a identificar patrones donde la búsqueda de memoria falló
La idea clave: sin comparación estructurada, las regresiones permanecieron invisibles. Cuando un prompt mejoraba algunos escenarios, rompía silenciosamente otros. LangSmith hizo estas rupturas visibles de inmediato — antes de que los cambios llegaran a la producción.
De la Intuición a Resultados Medibles
Antes de implementar LangSmith, el equipo operaba según el principio "lo intentamos — parece mejor". Las evaluaciones subjetivas no permitían comparar versiones con confianza: demasiadas variables, muy pocos datos medibles. Después de cambiar a pruebas comparativas, cada cambio de prompt pasó por un conjunto de escenarios de prueba. Los resultados se registraron, se compararon con la versión anterior — y solo después de una mejora confirmada se aceptaban los cambios.
La regresión se convirtió en un problema diagn ósticamente manejable en lugar de "algo se rompió" al azar. El resultado — una mejora del 50% en el recall: el agente se volvió 1.5 veces más probable para encontrar recuerdos relevantes de conversaciones pasadas. Para un asistente personal cuyo valor se mide por la calidad de la memoria — esta es una mejora fundamental del producto.
Lo Que Esto Significa
El caso de New Computer demuestra: la calidad del producto de IA hoy se determina no solo por la arquitectura o la elección del modelo base, sino por el sistema de observabilidad. Los equipos que ven sus regresiones en tiempo real iteran más rápido — y esto se convierte directamente en métricas. Herramientas como LangSmith mueven el desarrollo de aplicaciones LLM del modo "parece que funciona" al modo de mejoras medibles y reproducibles.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.