NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949
Вышел препринт NEXUS — монитор безопасности для LLM-агентов, которые вызывают инструменты и совершают реальные действия. На каждый шаг агента он выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки. На синтетическом бенчмарке из 128 сценариев NEXUS даёт F1 0,949 и обходит подход на голых правилах на 27,3 пункта по точности выбора вмешательства. Медианная задержка — 0,205 мс, меньше 0,1% к обычному циклу агента.
Procesado por IA desde arXiv cs.AI; editado por Hamidun News
En julio de 2026, arXiv publicó un preprint sobre NEXUS (Neural EXecution Utility and Safety), un monitor de seguridad en tiempo de ejecución para agentes LLM que utilizan herramientas. NEXUS intercepta cada acción del agente y elige una de cuatro opciones: permitir, bloquear, solicitar confirmación o exigir una revisión; en un benchmark sintético de 128 escenarios alcanza un F1 de 0,949 con una latencia mediana de 0,205 ms.
Cómo está construido el monitor
NEXUS combina tres mecanismos de control y, a partir de ellos, emite una respuesta graduada. Según el preprint publicado en arXiv, estos incluyen reglas de seguridad deterministas, inspección de argumentos a nivel de parámetros individuales y una regresión logística calibrada que calcula un risk-score para la escalada.
Precisamente este risk-score permite pasar de un «se puede/no se puede» binario a una política de intervención de cuatro niveles. En lugar de simplemente bloquear una llamada sospechosa, el monitor puede pedirle al agente una confirmación o enviar la acción de vuelta para su reformulación.
- Cuatro acciones de la política: allow, block, request confirmation, request revision
- Tres mecanismos: reglas deterministas + inspección de argumentos + regresión logística risk-score
- F1 = 0,949 en un benchmark sintético de 128 escenarios
- Precisión de la elección de intervención de 4 clases — 0,6406
- Latencia mediana de 0,205 ms, menos del 0,1% de sobrecarga
Cuánto más preciso es esto que las reglas
NEXUS supera al enfoque basado solo en reglas por 27,3 puntos porcentuales en precisión de elección de intervención en el benchmark sintético. Ahí mismo, su accuracy de 4 clases es de 0,6406, frente a un resultado notablemente más bajo del enfoque rule-only.
El modelo también se probó en conjuntos externos. En R-Judge, NEXUS da un F1 de 0,861 frente a 0,849 del rule-only; en AgentHarm queda a la par con las reglas (los autores lo atribuyen a limitaciones del modelo de amenazas); y en la prueba de inyecciones indirectas de prompt (IPI) logra 0% de ataques exitosos con un 99% de acciones legítimas permitidas.
Qué mostró la prueba de estrés
En el benchmark «ciego a las reglas» NEXUS-Stress, el monitor obtiene un F1 de 0,881, y los propios autores subrayan que precisamente el enrutamiento fino de las intervenciones sigue siendo la tarea más difícil. Este escenario está deliberadamente despojado de apoyo en reglas predefinidas, para probar la capacidad de generalización del risk-score.
Por separado, los autores hacen hincapié en el costo del control. Según el preprint, la latencia mediana es de 0,205 ms, y la sobrecarga es de menos del 0,1% de un ciclo típico del agente.
«NEXUS adds under 0.1% overhead to typical agent loops» — del resumen
del preprint en arXiv.
El código, los benchmarks y el risk-scorer calibrado se han publicado en acceso abierto, lo que permite reproducir los resultados e integrar el monitor en sistemas de agentes propios.
Qué significa esto
A medida que los agentes de IA pasan de dar respuestas en texto a realizar acciones reales —llamadas a API, compras, trabajo con archivos—, el costo de un error crece. NEXUS demuestra que el control en tiempo de ejecución puede ser al mismo tiempo preciso y prácticamente gratuito en términos de latencia, y la publicación abierta del código y los benchmarks le da a la industria un punto de referencia común para comparar este tipo de monitores.
Preguntas frecuentes
¿Qué es NEXUS?
NEXUS (Neural EXecution Utility and Safety) es un monitor de seguridad para agentes LLM que utilizan herramientas. Aplica una política formal de intervención y, para cada acción del agente, elige una de cuatro decisiones: permitir, bloquear, solicitar confirmación o exigir una revisión.
¿Cuánto ralentiza NEXUS a un agente?
Según el preprint, la latencia mediana es de 0,205 ms, y la sobrecarga es de menos del 0,1% de un ciclo típico de trabajo del agente. Es decir, el control prácticamente no afecta la velocidad.
¿Se puede usar NEXUS en proyectos propios?
Sí. Los autores han publicado en acceso abierto el código, los benchmarks y el risk-scorer calibrado, por lo que los resultados se pueden reproducir e integrar el monitor en pipelines de agentes propios.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.