arXiv cs.AI→ original

NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949

Вышел препринт NEXUS — монитор безопасности для LLM-агентов, которые вызывают инструменты и совершают реальные действия. На каждый шаг агента он выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки. На синтетическом бенчмарке из 128 сценариев NEXUS даёт F1 0,949 и обходит подход на голых правилах на 27,3 пункта по точности выбора вмешательства. Медианная задержка — 0,205 мс, меньше 0,1% к обычному циклу агента.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, arXiv a publié un preprint consacré à NEXUS (Neural EXecution Utility and Safety) — un moniteur de sécurité en temps d'exécution pour les agents LLM utilisant des outils. NEXUS intercepte chaque action de l'agent et choisit l'une des quatre options : autoriser, bloquer, demander une confirmation ou exiger une révision ; sur un benchmark synthétique de 128 scénarios, il atteint un F1 de 0,949 avec une latence médiane de 0,205 ms.

Comment le moniteur est construit

NEXUS combine trois mécanismes de contrôle et, sur leur base, produit une réponse graduée. Selon le preprint publié sur arXiv, ceux-ci comprennent des règles de sécurité déterministes, une inspection des arguments au niveau des paramètres individuels et une régression logistique calibrée qui calcule un risk-score pour l'escalade.

C'est précisément ce risk-score qui permet de dépasser le binaire « autorisé/interdit » pour adopter une politique d'intervention à quatre niveaux. Plutôt que de simplement bloquer un appel suspect, le moniteur peut demander à l'agent une confirmation ou renvoyer l'action pour reformulation.

  • Quatre actions de la politique : allow, block, request confirmation, request revision
  • Trois mécanismes : règles déterministes + inspection des arguments + régression logistique risk-score
  • F1 = 0,949 sur un benchmark synthétique de 128 scénarios
  • Précision du choix d'intervention à 4 classes — 0,6406
  • Latence médiane de 0,205 ms, moins de 0,1% de surcharge

Dans quelle mesure est-ce plus précis que des règles

NEXUS surpasse l'approche fondée uniquement sur des règles de 27,3 points de pourcentage en précision de choix d'intervention sur le benchmark synthétique. Sur ce même benchmark, sa précision à 4 classes s'établit à 0,6406, contre un résultat nettement plus faible pour l'approche rule-only.

Le modèle a également été testé sur des jeux de données externes. Sur R-Judge, NEXUS obtient un F1 de 0,861 contre 0,849 pour rule-only ; sur AgentHarm, il est comparable aux règles (les auteurs attribuent cela à des limites du modèle de menace) ; et sur un test d'injections indirectes de prompt (IPI), il atteint 0% d'attaques réussies tout en autorisant 99% des actions légitimes.

Ce qu'a montré le test de stress

Sur le benchmark « aveugle aux règles » NEXUS-Stress, le moniteur obtient un F1 de 0,881 — et les auteurs eux-mêmes soulignent que c'est précisément le routage fin des interventions qui reste la tâche la plus difficile. Ce scénario est délibérément privé de tout appui sur des règles prédéfinies, afin de tester la capacité de généralisation du risk-score.

Par ailleurs, les auteurs insistent sur le coût du contrôle. Selon le preprint, la latence médiane est de 0,205 ms, et la surcharge représente moins de 0,1% d'un cycle typique d'agent.

« NEXUS adds under 0.1% overhead to typical agent loops » — extrait du

résumé du preprint sur arXiv.

Le code, les benchmarks et le risk-scorer calibré ont été publiés en accès libre, ce qui permet de reproduire les résultats et d'intégrer le moniteur dans ses propres systèmes agentiques.

Ce que cela signifie

À mesure que les agents IA passent de réponses textuelles à des actions réelles — appels d'API, achats, manipulation de fichiers —, le coût d'une erreur augmente. NEXUS montre que le contrôle en temps d'exécution peut être à la fois précis et pratiquement gratuit en termes de latence, et la publication ouverte du code et des benchmarks offre à l'industrie un point de référence commun pour comparer ce type de moniteurs.

Questions fréquentes

Qu'est-ce que NEXUS ?

NEXUS (Neural EXecution Utility and Safety) est un moniteur de sécurité pour les agents LLM utilisant des outils. Il applique une politique d'intervention formelle et, pour chaque action de l'agent, choisit l'une des quatre décisions : autoriser, bloquer, demander une confirmation ou exiger une révision.

Dans quelle mesure NEXUS ralentit-il un agent ?

Selon le preprint, la latence médiane est de 0,205 ms, et la surcharge représente moins de 0,1% d'un cycle de travail typique de l'agent. Autrement dit, le contrôle n'a pratiquement aucun effet sur la vitesse.

Peut-on utiliser NEXUS dans ses propres projets ?

Oui. Les auteurs ont publié en accès libre le code, les benchmarks et le risk-scorer calibré, ce qui permet de reproduire les résultats et d'intégrer le moniteur dans ses propres pipelines agentiques.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…