NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949
Вышел препринт NEXUS — монитор безопасности для LLM-агентов, которые вызывают инструменты и совершают реальные действия. На каждый шаг агента он выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки. На синтетическом бенчмарке из 128 сценариев NEXUS даёт F1 0,949 и обходит подход на голых правилах на 27,3 пункта по точности выбора вмешательства. Медианная задержка — 0,205 мс, меньше 0,1% к обычному циклу агента.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Em julho de 2026, a arXiv publicou um preprint sobre o NEXUS (Neural EXecution Utility and Safety) — um monitor de segurança em tempo de execução para agentes LLM que utilizam ferramentas. O NEXUS intercepta cada ação do agente e escolhe uma de quatro opções: permitir, bloquear, solicitar confirmação ou exigir revisão; em um benchmark sintético de 128 cenários, ele atinge um F1 de 0,949 com latência mediana de 0,205 ms.
Como o monitor funciona
O NEXUS combina três mecanismos de controle e, com base neles, emite uma resposta graduada. De acordo com o preprint publicado na arXiv, eles incluem regras de segurança determinísticas, inspeção de argumentos no nível de parâmetros individuais e uma regressão logística calibrada que calcula um risk-score para a escalada.
É justamente esse risk-score que permite sair do binário «pode/não pode» para uma política de intervenção de quatro níveis. Em vez de simplesmente bloquear uma chamada suspeita, o monitor pode pedir ao agente uma confirmação ou enviar a ação de volta para reformulação.
- Quatro ações da política: allow, block, request confirmation, request revision
- Três mecanismos: regras determinísticas + inspeção de argumentos + regressão logística risk-score
- F1 = 0,949 em um benchmark sintético de 128 cenários
- Precisão da escolha de intervenção de 4 classes — 0,6406
- Latência mediana de 0,205 ms, menos de 0,1% de overhead
O quanto isso é mais preciso do que regras
O NEXUS supera a abordagem baseada apenas em regras em 27,3 pontos percentuais na precisão de escolha de intervenção no benchmark sintético. Ali mesmo, sua accuracy de 4 classes é de 0,6406, contra um resultado visivelmente mais baixo do rule-only.
O modelo também foi testado em conjuntos externos. No R-Judge, o NEXUS entrega um F1 de 0,861 contra 0,849 do rule-only; no AgentHarm ele fica equiparado às regras (os autores atribuem isso a limitações do modelo de ameaças); e no teste de injeções indiretas de prompt (IPI) alcança 0% de ataques bem-sucedidos com 99% das ações legítimas permitidas.
O que o teste de estresse mostrou
No benchmark «cego às regras» NEXUS-Stress, o monitor obtém um F1 de 0,881 — e os próprios autores destacam que justamente o roteamento fino das intervenções continua sendo a tarefa mais difícil. Esse cenário é deliberadamente desprovido de apoio em regras predefinidas, para testar a capacidade de generalização do risk-score.
Separadamente, os autores enfatizam o custo do controle. De acordo com o preprint, a latência mediana é de 0,205 ms, e o overhead é de menos de 0,1% de um ciclo típico do agente.
«NEXUS adds under 0.1% overhead to typical agent loops» — do resumo do
preprint na arXiv.
O código, os benchmarks e o risk-scorer calibrado foram disponibilizados em acesso aberto, o que permite reproduzir os resultados e incorporar o monitor a sistemas de agentes próprios.
O que isso significa
À medida que os agentes de IA passam de respostas em texto para ações reais — chamadas de API, compras, manipulação de arquivos —, o custo de um erro aumenta. O NEXUS mostra que o controle em tempo de execução pode ser, ao mesmo tempo, preciso e quase gratuito em termos de latência, e a publicação aberta do código e dos benchmarks dá à indústria um ponto de referência comum para comparar esse tipo de monitor.
Perguntas frequentes
O que é o NEXUS?
O NEXUS (Neural EXecution Utility and Safety) é um monitor de segurança para agentes LLM que utilizam ferramentas. Ele aplica uma política formal de intervenção e, para cada ação do agente, escolhe uma de quatro decisões: permitir, bloquear, solicitar confirmação ou exigir revisão.
O quanto o NEXUS deixa um agente mais lento?
De acordo com o preprint, a latência mediana é de 0,205 ms, e o overhead é de menos de 0,1% de um ciclo típico de trabalho do agente. Ou seja, o controle praticamente não afeta a velocidade.
É possível usar o NEXUS em projetos próprios?
Sim. Os autores disponibilizaram em acesso aberto o código, os benchmarks e o risk-scorer calibrado, portanto os resultados podem ser reproduzidos e o monitor pode ser incorporado a pipelines de agentes próprios.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.