arXiv cs.AI→ original

NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949

Вышел препринт NEXUS — монитор безопасности для LLM-агентов, которые вызывают инструменты и совершают реальные действия. На каждый шаг агента он выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки. На синтетическом бенчмарке из 128 сценариев NEXUS даёт F1 0,949 и обходит подход на голых правилах на 27,3 пункта по точности выбора вмешательства. Медианная задержка — 0,205 мс, меньше 0,1% к обычному циклу агента.

Processado por IA de arXiv cs.AI; editado por Hamidun News
NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, a arXiv publicou um preprint sobre o NEXUS (Neural EXecution Utility and Safety) — um monitor de segurança em tempo de execução para agentes LLM que utilizam ferramentas. O NEXUS intercepta cada ação do agente e escolhe uma de quatro opções: permitir, bloquear, solicitar confirmação ou exigir revisão; em um benchmark sintético de 128 cenários, ele atinge um F1 de 0,949 com latência mediana de 0,205 ms.

Como o monitor funciona

O NEXUS combina três mecanismos de controle e, com base neles, emite uma resposta graduada. De acordo com o preprint publicado na arXiv, eles incluem regras de segurança determinísticas, inspeção de argumentos no nível de parâmetros individuais e uma regressão logística calibrada que calcula um risk-score para a escalada.

É justamente esse risk-score que permite sair do binário «pode/não pode» para uma política de intervenção de quatro níveis. Em vez de simplesmente bloquear uma chamada suspeita, o monitor pode pedir ao agente uma confirmação ou enviar a ação de volta para reformulação.

  • Quatro ações da política: allow, block, request confirmation, request revision
  • Três mecanismos: regras determinísticas + inspeção de argumentos + regressão logística risk-score
  • F1 = 0,949 em um benchmark sintético de 128 cenários
  • Precisão da escolha de intervenção de 4 classes — 0,6406
  • Latência mediana de 0,205 ms, menos de 0,1% de overhead

O quanto isso é mais preciso do que regras

O NEXUS supera a abordagem baseada apenas em regras em 27,3 pontos percentuais na precisão de escolha de intervenção no benchmark sintético. Ali mesmo, sua accuracy de 4 classes é de 0,6406, contra um resultado visivelmente mais baixo do rule-only.

O modelo também foi testado em conjuntos externos. No R-Judge, o NEXUS entrega um F1 de 0,861 contra 0,849 do rule-only; no AgentHarm ele fica equiparado às regras (os autores atribuem isso a limitações do modelo de ameaças); e no teste de injeções indiretas de prompt (IPI) alcança 0% de ataques bem-sucedidos com 99% das ações legítimas permitidas.

O que o teste de estresse mostrou

No benchmark «cego às regras» NEXUS-Stress, o monitor obtém um F1 de 0,881 — e os próprios autores destacam que justamente o roteamento fino das intervenções continua sendo a tarefa mais difícil. Esse cenário é deliberadamente desprovido de apoio em regras predefinidas, para testar a capacidade de generalização do risk-score.

Separadamente, os autores enfatizam o custo do controle. De acordo com o preprint, a latência mediana é de 0,205 ms, e o overhead é de menos de 0,1% de um ciclo típico do agente.

«NEXUS adds under 0.1% overhead to typical agent loops» — do resumo do

preprint na arXiv.

O código, os benchmarks e o risk-scorer calibrado foram disponibilizados em acesso aberto, o que permite reproduzir os resultados e incorporar o monitor a sistemas de agentes próprios.

O que isso significa

À medida que os agentes de IA passam de respostas em texto para ações reais — chamadas de API, compras, manipulação de arquivos —, o custo de um erro aumenta. O NEXUS mostra que o controle em tempo de execução pode ser, ao mesmo tempo, preciso e quase gratuito em termos de latência, e a publicação aberta do código e dos benchmarks dá à indústria um ponto de referência comum para comparar esse tipo de monitor.

Perguntas frequentes

O que é o NEXUS?

O NEXUS (Neural EXecution Utility and Safety) é um monitor de segurança para agentes LLM que utilizam ferramentas. Ele aplica uma política formal de intervenção e, para cada ação do agente, escolhe uma de quatro decisões: permitir, bloquear, solicitar confirmação ou exigir revisão.

O quanto o NEXUS deixa um agente mais lento?

De acordo com o preprint, a latência mediana é de 0,205 ms, e o overhead é de menos de 0,1% de um ciclo típico de trabalho do agente. Ou seja, o controle praticamente não afeta a velocidade.

É possível usar o NEXUS em projetos próprios?

Sim. Os autores disponibilizaram em acesso aberto o código, os benchmarks e o risk-scorer calibrado, portanto os resultados podem ser reproduzidos e o monitor pode ser incorporado a pipelines de agentes próprios.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…