arXiv cs.AI→ оригинал

NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949

Вышел препринт NEXUS — монитор безопасности для LLM-агентов, которые вызывают инструменты и совершают реальные действия. На каждый шаг агента он выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки. На синтетическом бенчмарке из 128 сценариев NEXUS даёт F1 0,949 и обходит подход на голых правилах на 27,3 пункта по точности выбора вмешательства. Медианная задержка — 0,205 мс, меньше 0,1% к обычному циклу агента.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

В июле 2026 года на arXiv вышел препринт NEXUS (Neural EXecution Utility and Safety) — монитор рантайм-безопасности для LLM-агентов, использующих инструменты. NEXUS перехватывает каждое действие агента и выбирает одно из четырёх: разрешить, заблокировать, запросить подтверждение или потребовать доработки; на синтетическом бенчмарке из 128 сценариев он показывает F1 0,949 при медианной задержке 0,205 мс.

Как устроен монитор

NEXUS сочетает три механизма контроля и на их основе выдаёт градуированную реакцию. По данным препринта на arXiv, в него входят детерминированные правила безопасности, инспекция аргументов вызова на уровне отдельных параметров и калиброванная логистическая регрессия, которая считает risk-score для эскалации.

Именно risk-score позволяет уйти от бинарного «можно/нельзя» к четырёхуровневой политике вмешательства. Вместо того чтобы просто блокировать подозрительный вызов, монитор может запросить у агента подтверждение или отправить действие на переформулировку.

  • Четыре действия политики: allow, block, request confirmation, request revision
  • Три механизма: детерминированные правила + инспекция аргументов + логистическая регрессия risk-score
  • F1 = 0,949 на синтетическом бенчмарке из 128 сценариев
  • Точность 4-классового выбора вмешательства — 0,6406
  • Медианная задержка 0,205 мс, менее 0,1% накладных расходов

Насколько это точнее правил

NEXUS обходит подход на одних правилах на 27,3 процентных пункта по точности выбора вмешательства на синтетическом бенчмарке. Там же его 4-классовая accuracy составляет 0,6406 против заметно более низкого результата rule-only.

Модель проверяли и на внешних наборах. На R-Judge NEXUS даёт F1 0,861 против 0,849 у rule-only, на AgentHarm сравнивается с правилами (авторы связывают это с ограничениями модели угроз), а на тесте непрямых инъекций в промпт (IPI) достигает 0% успешных атак при 99% разрешённых легитимных действий.

Что показал стресс-тест

На «слепом к правилам» бенчмарке NEXUS-Stress монитор набирает F1 0,881 — и сами авторы подчёркивают, что именно тонкая маршрутизация вмешательств остаётся самой трудной задачей. Этот сценарий специально лишён опоры на заранее прописанные правила, чтобы проверить обобщающую способность risk-score.

Отдельно авторы делают акцент на цене контроля. По данным препринта, медианная задержка составляет 0,205 мс, а накладные расходы — менее 0,1% типичного цикла агента.

«NEXUS adds under 0.1% overhead to typical agent loops» — из абстракта

препринта на arXiv.

Код, бенчмарки и калиброванный risk-scorer выложены в открытый доступ, что позволяет воспроизвести результаты и встроить монитор в собственные агентные системы.

Что это значит

По мере того как ИИ-агенты переходят от текстовых ответов к реальным действиям — вызовам API, покупкам, работе с файлами, — цена ошибки растёт. NEXUS показывает, что рантайм-контроль можно сделать одновременно точным и почти бесплатным по задержке, а открытая публикация кода и бенчмарков даёт индустрии общую точку отсчёта для сравнения таких мониторов.

Частые вопросы

Что такое NEXUS?

NEXUS (Neural EXecution Utility and Safety) — монитор безопасности для LLM-агентов, использующих инструменты. Он применяет формальную политику вмешательства и на каждое действие агента выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки.

Насколько NEXUS замедляет агента?

По данным препринта, медианная задержка составляет 0,205 мс, а накладные расходы — менее 0,1% от типичного цикла работы агента. То есть контроль практически не влияет на скорость.

Можно ли использовать NEXUS в своих проектах?

Да. Авторы выложили в открытый доступ код, бенчмарки и калиброванный risk-scorer, поэтому результаты можно воспроизвести и встроить монитор в собственные агентные пайплайны.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…