NEXUS: рантайм-контроль безопасности для LLM-агентов с инструментами — F1 0.949
Вышел препринт NEXUS — монитор безопасности для LLM-агентов, которые вызывают инструменты и совершают реальные действия. На каждый шаг агента он выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки. На синтетическом бенчмарке из 128 сценариев NEXUS даёт F1 0,949 и обходит подход на голых правилах на 27,3 пункта по точности выбора вмешательства. Медианная задержка — 0,205 мс, меньше 0,1% к обычному циклу агента.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
В июле 2026 года на arXiv вышел препринт NEXUS (Neural EXecution Utility and Safety) — монитор рантайм-безопасности для LLM-агентов, использующих инструменты. NEXUS перехватывает каждое действие агента и выбирает одно из четырёх: разрешить, заблокировать, запросить подтверждение или потребовать доработки; на синтетическом бенчмарке из 128 сценариев он показывает F1 0,949 при медианной задержке 0,205 мс.
Как устроен монитор
NEXUS сочетает три механизма контроля и на их основе выдаёт градуированную реакцию. По данным препринта на arXiv, в него входят детерминированные правила безопасности, инспекция аргументов вызова на уровне отдельных параметров и калиброванная логистическая регрессия, которая считает risk-score для эскалации.
Именно risk-score позволяет уйти от бинарного «можно/нельзя» к четырёхуровневой политике вмешательства. Вместо того чтобы просто блокировать подозрительный вызов, монитор может запросить у агента подтверждение или отправить действие на переформулировку.
- Четыре действия политики: allow, block, request confirmation, request revision
- Три механизма: детерминированные правила + инспекция аргументов + логистическая регрессия risk-score
- F1 = 0,949 на синтетическом бенчмарке из 128 сценариев
- Точность 4-классового выбора вмешательства — 0,6406
- Медианная задержка 0,205 мс, менее 0,1% накладных расходов
Насколько это точнее правил
NEXUS обходит подход на одних правилах на 27,3 процентных пункта по точности выбора вмешательства на синтетическом бенчмарке. Там же его 4-классовая accuracy составляет 0,6406 против заметно более низкого результата rule-only.
Модель проверяли и на внешних наборах. На R-Judge NEXUS даёт F1 0,861 против 0,849 у rule-only, на AgentHarm сравнивается с правилами (авторы связывают это с ограничениями модели угроз), а на тесте непрямых инъекций в промпт (IPI) достигает 0% успешных атак при 99% разрешённых легитимных действий.
Что показал стресс-тест
На «слепом к правилам» бенчмарке NEXUS-Stress монитор набирает F1 0,881 — и сами авторы подчёркивают, что именно тонкая маршрутизация вмешательств остаётся самой трудной задачей. Этот сценарий специально лишён опоры на заранее прописанные правила, чтобы проверить обобщающую способность risk-score.
Отдельно авторы делают акцент на цене контроля. По данным препринта, медианная задержка составляет 0,205 мс, а накладные расходы — менее 0,1% типичного цикла агента.
«NEXUS adds under 0.1% overhead to typical agent loops» — из абстракта
препринта на arXiv.
Код, бенчмарки и калиброванный risk-scorer выложены в открытый доступ, что позволяет воспроизвести результаты и встроить монитор в собственные агентные системы.
Что это значит
По мере того как ИИ-агенты переходят от текстовых ответов к реальным действиям — вызовам API, покупкам, работе с файлами, — цена ошибки растёт. NEXUS показывает, что рантайм-контроль можно сделать одновременно точным и почти бесплатным по задержке, а открытая публикация кода и бенчмарков даёт индустрии общую точку отсчёта для сравнения таких мониторов.
Частые вопросы
Что такое NEXUS?
NEXUS (Neural EXecution Utility and Safety) — монитор безопасности для LLM-агентов, использующих инструменты. Он применяет формальную политику вмешательства и на каждое действие агента выбирает одно из четырёх решений: разрешить, заблокировать, запросить подтверждение или потребовать доработки.
Насколько NEXUS замедляет агента?
По данным препринта, медианная задержка составляет 0,205 мс, а накладные расходы — менее 0,1% от типичного цикла работы агента. То есть контроль практически не влияет на скорость.
Можно ли использовать NEXUS в своих проектах?
Да. Авторы выложили в открытый доступ код, бенчмарки и калиброванный risk-scorer, поэтому результаты можно воспроизвести и встроить монитор в собственные агентные пайплайны.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.