OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций
Исследователи выложили на arXiv OpenEvoShield — систему непрерывной защиты для мультиагентных LLM-систем. Она отражает атаки, где вредоносные инструкции расползаются между агентами через их переписку, а сами атаки постоянно эволюционируют. За 100 раундов тестов на 5 бенчмарках метод обошёл прежние подходы и поймал большинство новых атак при низком проценте ложных срабатываний.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Исследователи в июле 2026 года опубликовали на arXiv фреймворк OpenEvoShield — систему непрерывной защиты для мультиагентных систем на базе больших языковых моделей (LLM-MAS), которая за 100 раундов развёртывания распознаёт большинство ранее не встречавшихся атак-инъекций при низком уровне ложных срабатываний.
Против каких атак
OpenEvoShield защищает LLM-MAS от инъекции вредоносных инструкций через межагентную коммуникацию — когда злоумышленник подсовывает одному агенту команду, а тот распространяет вредоносное поведение по всей системе через переписку с другими агентами. По описанию авторов, такие атаки «дважды динамичны»: злоумышленники дорабатывают стратегии инъекций против уже развёрнутой защиты, а поведение нормальных агентов дрейфует по мере расширения системы. Именно поэтому статичные защиты, обученные один раз, быстро теряют точность.
Как устроена защита
OpenEvoShield построен как co-evolutionary continual defense — защита, которая эволюционирует вместе с атаками, а не остаётся замороженной после обучения. Согласно препринту, фреймворк собран из четырёх модулей.
- M1 — асимметричный контроллер скоростей: разделяет быстрое обучение на стороне атаки и медленное на стороне нормального поведения по двум сигналам дрейфа
- M2 — обновление границы нормы: медленно поддерживает динамическую поведенческую границу «нормальных» агентов
- M3 — ансамбль политик с регуляризацией EWC: быстро адаптируется к новым угрозам без катастрофического забывания старых
- M4 — энергетический детектор разной гранулярности: объединяет признаки уровня узла, подграфа и графа, чтобы отнести новую атаку к аномалиям вне обучающего распределения
- Тестирование — 100 раундов развёртывания на 5 бенчмарках и 4 топологиях мультиагентных систем
Почему обычная защита ломается?
Обычная защита ломается потому, что рассматривает развёртывание как «закрытый мир» и теряет точность, как только распределение атак или нормального поведения выходит за пределы обучающей выборки. По данным arXiv, OpenEvoShield решает это через раздельные скорости обучения: сторона атаки подстраивается быстро, а граница нормы обновляется медленно, что не даёт системе принять постепенный дрейф за атаку. На 100 раундах эксперименты показали, что метод обгоняет и статичные, и continual-базовые подходы.
«OpenEvoShield превосходит статические и continual-базовые методы,
обнаруживая большинство ранее не встречавшихся атак при низком уровне ложных срабатываний», — говорится в аннотации препринта на arXiv.
Что это значит
По мере того как компании собирают из LLM-агентов рабочие конвейеры, безопасность межагентной переписки становится отдельной инженерной задачей. OpenEvoShield показывает направление: защита должна учиться непрерывно и в реальном времени, отличая эволюцию атак от естественного дрейфа системы.
Частые вопросы
Что такое атака через межагентную коммуникацию?
Это когда злоумышленник внедряет вредоносную инструкцию в сообщение одного агента, и та распространяется по системе, пока агенты обмениваются данными. По описанию авторов, это ключевая угроза для мультиагентных LLM-систем в задачах, критичных к безопасности.
На чём тестировали OpenEvoShield?
Согласно препринту, метод прогнали через 100 раундов развёртывания на 5 бенчмарках и 4 топологиях мультиагентных систем. В этих условиях он обошёл статичные и continual-базовые подходы, поймав большинство новых атак при низком проценте ложных срабатываний.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.