OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций
Исследователи выложили на arXiv OpenEvoShield — систему непрерывной защиты для мультиагентных LLM-систем. Она отражает атаки, где вредоносные инструкции расползаются между агентами через их переписку, а сами атаки постоянно эволюционируют. За 100 раундов тестов на 5 бенчмарках метод обошёл прежние подходы и поймал большинство новых атак при низком проценте ложных срабатываний.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Em julho de 2026, pesquisadores publicaram no arXiv o framework OpenEvoShield — um sistema de defesa contínua para sistemas multiagente baseados em grandes modelos de linguagem (LLM-MAS) que, ao longo de 100 rodadas de implantação, detecta a maioria dos ataques de injeção nunca antes vistos com baixa taxa de falsos positivos.
Contra quais ataques protege
O OpenEvoShield protege os LLM-MAS da injeção de instruções maliciosas por meio da comunicação entre agentes — quando um atacante insere um comando em um agente, que então espalha o comportamento malicioso por todo o sistema por meio da troca de mensagens com outros agentes. Segundo a descrição dos autores, esses ataques são "duplamente dinâmicos": os atacantes aprimoram as estratégias de injeção contra uma defesa já implantada, enquanto o comportamento dos agentes normais vai se desviando à medida que o sistema se expande. É justamente por isso que defesas estáticas, treinadas uma única vez, perdem precisão rapidamente.
Como a defesa é estruturada
O OpenEvoShield é construído como uma co-evolutionary continual defense — uma defesa que evolui junto com os ataques, em vez de permanecer congelada após o treinamento. Segundo o preprint, o framework é composto por quatro módulos.
- M1 — controlador assimétrico de taxas: separa o aprendizado rápido do lado do ataque e o lento do lado do comportamento normal, com base em dois sinais de desvio
- M2 — atualização do limite da norma: mantém lentamente um limite comportamental dinâmico dos agentes "normais"
- M3 — conjunto de políticas com regularização EWC: adapta-se rapidamente a novas ameaças sem esquecimento catastrófico das antigas
- M4 — detector energético de granularidade variável: combina características em nível de nó, subgrafo e grafo para classificar um novo ataque como anomalia fora da distribuição de treinamento
- Testes — 100 rodadas de implantação em 5 benchmarks e 4 topologias de sistemas multiagente
Por que a defesa comum quebra?
A defesa comum quebra porque trata a implantação como um "mundo fechado" e perde precisão assim que a distribuição dos ataques ou do comportamento normal ultrapassa os limites do conjunto de treinamento. Segundo o arXiv, o OpenEvoShield resolve isso por meio de taxas de aprendizado separadas: o lado do ataque se ajusta rapidamente, enquanto o limite da norma é atualizado lentamente, o que impede o sistema de confundir um desvio gradual com um ataque. Ao longo de 100 rodadas, os experimentos mostraram que o método supera tanto as abordagens estáticas quanto as baseadas em continual learning.
"O
OpenEvoShield supera os métodos estáticos e os baseados em continual learning, detectando a maioria dos ataques nunca antes vistos com baixa taxa de falsos positivos", afirma o resumo do preprint no arXiv.
O que isso significa
À medida que as empresas montam pipelines de trabalho a partir de agentes LLM, a segurança da troca de mensagens entre agentes está se tornando uma tarefa de engenharia própria. O OpenEvoShield aponta um caminho: a defesa precisa aprender de forma contínua e em tempo real, distinguindo a evolução dos ataques do desvio natural do sistema.
Perguntas frequentes
O que é um ataque via comunicação entre agentes?
É quando um atacante insere uma instrução maliciosa na mensagem de um agente, e ela se espalha pelo sistema enquanto os agentes trocam dados. Segundo a descrição dos autores, essa é uma ameaça central para sistemas multiagente LLM em tarefas críticas de segurança.
Em que o OpenEvoShield foi testado?
Segundo o preprint, o método passou por 100 rodadas de implantação em 5 benchmarks e 4 topologias de sistemas multiagente. Nessas condições, ele superou as abordagens estáticas e baseadas em continual learning, capturando a maioria dos novos ataques com baixo percentual de falsos positivos.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.