arXiv cs.AI→ original

OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций

Исследователи выложили на arXiv OpenEvoShield — систему непрерывной защиты для мультиагентных LLM-систем. Она отражает атаки, где вредоносные инструкции расползаются между агентами через их переписку, а сами атаки постоянно эволюционируют. За 100 раундов тестов на 5 бенчмарках метод обошёл прежние подходы и поймал большинство новых атак при низком проценте ложных срабатываний.

Processado por IA de arXiv cs.AI; editado por Hamidun News
OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, pesquisadores publicaram no arXiv o framework OpenEvoShield — um sistema de defesa contínua para sistemas multiagente baseados em grandes modelos de linguagem (LLM-MAS) que, ao longo de 100 rodadas de implantação, detecta a maioria dos ataques de injeção nunca antes vistos com baixa taxa de falsos positivos.

Contra quais ataques protege

O OpenEvoShield protege os LLM-MAS da injeção de instruções maliciosas por meio da comunicação entre agentes — quando um atacante insere um comando em um agente, que então espalha o comportamento malicioso por todo o sistema por meio da troca de mensagens com outros agentes. Segundo a descrição dos autores, esses ataques são "duplamente dinâmicos": os atacantes aprimoram as estratégias de injeção contra uma defesa já implantada, enquanto o comportamento dos agentes normais vai se desviando à medida que o sistema se expande. É justamente por isso que defesas estáticas, treinadas uma única vez, perdem precisão rapidamente.

Como a defesa é estruturada

O OpenEvoShield é construído como uma co-evolutionary continual defense — uma defesa que evolui junto com os ataques, em vez de permanecer congelada após o treinamento. Segundo o preprint, o framework é composto por quatro módulos.

  • M1 — controlador assimétrico de taxas: separa o aprendizado rápido do lado do ataque e o lento do lado do comportamento normal, com base em dois sinais de desvio
  • M2 — atualização do limite da norma: mantém lentamente um limite comportamental dinâmico dos agentes "normais"
  • M3 — conjunto de políticas com regularização EWC: adapta-se rapidamente a novas ameaças sem esquecimento catastrófico das antigas
  • M4 — detector energético de granularidade variável: combina características em nível de nó, subgrafo e grafo para classificar um novo ataque como anomalia fora da distribuição de treinamento
  • Testes — 100 rodadas de implantação em 5 benchmarks e 4 topologias de sistemas multiagente

Por que a defesa comum quebra?

A defesa comum quebra porque trata a implantação como um "mundo fechado" e perde precisão assim que a distribuição dos ataques ou do comportamento normal ultrapassa os limites do conjunto de treinamento. Segundo o arXiv, o OpenEvoShield resolve isso por meio de taxas de aprendizado separadas: o lado do ataque se ajusta rapidamente, enquanto o limite da norma é atualizado lentamente, o que impede o sistema de confundir um desvio gradual com um ataque. Ao longo de 100 rodadas, os experimentos mostraram que o método supera tanto as abordagens estáticas quanto as baseadas em continual learning.

"O

OpenEvoShield supera os métodos estáticos e os baseados em continual learning, detectando a maioria dos ataques nunca antes vistos com baixa taxa de falsos positivos", afirma o resumo do preprint no arXiv.

O que isso significa

À medida que as empresas montam pipelines de trabalho a partir de agentes LLM, a segurança da troca de mensagens entre agentes está se tornando uma tarefa de engenharia própria. O OpenEvoShield aponta um caminho: a defesa precisa aprender de forma contínua e em tempo real, distinguindo a evolução dos ataques do desvio natural do sistema.

Perguntas frequentes

O que é um ataque via comunicação entre agentes?

É quando um atacante insere uma instrução maliciosa na mensagem de um agente, e ela se espalha pelo sistema enquanto os agentes trocam dados. Segundo a descrição dos autores, essa é uma ameaça central para sistemas multiagente LLM em tarefas críticas de segurança.

Em que o OpenEvoShield foi testado?

Segundo o preprint, o método passou por 100 rodadas de implantação em 5 benchmarks e 4 topologias de sistemas multiagente. Nessas condições, ele superou as abordagens estáticas e baseadas em continual learning, capturando a maioria dos novos ataques com baixo percentual de falsos positivos.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…