OpenEvoShield: защита мультиагентных LLM-систем от эволюционирующих инъекций
Исследователи выложили на arXiv OpenEvoShield — систему непрерывной защиты для мультиагентных LLM-систем. Она отражает атаки, где вредоносные инструкции расползаются между агентами через их переписку, а сами атаки постоянно эволюционируют. За 100 раундов тестов на 5 бенчмарках метод обошёл прежние подходы и поймал большинство новых атак при низком проценте ложных срабатываний.
Procesado por IA desde arXiv cs.AI; editado por Hamidun News
En julio de 2026, investigadores publicaron en arXiv el framework OpenEvoShield, un sistema de defensa continua para sistemas multiagente basados en grandes modelos de lenguaje (LLM-MAS) que, a lo largo de 100 rondas de despliegue, detecta la mayoría de los ataques de inyección nunca antes vistos con una baja tasa de falsos positivos.
Contra qué ataques protege
OpenEvoShield protege a los LLM-MAS de la inyección de instrucciones maliciosas a través de la comunicación entre agentes: cuando un atacante desliza un comando a un agente, y este propaga el comportamiento malicioso por todo el sistema mediante su correspondencia con otros agentes. Según la descripción de los autores, este tipo de ataques son "doblemente dinámicos": los atacantes perfeccionan sus estrategias de inyección contra una defensa ya desplegada, mientras que el comportamiento de los agentes normales va derivando a medida que el sistema se expande. Precisamente por eso las defensas estáticas, entrenadas una sola vez, pierden precisión rápidamente.
Cómo está construida la defensa
OpenEvoShield está construido como una co-evolutionary continual defense: una defensa que evoluciona junto con los ataques en lugar de quedar congelada tras el entrenamiento. Según el preprint, el framework está compuesto por cuatro módulos.
- M1 — controlador asimétrico de velocidades: separa el aprendizaje rápido del lado del ataque y el lento del lado del comportamiento normal, según dos señales de deriva
- M2 — actualización del límite de la norma: mantiene lentamente un límite conductual dinámico de los agentes "normales"
- M3 — ensamble de políticas con regularización EWC: se adapta rápidamente a nuevas amenazas sin olvido catastrófico de las anteriores
- M4 — detector energético multigranularidad: combina características a nivel de nodo, subgrafo y grafo para clasificar un ataque nuevo como una anomalía fuera de la distribución de entrenamiento
- Pruebas: 100 rondas de despliegue en 5 benchmarks y 4 topologías de sistemas multiagente
¿Por qué falla la defensa convencional?
La defensa convencional falla porque trata el despliegue como un "mundo cerrado" y pierde precisión en cuanto la distribución de los ataques o del comportamiento normal se sale de la muestra de entrenamiento. Según arXiv, OpenEvoShield resuelve esto mediante velocidades de aprendizaje separadas: el lado del ataque se ajusta rápido, mientras que el límite de la norma se actualiza lentamente, lo que evita que el sistema confunda una deriva gradual con un ataque. A lo largo de 100 rondas, los experimentos mostraron que el método supera tanto a los enfoques estáticos como a los basados en continual learning.
"OpenEvoShield supera a los métodos estáticos y a los basados en
continual learning, detectando la mayoría de los ataques nunca antes vistos con una baja tasa de falsos positivos", señala el resumen del preprint en arXiv.
Qué significa esto
A medida que las empresas ensamblan flujos de trabajo a partir de agentes LLM, la seguridad de la correspondencia entre agentes se está convirtiendo en una tarea de ingeniería propia. OpenEvoShield señala una dirección: la defensa debe aprender de forma continua y en tiempo real, distinguiendo la evolución de los ataques de la deriva natural del sistema.
Preguntas frecuentes
¿Qué es un ataque a través de la comunicación entre agentes?
Es cuando un atacante inserta una instrucción maliciosa en el mensaje de un agente, y esta se propaga por el sistema mientras los agentes intercambian datos. Según la descripción de los autores, se trata de una amenaza clave para los sistemas multiagente LLM en tareas críticas para la seguridad.
¿Con qué se probó OpenEvoShield?
Según el preprint, el método se sometió a 100 rondas de despliegue en 5 benchmarks y 4 topologías de sistemas multiagente. En estas condiciones, superó a los enfoques estáticos y a los basados en continual learning, capturando la mayoría de los ataques nuevos con un bajo porcentaje de falsos positivos.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.