Habr AI→ original

Experto PWN AI Artyom Semenov: cómo los agentes de IA eliminan archivos y se comprometen

El autor del canal Telegram PWN AI Artyom Semenov le contó a Habr cómo la superficie de ataque en sistemas de IA se ha expandido con agentes autónomos y el protocolo MCP. Explicó por qué los prompts del sistema no pueden considerarse un límite de seguridad y cómo la inyección directa de prompt difiere de la indirecta. Los ataques en modelos de lenguaje ya no son raros—se han convertido en una disciplina separada de ciberseguridad.

Procesado por IA desde Habr AI; editado por Hamidun News
Experto PWN AI Artyom Semenov: cómo los agentes de IA eliminan archivos y se comprometen
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

En 2026, Habr publicó una entrevista con Artem Semenov, autor del canal de Telegram PWN AI dedicado a aplicaciones inseguras de la inteligencia artificial, sobre cómo está estructurada la seguridad de los sistemas de IA y por qué los ataques a modelos de lenguaje se han convertido en una disciplina separada con su propia taxonomía, herramientas e incidentes del mundo real.

Cómo creció la superficie de ataque

Según Semenov, la aparición de agentes de IA autónomos y el protocolo MCP (Model Context Protocol) expandió drásticamente la superficie de ataque en sistemas de IA. Si anteriormente se trataba principalmente de manipulaciones de respuestas de modelos de lenguaje, ahora los agentes tienen la capacidad de realizar independientemente acciones en el mundo real — eliminar archivos, enviar datos al exterior e incluso hackearse a sí mismos, lo que hace que las consecuencias de un ataque exitoso sean mucho más tangibles que simplemente una "respuesta incorrecta" de un chatbot.

Por qué los prompts del sistema no te salvan

La tesis clave de la entrevista — un prompt del sistema no es un límite de seguridad. Las instrucciones integradas por los desarrolladores en el prompt de un modelo pueden ser evitadas, y no es aconsejable confiar en ellas como una barrera protectora. Por separado, Semenov discute la diferencia entre inyección de prompt directo, cuando una instrucción maliciosa es ingresada directamente por el usuario en el diálogo con el modelo, e inyección de prompt indirecto, cuando una instrucción maliciosa entra al modelo a través de datos externos — documentos, páginas web, correos electrónicos o resultados de herramientas que el agente procesa mientras completa una tarea, sin ni siquiera sospecharlo.

  • Persona entrevistada — Artem Semenov, autor del canal de Telegram PWN AI sobre aplicaciones inseguras de IA
  • Esta es ya la segunda entrevista de Semenov con Habr: la primera conversación sobre seguridad e IA se publicó en 2023
  • Temas clave — crecimiento de la superficie de ataque a través de agentes y el protocolo MCP, limitaciones de los prompts del sistema como protección, la diferencia entre inyección de prompt directo e indirecto
  • La seguridad de sistemas de IA se describe como una disciplina separada con su propia taxonomía y herramientas, no como un tema secundario de la seguridad clásica

Qué hay detrás de la palabra "taxonomía"

Semenov enfatiza que la protección de sistemas de IA ya no es una colección de consejos dispares como "no confíes en la entrada del usuario", sino una disciplina sistemática: tiene su propia clasificación de ataques, sus propias herramientas para pruebas y su propio conjunto de incidentes documentados que pueden ser referenciados. Para ingenieros y empresas que integran modelos de lenguaje y agentes en sus productos, esto significa la necesidad de construir protección contra tales ataques de manera tan sistemática como la protección contra vulnerabilidades clásicas como inyección SQL o XSS, en lugar de confiar en que el modelo "lo descifre solo", dónde termina la instrucción legítima y comienza el ataque.

Por qué esta conversación sucede por segunda vez

Esta no es la primera vez que Habr se acerca al tema de la seguridad de la IA con este entrevistado: una conversación similar con Semenov se publicó en la plataforma hace en 2023. La decisión de revisitar el tema y actualizar los datos es en sí misma indicativa — en el tiempo transcurrido, la industria pasó de chatbots simples, que en el peor de los casos daría una respuesta inapropiada, a agentes autónomos con acceso al sistema de archivos, servicios externos y herramientas a través de protocolos como MCP. En consecuencia, las apuestas han aumentado: un error en la protección ahora puede costar no un diálogo arruinado, sino archivos realmente eliminados o datos filtrados.

Qué significa esto

La conversación captura un cambio de escala: si hace poco los ataques a modelos de lenguaje eran más bien un ejercicio académico, entonces con la propagación de agentes autónomos que realmente eliminan archivos, envían datos al exterior y son vulnerables al auto-hackeo, la seguridad del sistema de IA se convierte en un problema de ingeniería práctica — igual que la seguridad de cualquier otro software crítico, solo que con una nueva taxonomía de amenazas específica de agentes y protocolos MCP.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…