Эксперт PWN AI Артём Семёнов: как агенты ИИ удаляют файлы и взламывают себя
Автор Telegram-канала PWN AI Артём Семёнов рассказал Хабру, как расширилась поверхность атаки на ИИ-системы с появлением автономных агентов и протокола MCP. Он объяснил, почему системный промпт нельзя считать границей безопасности и чем прямой prompt injection отличается от косвенного. Атаки на языковые модели перестали быть редкостью и стали отдельной дисциплиной кибербезопасности.
AI-обработка оригинала Habr AI; редакция Hamidun News
В 2026 году Хабр опубликовал интервью с Артёмом Семёновым, автором Telegram-канала PWN AI, посвящённого небезопасному применению искусственного интеллекта, — о том, как устроена безопасность ИИ-систем и почему атаки на языковые модели превратились в отдельную дисциплину со своей таксономией, инструментарием и реальными инцидентами.
Как выросла поверхность атаки
По словам Семёнова, появление автономных ИИ-агентов и протокола MCP (Model Context Protocol) резко расширило поверхность атаки на ИИ-системы. Если раньше речь шла в основном о манипуляциях с ответами языковой модели, то теперь агенты получили возможность самостоятельно выполнять действия в реальном мире — удалять файлы, отправлять данные наружу и даже взламывать сами себя, что делает последствия успешной атаки куда более ощутимыми, чем просто «неправильный ответ» чат-бота.
Почему системный промпт не спасает
Ключевой тезис интервью — системный промпт не является границей безопасности. Инструкции, заложенные разработчиками в промпт модели, можно обойти, и полагаться на них как на защитный барьер не стоит. Отдельно Семёнов разбирает разницу между прямым (direct) prompt injection, когда вредоносная инструкция вводится напрямую пользователем в диалоге с моделью, и косвенным (indirect) prompt injection, когда вредоносная инструкция попадает в модель через внешние данные — документы, веб-страницы, письма или результаты работы инструментов, которые агент обрабатывает в процессе выполнения задачи, даже не подозревая об этом.
- Собеседник — Артём Семёнов, автор Telegram-канала PWN AI о небезопасном применении ИИ
- Это уже второе интервью Семёнова Хабру: первый разговор об ИБ и ИИ вышел в 2023 году
- Ключевые темы — рост поверхности атаки за счёт агентов и MCP-протокола, ограничения системного промпта как защиты, разница между прямым и косвенным prompt injection
- Безопасность ИИ-систем описывается как отдельная дисциплина со своей таксономией и инструментарием, а не побочная тема классической ИБ
Что стоит за словом «таксономия»
Семёнов подчёркивает, что защита ИИ-систем — это уже не набор разрозненных советов вроде «не доверяйте пользовательскому вводу», а системная дисциплина: у неё есть собственная классификация атак, свои инструменты для тестирования и свой набор задокументированных инцидентов, на которые можно ссылаться. Для инженеров и компаний, которые встраивают языковые модели и агентов в свои продукты, это означает необходимость закладывать защиту от таких атак так же системно, как закладывают защиту от классических уязвимостей вроде SQL-инъекций или XSS, а не полагаться на то, что модель «сама разберётся», где заканчивается легитимная инструкция и начинается атака.
Почему разговор об этом идёт уже второй раз
Это не первое обращение Хабра к теме безопасности ИИ у этого собеседника: аналогичный разговор с Семёновым выходил на площадке ещё в 2023 году. Решение вернуться к теме и обновить данные само по себе показательно — за прошедшее время индустрия перешла от простых чат-ботов, которые в худшем случае выдавали неуместный ответ, к автономным агентам с доступом к файловой системе, внешним сервисам и инструментам через протоколы вроде MCP. Соответственно выросли и ставки: ошибка в защите теперь может стоить не испорченного диалога, а реально удалённых файлов или утёкших данных.
Что это значит
Разговор фиксирует смену масштаба: если ещё недавно атаки на языковые модели были скорее академическим упражнением, то с распространением автономных агентов, которые реально удаляют файлы, отправляют данные наружу и подвержены самовзлому, безопасность ИИ-систем становится практической инженерной задачей — такой же, как безопасность любого другого критичного программного обеспечения, только с новой, специфической для агентов и MCP-протоколов таксономией угроз.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.