OpenAI Blog→ оригинал

GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций

OpenAI представила GPT-Red — систему автоматического red teaming: модель через self-play атакует саму себя, находит уязвимости и учится их закрывать. Три цели — безопасность, alignment и устойчивость к prompt-инъекциям, главной болевой точке браузерных и почтовых AI-агентов. Ручного труда красных команд для масштаба фронтирных моделей уже не хватает — OpenAI автоматизирует их работу.

AI-обработка оригинала OpenAI Blog; редакция Hamidun News
GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций
Источник: OpenAI Blog. Коллаж: Hamidun News.
◐ Слушать статью

OpenAI в июле 2026 года представила GPT-Red — систему автоматического red teaming, в которой языковая модель через self-play атакует саму себя, находит уязвимости и учится их закрывать. Ключевые цели проекта, по описанию в блоге OpenAI, — безопасность, alignment и устойчивость к prompt-инъекциям.

Как устроен self-play в GPT-Red

GPT-Red автоматизирует red teaming: одна роль модели генерирует атакующие запросы, другая учится их распознавать и отражать, и цикл повторяется без участия человека. Принцип наследует подходу AlphaGo от DeepMind: в 2016 году программа стала сильнейшим игроком в го, играя сама с собой, — теперь ту же механику самоигры применяют не к настольной игре, а к поиску дыр в защите языковых моделей.

«GPT-Red использует self-play, чтобы улучшать безопасность ИИ, alignment и устойчивость к prompt-инъекциям», — говорится в анонсе публикации в блоге

OpenAI.

Классический red teaming упирается в людей: эксперты вручную придумывают провокационные сценарии, и таких специалистов на рынке мало. Автоматическая система снимает ограничение масштаба — модель генерирует и проверяет на порядки больше атак, чем любая человеческая команда, причём делает это непрерывно и может перезапускаться после каждого обновления весов.

Почему это важно для AI-агентов

Prompt-инъекция — атака, при которой вредоносная инструкция прячется во внешних данных: в письме, веб-странице или документе — и агент исполняет её как команду владельца. OpenAI выносит устойчивость к prompt-инъекциям в число трёх главных целей GPT-Red наряду с безопасностью и alignment — это зафиксировано прямо в анонсе публикации.

Для браузерных и почтовых агентов такая защита критична: модель, которая читает интернет, неизбежно читает и инструкции злоумышленников. В индустрии prompt-инъекции считаются главной нерешённой проблемой агентной эры — чем больше автономии получают агенты с доступом к деньгам, почте и файлам пользователя, тем дороже обходится каждая пропущенная атака.

Самоулучшение как стратегия защиты

Заголовок публикации OpenAI — «Unlocking Self-Improvement for Robustness» — прямо заявляет ставку на самоулучшение: модель не просто проверяют извне, она сама делает себя устойчивее. Это меняет привычную асимметрию кибербезопасности, в которой атакующему достаточно одной удачной попытки, а защитнику нужно закрыть все дыры сразу: теперь автоматический атакующий работает на стороне защиты и находит уязвимость раньше реального злоумышленника.

Открытых вопросов хватает: в кратком описании OpenAI не приводит публичных метрик — сколько уязвимостей находит GPT-Red и насколько падает доля успешных инъекций после обучения. Судить о практическом эффекте можно будет по устойчивости следующих релизов моделей OpenAI.

Что это значит

Безопасность фронтирных моделей превращается из ручного аудита в автоматизированный конвейер: модели начинают атаковать и чинить сами себя. Если подход GPT-Red масштабируется, устойчивость к prompt-инъекциям станет измеримой характеристикой моделей — такой же, как сегодня результаты бенчмарков по коду или математике.

Частые вопросы

Что такое автоматический red teaming?

Red teaming — это намеренные атаки на систему ради поиска уязвимостей до того, как их найдут злоумышленники. В GPT-Red эту роль выполняет не команда людей, а сама модель: через self-play она генерирует атаки на собственные защиты и учится им противостоять.

Что такое prompt-инъекция и чем она опасна?

Prompt-инъекция — скрытая инструкция во внешних данных (письме, странице, файле), которую модель ошибочно исполняет как команду пользователя. Для AI-агентов с доступом к почте и браузеру это главный вектор атак; именно устойчивость к таким инъекциям OpenAI называет одной из трёх целей GPT-Red.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…