Ограничения ИИ от OpenAI и Anthropic мешают исследователям кибербезопасности
Издание TechCrunch опросило нескольких специалистов по наступательной кибербезопасности — тех, кто ищет неизвестные уязвимости и пишет инструменты для их эксплуатации. Главная жалоба: защитные ограничения (guardrails) моделей OpenAI и Anthropic всё чаще отказывают в помощи с задачами, которые для «белых» хакеров — рутина. Причина в том, что тот же запрос мог бы прийти и от злоумышленника, а модель не видит намерения.
AI-обработка оригинала TechCrunch; редакция Hamidun News
TechCrunch 23 июля 2026 года опубликовал материал о том, что защитные ограничения (guardrails) языковых моделей OpenAI и Anthropic мешают работе исследователей наступательной кибербезопасности — специалистов, которые ищут ещё неизвестные уязвимости и разрабатывают инструменты для их эксплуатации.
Почему AI-фильтры мешают пентестерам
Модели OpenAI (ChatGPT) и Anthropic (Claude) всё чаще отказывают в помощи с задачами наступательной безопасности, даже когда за клавиатурой «белый» специалист. По данным TechCrunch, издание опросило нескольких исследователей, которые профессионально ищут уязвимости нулевого дня и пишут эксплойты, — и все они говорят об одном: фильтры срабатывают на легитимную рабочую задачу как на попытку взлома.
Проблема в том, что запрос «напиши код, эксплуатирующий вот эту уязвимость» выглядит для модели одинаково — независимо от того, кто его отправил: red team компании или злоумышленник. Модель видит только текст запроса, а не намерение и не контракт на пентест.
- Издание — TechCrunch, дата публикации — 23 июля 2026 года
- Модели в фокусе — OpenAI (ChatGPT) и Anthropic (Claude)
- Кого опросили — исследователей наступательной кибербезопасности (offensive security)
- Суть претензии — guardrails отказывают в помощи с поиском уязвимостей и написанием эксплойтов
Guardrails — это встроенные в модель правила безопасности, которые блокируют потенциально вредоносный вывод: инструкции по созданию оружия, вредоносного кода или обхода защиты. OpenAI и Anthropic позиционируют их как ключевой элемент ответственного ИИ, но именно на границе с наступательной безопасностью правила срабатывают слишком широко.
В чём дилемма двойного назначения
Наступательная кибербезопасность — классический пример технологии двойного назначения: те же навыки и инструменты, что защищают инфраструктуру, ломают её. Red team имитирует атакующего, чтобы найти дыры раньше настоящего противника, — и для этого ей нужны ровно те же эксплойты, эмуляция вредоносного ПО и техники обхода защиты.
Guardrails OpenAI и Anthropic настроены блокировать именно этот класс запросов, потому что лаборатории не могут на лету отличить исследователя от преступника. В результате, как описывает TechCrunch, специалисты по безопасности упираются в отказы там, где ещё год-два назад модель охотно помогала, и вынуждены обходить ограничения или уходить к менее зарегулированным инструментам.
Защитные ограничения
OpenAI и Anthropic мешают работе исследователей наступательной кибербезопасности — так суть проблемы сформулирована в материале TechCrunch от 23 июля 2026 года.
Чем это грозит защите
Пережатые фильтры бьют не только по атакующей стороне — они замедляют оборону. Если легальный red team не может использовать топовую модель для рутинной работы, он теряет в скорости, а сама модель — в полезности для целого профессионального сегмента. Часть опрошенных, по словам TechCrunch, переключается на локальные open-weight модели или узкоспециализированные security-инструменты, где нет корпоративных фильтров, — ценой качества и удобства.
Дальше возникает перекос: злоумышленники и так работают с моделями без ограничений (open-weight, «расцензуренные» сборки, подпольные сервисы), а связаны руки оказываются как раз у тех, кто действует легально и по контракту. По логике материала TechCrunch, чрезмерная осторожность OpenAI и Anthropic рискует наказать добросовестных исследователей, не остановив недобросовестных.
Что это значит
Спор о guardrails в наступательной безопасности — это спор о том, где проходит граница между «безопасно по умолчанию» и «бесполезно для профессионалов». Пока OpenAI и Anthropic не научатся отличать легитимный пентест от подготовки атаки — например, через верификацию организаций или специальные режимы для security-команд, — исследователи будут выбирать инструменты, которые их не блокируют.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.