Ограничения ИИ от OpenAI и Anthropic мешают исследователям кибербезопасности
Издание TechCrunch опросило нескольких специалистов по наступательной кибербезопасности — тех, кто ищет неизвестные уязвимости и пишет инструменты для их эксплуатации. Главная жалоба: защитные ограничения (guardrails) моделей OpenAI и Anthropic всё чаще отказывают в помощи с задачами, которые для «белых» хакеров — рутина. Причина в том, что тот же запрос мог бы прийти и от злоумышленника, а модель не видит намерения.
Procesado por IA desde TechCrunch; editado por Hamidun News
TechCrunch publicó el 23 de julio de 2026 un artículo sobre cómo las barreras de seguridad (guardrails) de los modelos de lenguaje de OpenAI y Anthropic están dificultando el trabajo de los investigadores de ciberseguridad ofensiva —especialistas que buscan vulnerabilidades aún desconocidas y desarrollan herramientas para explotarlas.
Por qué los filtros de IA estorban a los pentesters
Los modelos de OpenAI (ChatGPT) y de Anthropic (Claude) se niegan cada vez más a ayudar con tareas de seguridad ofensiva, incluso cuando quien está al teclado es un especialista "de sombrero blanco". Según TechCrunch, el medio entrevistó a varios investigadores que buscan profesionalmente vulnerabilidades de día cero y escriben exploits, y todos coinciden en lo mismo: los filtros reaccionan ante una tarea de trabajo legítima como si fuera un intento de intrusión.
El problema es que una solicitud como "escribe código que explote esta vulnerabilidad" luce igual para el modelo sin importar quién la envíe: el red team de una empresa o un atacante. El modelo solo ve el texto de la solicitud, no la intención ni el contrato de pentest que hay detrás.
- Medio — TechCrunch, fecha de publicación — 23 de julio de 2026
- Modelos en el foco — OpenAI (ChatGPT) y Anthropic (Claude)
- A quién entrevistaron — investigadores de ciberseguridad ofensiva (offensive security)
- La esencia de la queja — los guardrails se niegan a ayudar con la búsqueda de vulnerabilidades y la escritura de exploits
Los guardrails son reglas de seguridad integradas en el modelo que bloquean resultados potencialmente dañinos: instrucciones para fabricar armas, código malicioso o formas de eludir defensas. OpenAI y Anthropic los presentan como un elemento clave de la IA responsable, pero es justo en el límite con la seguridad ofensiva donde las reglas se activan de forma demasiado amplia.
En qué consiste el dilema del doble uso
La ciberseguridad ofensiva es un ejemplo clásico de tecnología de doble uso: las mismas habilidades y herramientas que protegen la infraestructura también pueden romperla. Un red team imita a un atacante para encontrar los huecos antes que un adversario real, y para eso necesita exactamente los mismos exploits, la emulación de malware y las técnicas de evasión de defensas.
Los guardrails de OpenAI y Anthropic están configurados para bloquear precisamente esta clase de solicitudes, porque los laboratorios no pueden distinguir al vuelo a un investigador de un delincuente. Como resultado, según describe TechCrunch, los profesionales de la seguridad se topan con negativas justo donde, hace uno o dos años, el modelo ayudaba sin problema, y se ven obligados a eludir las restricciones o a recurrir a herramientas menos reguladas.
Las barreras de seguridad de
OpenAI y Anthropic dificultan el trabajo de los investigadores de ciberseguridad ofensiva: así se formula la esencia del problema en el artículo de TechCrunch del 23 de julio de 2026.
Qué riesgo representa esto para la defensa
Los filtros demasiado estrictos no solo golpean al lado atacante: también frenan la defensa. Si un red team legítimo no puede usar un modelo de primer nivel para el trabajo rutinario, pierde velocidad, y el propio modelo pierde utilidad para todo un segmento profesional. Parte de los entrevistados, según TechCrunch, está pasándose a modelos locales de pesos abiertos (open-weight) o a herramientas de seguridad muy especializadas que no tienen filtros corporativos, a costa de la calidad y la comodidad.
Después surge un desequilibrio: los atacantes ya trabajan con modelos sin restricciones (compilaciones open-weight, versiones "sin censura", servicios clandestinos), mientras que quienes tienen las manos atadas son precisamente los que actúan de forma legal y bajo contrato. Siguiendo la lógica del artículo de TechCrunch, la cautela excesiva de OpenAI y Anthropic corre el riesgo de castigar a los investigadores de buena fe sin detener a los de mala fe.
Qué significa esto
El debate sobre los guardrails en la seguridad ofensiva es un debate sobre dónde se traza la línea entre "seguro por defecto" e "inútil para los profesionales". Mientras OpenAI y Anthropic no aprendan a distinguir un pentest legítimo de la preparación de un ataque —por ejemplo, mediante la verificación de organizaciones o modos especiales para equipos de seguridad—, los investigadores seguirán eligiendo las herramientas que no los bloqueen.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.