Anthropic Reveló Detalles de la Seguridad Cibernética de Fable 5 y Propuso una Escala de Severidad de Jailbreak
El 2 de julio de 2026, Anthropic publicó detalles sobre cómo funcionan los clasificadores de seguridad de Fable 5: el modelo categoriza todas las solicitudes cibernéticas en cuatro categorías—de prohibidas a inofensivas—y utiliza un 'margen de seguridad' ampliado. En paralelo, Anthropic y su socio Glasswing presentaron el primer borrador de una escala de severidad de jailbreak a nivel industrial e iniciaron un programa HackerOne para investigadores.
Procesado por IA desde Anthropic Blog; editado por Hamidun News
El 2 de julio de 2026, Anthropic describió en detalle los principios de cómo funcionan los clasificadores de seguridad de Fable 5 y lanzó el primer borrador de un marco industrial para evaluar la criticidad de los jailbreaks.
Cómo se organizan los clasificadores de seguridad de Fable 5
La ciberseguridad es fundamentalmente un campo de doble uso: las mismas capacidades pueden servir tanto para la defensa como para el ataque. Esta es precisamente la razón por la que Anthropic no busca bloquear todo lo relacionado. En su lugar, los clasificadores de Fable 5 evalúan cada solicitud en cuatro categorías:
- Uso prohibido—acciones que en la mayoría de los casos son capaces de causar daño significativo y carecen de valor defensivo. Bloqueadas incondicionalmente.
- Doble uso de alto riesgo—herramientas ampliamente utilizadas por atacantes pero que también tienen aplicaciones legítimas. También bloqueadas.
- Doble uso de bajo riesgo—capacidades que son principalmente defensivas en naturaleza, teóricamente útiles y para atacantes. Monitoreo; a veces bloqueo como precaución.
- Uso inofensivo—tareas legítimas sin potencial de daño. Permitidas con monitoreo.
El concepto clave del sistema es "margen de seguridad": una zona intencionalmente expandida en la cual el clasificador bloquea solicitudes por precaución, incluso si parecen potencialmente inofensivas. Una solicitud debe verse claramente segura para garantizar el paso a través de la verificación.
Para Fable 5, este margen fue intencionalmente hecho más amplio que en modelos anteriores de Anthropic.
¿Por qué se necesita una escala unificada de criticidad de jailbreak?
Un jailbreak es una forma no convencional de hacer que un modelo de IA evite sus propias limitaciones. Puede ser casi inofensivo (elimina solo una restricción menor) o críticamente peligroso (abre un amplio rango de capacidades dañinas, haciendo el modelo fundamentalmente más peligroso).
Al mismo tiempo, la industria carece de una terminología unificada para evaluar estos riesgos, lo que complica seriamente el diálogo entre empresas de IA y reguladores. Anthropic, junto con socios de Glasswing, preparó el primer borrador de tal marco. La empresa lo ve como un punto de partida para una amplia discusión que involucre a la comunidad académica, la industria, la sociedad civil y los organismos gubernamentales.
Las propuestas se aceptan en [email protected].
"Creemos: trabajando juntos, seremos capaces de desarrollar un
estándar que nos permita usar esta tecnología con propósitos defensivos, mientras simultáneamente prevenimos el abuso", dijo en la declaración oficial de Anthropic.
En paralelo, se ha lanzado un programa en la plataforma HackerOne: los investigadores de seguridad pueden enviar oficialmente jailbreaks de Fable 5 descubiertos para verificación por el equipo de Anthropic.
Lo que esto significa
Anthropic reconoce abiertamente la complejidad fundamental de la ciberseguridad como campo de doble uso y elige un enfoque calibrado en lugar de bloques totales. El marco para la criticidad de jailbreak es el primer intento industrial serio de crear un lenguaje común para el diálogo entre laboratorios de IA y reguladores.
Si el estándar echa raíces, las empresas podrán describir amenazas de omisión de seguridad en términos acordados, y los gobiernos podrán evaluar más precisamente los riesgos de nuevos modelos.
Preguntas frecuentes
¿Qué es "margen de seguridad" en Fable 5?
"Margen de seguridad" es una zona en la cual el clasificador bloquea solicitudes por precaución, incluso si no parecen explícitamente dañinas. Esto reduce el riesgo de permitir accidentalmente tareas peligrosas al costo de algunos falsos positivos. En Fable 5, Anthropic intencionalmente expandió esta zona comparada con modelos anteriores.
¿Cómo pueden los investigadores reportar un jailbreak de
Fable 5 que encontraron?
Anthropic lanzó un programa especial en HackerOne: los investigadores de seguridad pueden enviar jailbreaks de Fable 5 descubiertos para verificación oficial. Las propuestas conceptuales en el marco de criticidad se aceptan en [email protected].
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.