Anthropic Blog→ original

Anthropic Revelou Detalhes da Segurança Cibernética do Fable 5 e Propôs uma Escala de Severidade de Jailbreak

Em 2 de julho de 2026, Anthropic publicou detalhes sobre como os classificadores de segurança do Fable 5 funcionam: o modelo categoriza todas as solicitações cibernéticas em quatro categorias—de proibidas a inofensivas—e utiliza uma 'margem de segurança' estendida. Em paralelo, Anthropic e seu parceiro Glasswing revelaram o primeiro rascunho de uma escala de severidade de jailbreak em nível industrial e lançaram um programa HackerOne para pesquisadores.

Processado por IA de Anthropic Blog; editado por Hamidun News
Anthropic Revelou Detalhes da Segurança Cibernética do Fable 5 e Propôs uma Escala de Severidade de Jailbreak
Fonte: Anthropic Blog. Colagem: Hamidun News.
◐ Ouvir artigo

Em 2 de julho de 2026, Anthropic descreveu em detalhes os princípios de como os classificadores de segurança do Fable 5 funcionam e lançou o primeiro rascunho de um framework industrial para avaliar a criticidade de jailbreaks.

Como os classificadores de segurança do

Fable 5 são organizados

Cibersegurança é fundamentalmente um campo de duplo uso: as mesmas capacidades podem servir tanto para defesa quanto para ataque. Esta é precisamente a razão pela qual Anthropic não busca bloquear tudo relacionado a isso. Em vez disso, os classificadores do Fable 5 avaliam cada solicitação em quatro categorias:

  • Uso proibido—ações que na maioria dos casos são capazes de causar dano significativo e carecem de valor defensivo. Bloqueadas incondicionalmente.
  • Duplo uso de alto risco—ferramentas amplamente usadas por atacantes mas que também têm aplicações legítimas. Também bloqueadas.
  • Duplo uso de baixo risco—capacidades que são principalmente defensivas por natureza, teoricamente úteis e para atacantes. Monitoramento; às vezes bloqueio como precaução.
  • Uso inofensivo—tarefas legítimas sem potencial para dano. Permitidas com monitoramento.

O conceito-chave do sistema é "margem de segurança": uma zona intencionalmente expandida na qual o classificador bloqueia solicitações por precaução, mesmo que pareçam potencialmente inofensivas. Uma solicitação deve parecer claramente segura para garantir passagem através da verificação.

Para o Fable 5, esta margem foi intencionalmente feita mais ampla do que nos modelos anteriores da Anthropic.

Por que uma escala unificada de criticidade de jailbreak é necessária?

Um jailbreak é uma forma não convencional de fazer um modelo de IA contornar suas próprias limitações. Pode ser quase inofensivo (remove apenas uma restrição menor) ou criticamente perigoso (abre um amplo espectro de capacidades prejudiciais, tornando o modelo fundamentalmente mais perigoso).

Ao mesmo tempo, a indústria carece de uma terminologia unificada para avaliar esses riscos, o que complica seriamente o diálogo entre empresas de IA e reguladores. Anthropic, em conjunto com parceiros Glasswing, preparou o primeiro rascunho de tal framework. A empresa o vê como um ponto de partida para ampla discussão envolvendo comunidade acadêmica, indústria, sociedade civil e órgãos governamentais.

Propostas são aceitas em [email protected].

"Acreditamos: trabalhando conjuntamente, seremos capazes de

desenvolver um padrão que nos permitirá usar esta tecnologia para fins defensivos, enquanto simultaneamente prevenimos abusos", disse na declaração oficial da Anthropic.

Em paralelo, um programa foi lançado na plataforma HackerOne: pesquisadores de segurança podem oficialmente enviar jailbreaks do Fable 5 descobertos para verificação pela equipe Anthropic.

O que isto significa

Anthropic reconhece abertamente a complexidade fundamental de cibersegurança como campo de duplo uso e escolhe uma abordagem calibrada em vez de bloqueios totais. O framework para criticidade de jailbreak é a primeira tentativa industrial séria de criar uma linguagem comum para diálogo entre laboratórios de IA e reguladores.

Se o padrão se estabelecer, as empresas serão capazes de descrever ameaças de contorno de segurança em termos acordados, e governos serão capazes de avaliar mais precisamente os riscos de novos modelos.

Perguntas frequentes

O que é "margem de segurança" no Fable 5?

"Margem de segurança" é uma zona na qual o classificador bloqueia solicitações por precaução, mesmo que não pareçam explicitamente prejudiciais. Isto reduz o risco de acidentalmente permitir tarefas perigosas ao custo de alguns falsos positivos. No Fable 5, Anthropic intencionalmente expandiu esta zona comparada a modelos anteriores.

Como os pesquisadores podem relatar um jailbreak do

Fable 5 que encontraram?

Anthropic lançou um programa especial na plataforma HackerOne: pesquisadores de segurança podem enviar jailbreaks do Fable 5 descobertos para verificação oficial. Propostas conceituais no framework de criticidade são aceitas em [email protected].

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…