Джейлбрейк ИИ: новый инструмент обходит защиту моделей Google, OpenAI, Anthropic и xAI
Wired протестировал новый инструмент для джейлбрейка на флагманских моделях Google, OpenAI, Anthropic и xAI. Итог: защиту части передовых моделей обойти тревожно легко, а устойчивость к взлому у разных компаний ощутимо различается — одни держат оборону лучше, другие заметно слабее.
Processado por IA de Wired; editado por Hamidun News
A Wired testou uma nova ferramenta de jailbreak — uma forma de burlar as restrições de segurança embutidas — nos modelos de quatro das maiores empresas de IA: Google, OpenAI, Anthropic e xAI. A conclusão do correspondente é direta: as proteções de parte dos modelos de fronteira (frontier) se mostram alarmantemente fáceis de remover.
O que o experimento da Wired mostrou
Um correspondente da Wired observou uma nova ferramenta tentando, uma a uma, burlar os mecanismos de segurança dos modelos de quatro empresas frontier. São as desenvolvedoras do Gemini (Google), GPT (OpenAI), Claude (Anthropic) e Grok (xAI) — basicamente, todo o topo do setor. Segundo a observação da publicação, os modelos se comportaram de forma diferente: alguns se defenderam melhor, outros bem pior, e é justamente essa disparidade que o autor chama de inesperada.
Principais fatos da matéria:
- A ferramenta foi testada contra modelos de quatro empresas: Google, OpenAI, Anthropic e xAI
- Os alvos foram os mecanismos de proteção (safeguards) dos modelos principais — Gemini, GPT, Claude e Grok
- Principal conclusão da Wired: as proteções de alguns modelos de fronteira são alarmantemente fáceis de burlar
- A resistência a jailbreak varia de forma perceptível entre as empresas
"Observei uma nova ferramenta tentando burlar os mecanismos de proteção de quatro grandes empresas frontier.
Você pode se surpreender com o desempenho delas", diz a reportagem da Wired.
O que é o jailbreak de um modelo
Jailbreak é uma técnica que faz um modelo de linguagem produzir aquilo que, por suas próprias regras, ele não deveria produzir: instruções para fabricar armas, código malicioso, desinformação ou outro conteúdo proibido. Formalmente, o modelo tem filtros e regras, mas um pedido especialmente formulado consegue contorná-los.
Os métodos clássicos incluem cenários de interpretação de papéis ("imagine que você é o vilão de um filme"), disfarçar o pedido como um exercício acadêmico, escalada gradual do inofensivo ao proibido, ou substituição de contexto. As ferramentas novas automatizam essa tentativa e erro: em vez de formular manualmente as frases, elas passam pelo modelo centenas de variantes até alguma funcionar. As quatro empresas do teste investem publicamente em red-teaming — testes adversariais dos modelos antes do lançamento —, mas o jailbreak continua sendo uma das principais classes de ataque contra grandes modelos de linguagem.
Por que isso é perigoso
O perigo está em que um jailbreak bem-sucedido transforma um assistente útil em fonte de dano real. Enquanto o modelo apenas responde em um chat, o custo de uma falha é limitado; mas os modelos frontier ganham cada vez mais acesso a ferramentas, a um navegador e a ações realizadas em nome do usuário — e, nesse momento, a proteção removida amplia as consequências. Ao contrário de uma vulnerabilidade comum de software, o jailbreak não pode ser fechado com um único patch: um modelo não é uma linha de código, e sim um comportamento aprendido, e tapar uma brecha muitas vezes abre outra.
A disparidade de resultados entre as quatro empresas é, por si só, um sinal. Ela significa que "segurança de modelo frontier" não é um padrão único do setor, mas uma propriedade de cada produto específico: em algumas as barreiras são mais altas, em outras a mesma ferramenta consegue derrubá-las. Para uma empresa que incorpora esses modelos em seus serviços, essa é a diferença entre um risco administrado e um risco não administrado.
O que isso significa
O teste da Wired é mais um lembrete de que os mecanismos de proteção dos modelos de ponta não são absolutos, e que sua confiabilidade varia bastante de empresa para empresa. À medida que os assistentes de IA ganham mais permissões e autonomia, a resistência a jailbreak deixará de ser um tema abstrato para pesquisadores e se tornará um critério prático na escolha de um modelo.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.