Wired→ original

Джейлбрейк ИИ: новый инструмент обходит защиту моделей Google, OpenAI, Anthropic и xAI

Wired протестировал новый инструмент для джейлбрейка на флагманских моделях Google, OpenAI, Anthropic и xAI. Итог: защиту части передовых моделей обойти тревожно легко, а устойчивость к взлому у разных компаний ощутимо различается — одни держат оборону лучше, другие заметно слабее.

Processado por IA de Wired; editado por Hamidun News
Джейлбрейк ИИ: новый инструмент обходит защиту моделей Google, OpenAI, Anthropic и xAI
Fonte: Wired. Colagem: Hamidun News.
◐ Ouvir artigo

A Wired testou uma nova ferramenta de jailbreak — uma forma de burlar as restrições de segurança embutidas — nos modelos de quatro das maiores empresas de IA: Google, OpenAI, Anthropic e xAI. A conclusão do correspondente é direta: as proteções de parte dos modelos de fronteira (frontier) se mostram alarmantemente fáceis de remover.

O que o experimento da Wired mostrou

Um correspondente da Wired observou uma nova ferramenta tentando, uma a uma, burlar os mecanismos de segurança dos modelos de quatro empresas frontier. São as desenvolvedoras do Gemini (Google), GPT (OpenAI), Claude (Anthropic) e Grok (xAI) — basicamente, todo o topo do setor. Segundo a observação da publicação, os modelos se comportaram de forma diferente: alguns se defenderam melhor, outros bem pior, e é justamente essa disparidade que o autor chama de inesperada.

Principais fatos da matéria:

  • A ferramenta foi testada contra modelos de quatro empresas: Google, OpenAI, Anthropic e xAI
  • Os alvos foram os mecanismos de proteção (safeguards) dos modelos principais — Gemini, GPT, Claude e Grok
  • Principal conclusão da Wired: as proteções de alguns modelos de fronteira são alarmantemente fáceis de burlar
  • A resistência a jailbreak varia de forma perceptível entre as empresas
"Observei uma nova ferramenta tentando burlar os mecanismos de proteção de quatro grandes empresas frontier.

Você pode se surpreender com o desempenho delas", diz a reportagem da Wired.

O que é o jailbreak de um modelo

Jailbreak é uma técnica que faz um modelo de linguagem produzir aquilo que, por suas próprias regras, ele não deveria produzir: instruções para fabricar armas, código malicioso, desinformação ou outro conteúdo proibido. Formalmente, o modelo tem filtros e regras, mas um pedido especialmente formulado consegue contorná-los.

Os métodos clássicos incluem cenários de interpretação de papéis ("imagine que você é o vilão de um filme"), disfarçar o pedido como um exercício acadêmico, escalada gradual do inofensivo ao proibido, ou substituição de contexto. As ferramentas novas automatizam essa tentativa e erro: em vez de formular manualmente as frases, elas passam pelo modelo centenas de variantes até alguma funcionar. As quatro empresas do teste investem publicamente em red-teaming — testes adversariais dos modelos antes do lançamento —, mas o jailbreak continua sendo uma das principais classes de ataque contra grandes modelos de linguagem.

Por que isso é perigoso

O perigo está em que um jailbreak bem-sucedido transforma um assistente útil em fonte de dano real. Enquanto o modelo apenas responde em um chat, o custo de uma falha é limitado; mas os modelos frontier ganham cada vez mais acesso a ferramentas, a um navegador e a ações realizadas em nome do usuário — e, nesse momento, a proteção removida amplia as consequências. Ao contrário de uma vulnerabilidade comum de software, o jailbreak não pode ser fechado com um único patch: um modelo não é uma linha de código, e sim um comportamento aprendido, e tapar uma brecha muitas vezes abre outra.

A disparidade de resultados entre as quatro empresas é, por si só, um sinal. Ela significa que "segurança de modelo frontier" não é um padrão único do setor, mas uma propriedade de cada produto específico: em algumas as barreiras são mais altas, em outras a mesma ferramenta consegue derrubá-las. Para uma empresa que incorpora esses modelos em seus serviços, essa é a diferença entre um risco administrado e um risco não administrado.

O que isso significa

O teste da Wired é mais um lembrete de que os mecanismos de proteção dos modelos de ponta não são absolutos, e que sua confiabilidade varia bastante de empresa para empresa. À medida que os assistentes de IA ganham mais permissões e autonomia, a resistência a jailbreak deixará de ser um tema abstrato para pesquisadores e se tornará um critério prático na escolha de um modelo.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…