OpenAI Blog→ original

GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций

OpenAI представила GPT-Red — систему автоматического red teaming: модель через self-play атакует саму себя, находит уязвимости и учится их закрывать. Три цели — безопасность, alignment и устойчивость к prompt-инъекциям, главной болевой точке браузерных и почтовых AI-агентов. Ручного труда красных команд для масштаба фронтирных моделей уже не хватает — OpenAI автоматизирует их работу.

Processado por IA de OpenAI Blog; editado por Hamidun News
GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций
Fonte: OpenAI Blog. Colagem: Hamidun News.
◐ Ouvir artigo

A OpenAI apresentou em julho de 2026 o GPT-Red — um sistema de red teaming automático em que um modelo de linguagem ataca a si mesmo via self-play, encontra vulnerabilidades e aprende a fechá-las. Os objetivos-chave do projeto, segundo a descrição no blog da OpenAI, são segurança, alignment e resistência a injeções de prompt.

Como funciona o self-play no GPT-Red

O GPT-Red automatiza o red teaming: um papel do modelo gera solicitações de ataque, o outro aprende a reconhecê-las e repeli-las, e o ciclo se repete sem participação humana. O princípio herda a abordagem do AlphaGo, da DeepMind: em 2016, o programa se tornou o jogador de go mais forte jogando contra si mesmo — agora a mesma mecânica de autojogo é aplicada não a um jogo de tabuleiro, mas à busca de brechas nas defesas dos modelos de linguagem.

"O GPT-Red usa self-play para melhorar a segurança da IA, o alignment e a resistência a injeções de prompt", diz o anúncio da publicação no blog da

OpenAI.

O red teaming clássico esbarra no fator humano: especialistas criam manualmente cenários provocativos, e há poucos profissionais desse tipo no mercado. Um sistema automático remove a limitação de escala — o modelo gera e testa ordens de magnitude mais ataques do que qualquer equipe humana, faz isso continuamente e pode ser reiniciado após cada atualização dos pesos.

Por que isso é importante para agentes de IA

A injeção de prompt é um ataque em que uma instrução maliciosa se esconde em dados externos — um e-mail, uma página da web ou um documento — e o agente a executa como se fosse um comando do dono. A OpenAI coloca a resistência a injeções de prompt entre os três principais objetivos do GPT-Red, ao lado da segurança e do alignment — isso está registrado diretamente no anúncio da publicação.

Para agentes de navegador e de e-mail, essa proteção é crítica: um modelo que lê a internet inevitavelmente lê também as instruções dos atacantes. Na indústria, as injeções de prompt são consideradas o principal problema não resolvido da era dos agentes — quanto mais autonomia os agentes ganham com acesso ao dinheiro, ao e-mail e aos arquivos do usuário, mais caro sai cada ataque que passa despercebido.

Autoaperfeiçoamento como estratégia de defesa

O título da publicação da OpenAI — "Unlocking Self-Improvement for Robustness" — declara abertamente a aposta no autoaperfeiçoamento: o modelo não é apenas verificado de fora, ele mesmo se torna mais resistente. Isso muda a assimetria habitual da cibersegurança, em que ao atacante basta uma única tentativa bem-sucedida, enquanto o defensor precisa fechar todas as brechas de uma vez: agora o atacante automático trabalha do lado da defesa e encontra a vulnerabilidade antes de um adversário real.

Perguntas em aberto não faltam: na breve descrição, a OpenAI não apresenta métricas públicas — quantas vulnerabilidades o GPT-Red encontra e quanto cai a proporção de injeções bem-sucedidas após o treinamento. O efeito prático só poderá ser avaliado pela resistência dos próximos lançamentos de modelos da OpenAI.

O que isso significa

A segurança dos modelos de fronteira está se transformando de auditoria manual em uma esteira automatizada: os modelos começam a atacar e consertar a si mesmos. Se a abordagem do GPT-Red escalar, a resistência a injeções de prompt se tornará uma característica mensurável dos modelos — assim como hoje são os resultados de benchmarks de código ou matemática.

Perguntas frequentes

O que é red teaming automático?

Red teaming são ataques intencionais a um sistema para encontrar vulnerabilidades antes que criminosos as descubram. No GPT-Red, esse papel não é desempenhado por uma equipe de pessoas, mas pelo próprio modelo: via self-play, ele gera ataques contra as próprias defesas e aprende a resistir a eles.

O que é injeção de prompt e por que ela é perigosa?

A injeção de prompt é uma instrução oculta em dados externos (um e-mail, uma página, um arquivo) que o modelo executa por engano como um comando do usuário. Para agentes de IA com acesso ao e-mail e ao navegador, esse é o principal vetor de ataque; é justamente a resistência a esse tipo de injeção que a OpenAI aponta como um dos três objetivos do GPT-Red.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…