OpenAI Blog→ original

GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций

OpenAI представила GPT-Red — систему автоматического red teaming: модель через self-play атакует саму себя, находит уязвимости и учится их закрывать. Три цели — безопасность, alignment и устойчивость к prompt-инъекциям, главной болевой точке браузерных и почтовых AI-агентов. Ручного труда красных команд для масштаба фронтирных моделей уже не хватает — OpenAI автоматизирует их работу.

Procesado por IA desde OpenAI Blog; editado por Hamidun News
GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций
Fuente: OpenAI Blog. Collage: Hamidun News.
◐ Escuchar artículo

OpenAI presentó en julio de 2026 GPT-Red: un sistema de red teaming automático en el que un modelo de lenguaje se ataca a sí mismo mediante self-play, encuentra vulnerabilidades y aprende a cerrarlas. Los objetivos clave del proyecto, según la descripción en el blog de OpenAI, son la seguridad, el alignment y la resistencia a las inyecciones de prompt.

Cómo funciona el self-play en GPT-Red

GPT-Red automatiza el red teaming: un rol del modelo genera solicitudes de ataque, el otro aprende a reconocerlas y repelerlas, y el ciclo se repite sin intervención humana. El principio hereda el enfoque de AlphaGo de DeepMind: en 2016, el programa se convirtió en el jugador de go más fuerte jugando contra sí mismo; ahora la misma mecánica de autojuego se aplica no a un juego de mesa, sino a la búsqueda de agujeros en las defensas de los modelos de lenguaje.

«GPT-Red utiliza self-play para mejorar la seguridad de la IA, el alignment y la resistencia a las inyecciones de prompt», se afirma en el anuncio de la publicación en el blog de

OpenAI.

El red teaming clásico choca con el factor humano: los expertos idean manualmente escenarios provocadores, y hay pocos especialistas de este tipo en el mercado. Un sistema automático elimina la limitación de escala: el modelo genera y prueba órdenes de magnitud más ataques que cualquier equipo humano, lo hace de forma continua y puede reiniciarse tras cada actualización de los pesos.

Por qué esto es importante para los agentes de IA

La inyección de prompt es un ataque en el que una instrucción maliciosa se oculta en datos externos —un correo, una página web o un documento— y el agente la ejecuta como si fuera una orden de su dueño. OpenAI sitúa la resistencia a las inyecciones de prompt entre los tres objetivos principales de GPT-Red, junto con la seguridad y el alignment, algo fijado directamente en el anuncio de la publicación.

Para los agentes de navegador y de correo, esta protección es crítica: un modelo que lee internet inevitablemente lee también las instrucciones de los atacantes. En la industria, las inyecciones de prompt se consideran el principal problema sin resolver de la era de los agentes: cuanta más autonomía reciben los agentes con acceso al dinero, el correo y los archivos del usuario, más caro sale cada ataque no detectado.

La automejora como estrategia de defensa

El título de la publicación de OpenAI —«Unlocking Self-Improvement for Robustness»— declara abiertamente la apuesta por la automejora: el modelo no solo se verifica desde fuera, sino que se hace más resistente por sí mismo. Esto cambia la asimetría habitual de la ciberseguridad, en la que al atacante le basta un solo intento exitoso mientras el defensor debe cerrar todos los agujeros a la vez: ahora el atacante automático trabaja del lado de la defensa y encuentra la vulnerabilidad antes que un adversario real.

Preguntas abiertas no faltan: en su breve descripción, OpenAI no aporta métricas públicas sobre cuántas vulnerabilidades encuentra GPT-Red ni cuánto cae la proporción de inyecciones exitosas tras el entrenamiento. El efecto práctico solo podrá juzgarse por la resistencia de los próximos lanzamientos de modelos de OpenAI.

Qué significa esto

La seguridad de los modelos de frontera se transforma de una auditoría manual en una cadena automatizada: los modelos empiezan a atacarse y repararse a sí mismos. Si el enfoque de GPT-Red escala, la resistencia a las inyecciones de prompt se convertirá en una característica medible de los modelos, igual que hoy lo son los resultados de los benchmarks de código o matemáticas.

Preguntas frecuentes

¿Qué es el red teaming automático?

El red teaming consiste en ataques deliberados contra un sistema para encontrar vulnerabilidades antes de que las descubran los actores maliciosos. En GPT-Red este papel no lo desempeña un equipo de personas, sino el propio modelo: mediante self-play genera ataques contra sus propias defensas y aprende a resistirlos.

¿Qué es una inyección de prompt y por qué es peligrosa?

La inyección de prompt es una instrucción oculta en datos externos (un correo, una página, un archivo) que el modelo ejecuta por error como una orden del usuario. Para los agentes de IA con acceso al correo y al navegador es el principal vector de ataque; precisamente la resistencia a este tipo de inyecciones es la que OpenAI menciona como uno de los tres objetivos de GPT-Red.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…