OpenAI Blog→ المصدر

GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций

OpenAI представила GPT-Red — систему автоматического red teaming: модель через self-play атакует саму себя, находит уязвимости и учится их закрывать. Три цели — безопасность, alignment и устойчивость к prompt-инъекциям, главной болевой точке браузерных и почтовых AI-агентов. Ручного труда красных команд для масштаба фронтирных моделей уже не хватает — OpenAI автоматизирует их работу.

معالج بواسطة الذكاء الاصطناعي من OpenAI Blog؛ بتحرير Hamidun News
GPT-Red от OpenAI: автоматический red teaming через self-play против prompt-инъекций
المصدر: OpenAI Blog. كولاج: Hamidun News.
◐ استمع للمقال

كشفت OpenAI في يوليو 2026 عن GPT-Red — نظام آلي للـ red teaming يقوم فيه نموذج لغوي بمهاجمة نفسه عبر self-play، فيكتشف الثغرات ويتعلم كيفية سدّها. الأهداف الرئيسية للمشروع، بحسب الوصف في مدونة OpenAI، هي السلامة والـ alignment والمناعة ضد حقن الأوامر (prompt injection).

كيف يعمل self-play في GPT-Red

يقوم GPT-Red بأتمتة الـ red teaming: أحد أدوار النموذج يولّد طلبات هجومية، والآخر يتعلم التعرف عليها وصدّها، وتتكرر الدورة دون تدخل بشري. يرث هذا المبدأ نهج AlphaGo من DeepMind: ففي عام 2016 أصبح البرنامج أقوى لاعب في لعبة «غو» باللعب ضد نفسه — والآن تُطبَّق آلية اللعب الذاتي نفسها لا على لعبة لوحية، بل على البحث عن ثغرات في دفاعات النماذج اللغوية.

«يستخدم GPT-Red الـ self-play لتحسين سلامة الذكاء الاصطناعي والـ alignment والمناعة ضد حقن الأوامر»، كما جاء في إعلان النشر في مدونة

OpenAI.

الـ red teaming الكلاسيكي يصطدم بحدود العنصر البشري: يبتكر الخبراء يدويًا سيناريوهات استفزازية، وهؤلاء المتخصصون قليلون في السوق. أما النظام الآلي فيزيل قيد الحجم — إذ يولّد النموذج ويختبر هجمات تفوق بمراتب ما يستطيعه أي فريق بشري، ويفعل ذلك باستمرار ويمكن إعادة تشغيله بعد كل تحديث للأوزان.

لماذا هذا مهم لوكلاء الذكاء الاصطناعي

حقن الأوامر هو هجوم تُخفى فيه تعليمات خبيثة داخل بيانات خارجية: في رسالة بريد أو صفحة ويب أو مستند — فينفّذها الوكيل كأنها أمر من مالكه. وتضع OpenAI المناعة ضد حقن الأوامر ضمن الأهداف الثلاثة الرئيسية لـ GPT-Red إلى جانب السلامة والـ alignment — وهو ما ورد صراحة في إعلان النشر.

بالنسبة لوكلاء المتصفح والبريد الإلكتروني، هذه الحماية حاسمة: فالنموذج الذي يقرأ الإنترنت يقرأ حتمًا تعليمات المهاجمين أيضًا. وفي الصناعة تُعتبر هجمات حقن الأوامر المشكلة الرئيسية غير المحلولة في عصر الوكلاء — فكلما ازدادت استقلالية الوكلاء الذين يملكون وصولًا إلى أموال المستخدم وبريده وملفاته، ارتفعت كلفة كل هجوم يفلت من الرصد.

التحسين الذاتي كاستراتيجية دفاع

عنوان منشور OpenAI — «Unlocking Self-Improvement for Robustness» — يعلن صراحة الرهان على التحسين الذاتي: فالنموذج لا يُختبر من الخارج فحسب، بل يجعل نفسه بنفسه أكثر مناعة. وهذا يغيّر اللاتماثل المعتاد في الأمن السيبراني، حيث تكفي المهاجمَ محاولة ناجحة واحدة بينما يحتاج المدافع إلى سد كل الثغرات دفعة واحدة: الآن يعمل المهاجم الآلي في صف الدفاع ويعثر على الثغرة قبل المهاجم الحقيقي.

ولا تنقص الأسئلة المفتوحة: ففي الوصف الموجز لا تقدم OpenAI مقاييس علنية — كم عدد الثغرات التي يكتشفها GPT-Red وبكم تنخفض نسبة الحقن الناجحة بعد التدريب. ولن يمكن الحكم على الأثر العملي إلا من خلال مناعة الإصدارات القادمة من نماذج OpenAI.

ماذا يعني هذا

تتحول سلامة النماذج الطليعية من تدقيق يدوي إلى خط إنتاج آلي: بدأت النماذج تهاجم نفسها وتصلح نفسها بنفسها. وإذا توسّع نهج GPT-Red، فستصبح المناعة ضد حقن الأوامر خاصية قابلة للقياس في النماذج — تمامًا مثل نتائج اختبارات الأداء في البرمجة أو الرياضيات اليوم.

أسئلة شائعة

ما هو الـ red teaming الآلي؟

الـ red teaming هو هجمات متعمدة على نظام بهدف اكتشاف الثغرات قبل أن يجدها المهاجمون. في GPT-Red لا يؤدي هذا الدور فريق من البشر، بل النموذج نفسه: فعبر self-play يولّد هجمات على دفاعاته الخاصة ويتعلم كيفية مقاومتها.

ما هو حقن الأوامر ولماذا هو خطير؟

حقن الأوامر (prompt injection) هو تعليمات مخفية في بيانات خارجية (رسالة، صفحة، ملف) ينفّذها النموذج خطأً كأنها أمر من المستخدم. بالنسبة لوكلاء الذكاء الاصطناعي الذين يملكون وصولًا إلى البريد والمتصفح، هذا هو ناقل الهجوم الرئيسي؛ والمناعة ضد هذا النوع من الحقن تحديدًا هي ما تسميه OpenAI أحد أهداف GPT-Red الثلاثة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…