Wired→ المصدر

Джейлбрейк ИИ: новый инструмент обходит защиту моделей Google, OpenAI, Anthropic и xAI

Wired протестировал новый инструмент для джейлбрейка на флагманских моделях Google, OpenAI, Anthropic и xAI. Итог: защиту части передовых моделей обойти тревожно легко, а устойчивость к взлому у разных компаний ощутимо различается — одни держат оборону лучше, другие заметно слабее.

معالج بواسطة الذكاء الاصطناعي من Wired؛ بتحرير Hamidun News
Джейлбрейк ИИ: новый инструмент обходит защиту моделей Google, OpenAI, Anthropic и xAI
المصدر: Wired. كولاج: Hamidun News.
◐ استمع للمقال

اختبرت مجلة Wired أداة جديدة للجيلبريك — أي تجاوز القيود الأمنية المدمجة — على نماذج أربع من أكبر شركات الذكاء الاصطناعي: Google وOpenAI وAnthropic وxAI. واستنتاج المراسل واضح ومباشر: تبيّن أن حماية بعض النماذج المتقدمة (frontier) يمكن إزالتها بسهولة مثيرة للقلق.

ماذا أظهرت تجربة Wired

راقب مراسل Wired أداة جديدة وهي تحاول، واحدة تلو الأخرى، تجاوز آليات الحماية في نماذج أربع شركات رائدة (frontier). وهذه الشركات هي مطورو Gemini (من Google) وGPT (من OpenAI) وClaude (من Anthropic) وGrok (من xAI) — أي عملياً الصف الأول بأكمله في هذه الصناعة. وبحسب ملاحظات المجلة، تصرفت النماذج بشكل مختلف: بعضها صمد بشكل أفضل، وبعضها الآخر كان أضعف بوضوح، وهذا التفاوت تحديداً هو ما وصفه الكاتب بأنه غير متوقع.

أبرز حقائق المادة الصحفية:

  • تم اختبار الأداة على نماذج أربع شركات: Google وOpenAI وAnthropic وxAI
  • استُهدفت آليات الحماية (safeguards) الخاصة بالنماذج الرائدة — Gemini وGPT وClaude وGrok
  • الاستنتاج الرئيسي لمجلة Wired: يمكن تجاوز حماية بعض النماذج المتقدمة بسهولة مثيرة للقلق
  • تتفاوت مقاومة الاختراق بشكل ملحوظ من شركة إلى أخرى
«راقبتُ أداة جديدة وهي تحاول تجاوز آليات الحماية لدى أربع شركات رائدة كبرى. قد يفاجئك أداء كل منها»، جاء في تقرير

Wired.

ما هو جيلبريك النماذج

الجيلبريك هو أسلوب يجبر النموذج اللغوي على إنتاج ما لا يُفترض أن ينتجه وفق قواعده الخاصة: تعليمات لصنع الأسلحة، أو أكواد ضارة، أو معلومات مضللة، أو أي محتوى محظور آخر. من الناحية الرسمية، يملك النموذج مرشحات وقواعد، لكن طلباً مُصاغاً بعناية خاصة يتجاوزها.

تشمل الأساليب الكلاسيكية سيناريوهات تقمص الأدوار («تخيّل أنك الشرير في فيلم»)، أو تمويه الطلب كمهمة تعليمية، أو التصعيد التدريجي من المحتوى البريء إلى المحظور، أو استبدال السياق. وتقوم الأدوات الجديدة بأتمتة عملية المحاولة والخطأ هذه: فبدلاً من صياغة العبارات يدوياً، تُمرِّر عبر النموذج مئات الصيغ إلى أن تنجح إحداها. وتستثمر جميع الشركات الأربع المشمولة بالاختبار علناً في اختبارات "الفريق الأحمر" (red-teaming) — وهي اختبارات تصادمية للنماذج قبل الإطلاق — لكن الجيلبريك يبقى أحد أهم أصناف الهجمات على النماذج اللغوية الكبيرة.

لماذا هذا خطير

يكمن الخطر في أن نجاح الجيلبريك يحوّل مساعداً مفيداً إلى مصدر ضرر حقيقي. فما دام النموذج يكتفي بالرد داخل محادثة، يبقى ثمن الخطأ محدوداً؛ لكن النماذج الرائدة تحصل بشكل متزايد على صلاحية الوصول إلى الأدوات والمتصفح وتنفيذ إجراءات نيابة عن المستخدم — وعندها تؤدي إزالة الحماية إلى تضخيم العواقب. وخلافاً للثغرات البرمجية المعتادة، لا يمكن إغلاق الجيلبريك بترقيع واحد: فالنموذج ليس سطراً برمجياً بل سلوكاً مُتعلَّماً، وسدّ ثغرة واحدة غالباً ما يفتح ثغرة أخرى.

يمثل التفاوت في النتائج بين الشركات الأربع إشارة قائمة بذاتها. فهو يعني أن «أمان النموذج الرائد» ليس معياراً موحداً للصناعة، بل خاصية متعلقة بكل منتج على حدة: فبعضها يملك حواجز أعلى، بينما تنجح الأداة نفسها في إسقاط حواجز أخرى. وبالنسبة لأي شركة تدمج هذه النماذج في خدماتها، فإن هذا يمثل الفارق بين خطر مُدار وآخر غير مُدار.

ما الذي يعنيه هذا

يمثل اختبار Wired تذكيراً إضافياً بأن آليات الحماية في أفضل النماذج ليست مطلقة، وأن موثوقيتها تتفاوت بشكل ملحوظ من شركة إلى أخرى. ومع حصول مساعدات الذكاء الاصطناعي على صلاحيات واستقلالية أكبر باستمرار، فإن مقاومة الجيلبريك لن تبقى موضوعاً نظرياً للباحثين، بل ستصبح معياراً عملياً في اختيار النموذج.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…