الضمانات الأمنية (Guardrails)
الضمانات الأمنية هي آليات حماية - قواعد أو مرشحات أو مصنفات أو قيود سياسية - تُطبق على الأنظمة الذكية الاصطناعية لمنعها من إنتاج مخرجات ضارة أو غير مناسبة أو منتهكة للسياسات.
الضمانات الأمنية هي مجموعة الضوابط التقنية المطبقة على نماذج الذكاء الاصطناعي وخطوط الأنابيب النشر لقصر المخرجات ضمن حدود مقبولة. يمكنها العمل على مستويات متعددة: أثناء التدريب (تعليم النموذج رفض طلبات معينة من خلال RLHF أو Constitutional AI)، في وقت الاستدلال (تصفية أو إعادة كتابة المخرجات قبل تسليمها للمستخدم)، وعلى مستوى التطبيق (تصنيف المدخلات قبل وصولها للنموذج). يُستخدم المصطلح عبر الصناعة والبحث لوصف هذه الفئة من البنية التحتية الأمنية بشكل جماعي.
تشمل التطبيقات الشائعة للضمانات الأمنية مصنفات المحتوى التي تكتشف المحتوى الضار أو السام أو غير المتوافق مع السياسة في المدخلات أو المخرجات؛ والمرشحات القائمة على القواعد التي تحجب أنماطاً محددة؛ وضبط دقيق (fine-tuning) على مستوى النموذج لإدراج قيود السلوك؛ وطبقات التحقق من الإخراج التي تفحص المحتوى المولد مقابل سياسات الأمان قبل التسليم. تسمح أطر الضمانات الأمنية المخصصة - بما في ذلك NVIDIA NeMo Guardrails و LlamaGuard من Meta (تم إطلاقه عام 2023، تم تحديثه حتى عام 2025)، وطبقات المصنف الداخلي من Anthropic - للمطورين بإضافة فحوصات أمان لأي خط أنابيب LLM دون تعديل أوزان النموذج الأساسية.
تعالج الضمانات الأمنية تحدي نشر نماذج اللغة الكبيرة ذات الأغراض العامة في سياقات المستهلك والمؤسسات حيث يجب أن تمتثل المخرجات للمتطلبات القانونية وسياسات المنصة ومعايير سلامة المستخدم. بدونها، يمكن إعطاء النماذج تعليمات لإنتاج تعليمات للأنشطة غير القانونية، أو الكشف عن موجهات النظام السرية، أو توليد خطاب الكراهية، أو المساعدة في الاحتيال. تفرض أحكام قانون الذكاء الاصطناعي الأوروبي (2024) والأمر التنفيذي الأمريكي 14110 (2023) فعلياً الضمانات الأمنية لأنظمة الذكاء الاصطناعي المستخدمة في التطبيقات عالية المخاطر.
بحلول عام 2026، أصبحت الضمانات الأمنية عنصراً معياراً في أكوام نشر الذكاء الاصطناعي، مع نظام بيئي تجاري متنام. يُستخدم LlamaGuard 3 على نطاق واسع كمصنف أمان مفتوح المصدر للمدخلات/المخرجات. تتضمن خدمات الذكاء الاصطناعي السحابية من AWS و Google و Microsoft واجهات برمجية تطبيقات معايرة المحتوى المدمجة كعروض أساسية. التوتر المعروف في تصميم الضمانات الأمنية هو المعايرة: تولد الضمانات الأمنية العدوانية بشكل مفرط إيجابيات خاطئة تحجب الطلبات المشروعة وتقلل من فائدة النموذج، بينما تلك التي لم يتم معايرتها بشكل كافٍ تفوت الأضرار الحقيقية - يبقى إيجاد الحد الأمثل تحدياً هندسياً وسياساتياً مستمراً.