CRA-Bench и CRA-Net: как ловить вред, который копится по ходу диалога с LLM
Исследователи выложили на arXiv фреймворк CRA — систему защиты LLM, которая отслеживает риск на протяжении всего диалога, а не в отдельном сообщении. Идея: вредная цель может собираться постепенно из безобидных ходов. Вместе с работой открыт бенчмарк CRA-Bench — 1200 сессий по 8 ходов в трёх семействах угроз, плюс расширенный набор на 2000 сессий.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.CL؛ بتحرير Hamidun News
CRA-Bench وCRA-Net: كيف نرصد الضرر المتراكم على مدار محادثة مع نموذج
لغوي كبير (LLM)
في يوليو 2026، نشر فريق من الباحثين على arXiv ورقة بعنوان «Stateful Guardrails for Multi-Turn LLM Systems» — إطار عمل يُدعى CRA يتتبّع تراكم المخاطر على امتداد المحادثة كاملة مع نموذج اللغة، بدلاً من رسالة واحدة منفردة، وأطلق معيار CRA-Bench المكوّن من 1200 جلسة موسومة.
لماذا تفوّت أنظمة الحماية العادية الضرر
تُقيّم معظم أنظمة أمان LLM كل زوج «طلب-استجابة» بمعزل عن غيره — فلا تلاحظ الهجمات التي تُبنى تدريجياً، جولة بعد جولة. يسمّي المؤلفون هذا Conversational Risk Accumulation (CRA)، ويحددون ثلاثة أشكال لتراكم المخاطر: انجراف المحادثة تدريجياً بعيداً عن موضوع بريء، وتجميع تعليمة محظورة قطعة تلو أخرى من رسائل منفصلة، وتراكم بيانات حساسة عبر إفصاحات متكررة.
«جولات بريئة كلٌّ على حدة تتراكم لتشكّل ضرراً» — هكذا يصوغ المؤلفون
جوهر المشكلة في ملخص arXiv.
ما الذي يرصده CRA Framework
يعمل CRA Framework على مستوى الجلسة، ويراقب ثلاث إشارات لمسار المحادثة. الأولى هي الانجراف الدلالي عن «مرساة» الجلسة: إلى أي مدى ابتعدت المحادثة عن موضوعها الأصلي. الثانية هي رسم بياني لتراكم المعلومات حول الكيانات المستخرجة، مرجّحاً بحساسيتها. الثالثة هي «تدرّج الامتثال»: إشارة إلى استعداد النموذج المتزايد لتنفيذ طلبات تزداد خطورة.
أبرز حقائق العمل:
- المصطلح — Conversational Risk Accumulation (CRA): انجراف النية، تجميع تعليمات محظورة على أجزاء، تراكم الحساسية
- ثلاث إشارات — الانجراف الدلالي، رسم تراكم المعلومات، تدرّج الامتثال
- طريقتا تقييم — unsupervised convex fusion ونموذج قابل للتدريب هو CRA-Net DA بأهداف family-adversarial
- CRA-Bench v0.1 — 1200 جلسة من 8 جولات، ثلاث عائلات تهديد لكل منها «توأم حميد» بنفس الموضوع
- مجموعة موسّعة — 2000 جلسة، خمس عائلات (مع إضافة persona priming وcontext stuffing)
للتقييم، يقترح المؤلفون نهجين: unsupervised convex fusion — دمج خطي للإشارات دون تدريب، مناسب لتحليل مساهمة كل إشارة — وCRA-Net DA، نموذج مسار مدمج وقابل للتدريب، دُرّب بأهداف family-adversarial، حتى لا يحلّ طول المحادثة وتنوّع مواضيعها محل إشارة التهديد الحقيقي.
كيف قِيست الفعالية
أصدر المؤلفون دفعة واحدة ثلاث نسخ من المعيار. تحتوي CRA-Bench v0.1 على 1200 جلسة من ثماني جولات موزعة على ثلاث عائلات تهديد، ولكل جلسة ضارة «توأم» حميد بنفس الموضوع. أما CRA-Bench v0.2 فهي السيناريوهات نفسها لكن معاد صياغتها بواسطة نموذج لغوي آخر لإزالة الأنماط القالبية. وترفع المجموعة الموسّعة الحجم إلى 2000 جلسة وخمس عائلات.
للتقييم، اقتُرح بروتوكول «مساري» مع تقسيم على مستوى الجلسات: Trajectory AUROC، ومقياس turns-to-detection (عدد الجولات التي يستغرقها النظام لرصد الهجوم)، ومعدّلات إيجابيات كاذبة معايَرة، وفترات ثقة bootstrap، واختبار إجهاد leave-one-family-out — حيث تُستبعد عائلة تهديد كاملة من التدريب لاختبار قدرة التعميم.
ما الذي يعنيه هذا
ينتقل أمان LLM من فحص الرسائل المنفردة إلى تحليل مسار المحادثة بأكمله. الهجمات متعددة الجولات، حيث يُجمَّع الضرر من أجزاء تبدو بريئة، تتحوّل إلى فئة تهديد مستقلة وقابلة للقياس — بمعيار يضم أكثر من 2000 جلسة ومقاييس يمكن من خلالها رصدها.
أسئلة شائعة
ما هو Conversational Risk Accumulation؟
هو تراكم المخاطر خلال محادثة مع LLM، حيث تتراكم رسائل بريئة كلٌّ على حدة تدريجياً لتشكّل ضرراً: تنجرف النية، وتُجمَّع تعليمة محظورة على أجزاء، وتتراكم بيانات حساسة عبر إفصاحات متكررة.
ما الذي يتضمّنه معيار CRA-Bench؟
CRA-Bench v0.1 هو 1200 جلسة من ثماني جولات موزعة على ثلاث عائلات تهديد، مع «توائم» حميدة مطابقة في الموضوع. تضيف النسخة v0.2 صيغاً معاد صياغتها بنموذج آخر، بينما تضيف المجموعة الموسّعة 2000 جلسة وخمس عائلات تهديد.
بمَ يختلف CRA-Net عن مرشّح بسيط؟
CRA-Net DA نموذج مدمج وقابل للتدريب يحلّل مسار الجلسة بأكمله وليس رسالة منفردة، وقد دُرّب بأهداف family-adversarial حتى لا يخلط بين طول المحادثة واتساع مواضيعها وبين التهديد الحقيقي.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.