Habr AI→ المصدر

وكلاء LLM و SOC: بناء قاعدة بيانات التهديدات السيبرانية باستخدام RAG

شارك المطورون على Habr معمارية قاعدة بيانات التهديدات السيبرانية لوكلاء LLM وأنظمة SOC. مصادر البيانات — مستندات PDF وسجلات CVE ومقالات الأمن السيبراني — تمر عبر خط أنابيب التحميل واستخراج النص والتقسيم وبناء التمثيل المتجه والبحث، مع حصول الوكيل على أجزاء جاهزة عبر HTTP API. تم بناء النموذج الأولي العامل بسرعة، لكن وفقاً للمؤلفين، بدأ العمل الحقيقي فقط بعد إطلاقه.

معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
وكلاء LLM و SOC: بناء قاعدة بيانات التهديدات السيبرانية باستخدام RAG
المصدر: Habr AI. كولاج: Hamidun News.
◐ استمع للمقال

شارك المطورون على Habr كيفية بناء قاعدة بيانات تهديدات أمان سيبراني خاصة بهم لوكلاء LLM وأنظمة SOC: تجمع الخدمة مستندات PDF وسجلات CVE ومقالات الأمن السيبراني في قاعدة بيانات واحدة وتوفر أجزاء ذات صلة لوكيل ذكاء اصطناعي عبر HTTP API.

كيفية بناء قاعدة بيانات خط الأنابيب

في البداية، بدت المهمة خطية وتناسبت سلسلة من الخطوات. يتم تحميل المصادر أولاً — ملفات PDF ووصف ثغرات CVE ومقالات أمان المعلومات — إلى النظام، ثم يتم استخراج النص منها.

  • مصادر البيانات — مستندات PDF وسجلات CVE ومقالات الأمن السيبراني
  • يتم تقسيم النص إلى أجزاء (chunking) للفهرسة اللاحقة
  • يتم بناء التمثيلات المتجهة (embeddings) من الأجزاء للبحث الدلالي
  • تعيد قاعدة البيانات المكتملة النتائج إلى وكيل LLM عبر HTTP API
  • جمع المؤلفون نموذجاً أولياً يعمل بسرعة — بدأ العمل الحقيقي بعد إطلاقه

بعد استخراج النص، يقسم النظام المستندات إلى أجزاء ويبني التمثيلات المتجهة منها ويحول كل شيء إلى فهرس بحث يحصل منه وكيل LLM أو محلل SOC على السياق لتهديد محدد.

لماذا النموذج الأولي مجرد البداية

وفقاً للمؤلفين، ظهر نموذج أولي يعمل بسرعة وبدأ العمل الحقيقي بعد ذلك. هذا وضع نموذجي لقواعس البيانات المعرفية القائمة على RAG (retrieval-augmented generation) في المجالات المتخصصة الضيقة مثل الأمن السيبراني: يمكن تجميع سلسلة أساسية من التحميل واستخراج النص والتقسيم والمتجهات والبحث في وقت قصير، لكن تحويلها إلى مصدر يثق به وكيل LLM ومحلل SOC فعلياً — مهمة من حجم مختلف تماماً.

تعقيد إضافي في مثل هذا المجال هو عدم تجانس الصيغ: تقارير التهديدات PDF والسجلات المهيكلة CVE والمقالات الأمنية العادية يتم بناؤها بطرق مختلفة وتتطلب نهج مختلفة لاستخراج النص والتقسيم قبل أن يتم جمعها في فهرس بحث موحد.

لماذا هذا مطلوب لوكلاء LLM و SOC

الفكرة هي إعطاء وكيل LLM ليس المعرفة العامة من مجموعة بيانات التدريب، بل أجزاء حالية وقابلة للتحقق من تقارير PDF وسجلات CVE ومقالات الأمان عبر HTTP API. بالنسبة لمحلل SOC (مركز عمليات الأمان)، يعني هذا أن استجابة النموذج لتهديد محدد تستند إلى مصدر حقيقي وليس فقط ما "يتذكره" النموذج من التدريب المسبق — نهج يُعرّف عادة باسم retrieval-augmented generation أو RAG.

هذا هو السبب في أن المؤلفين يصفون المسار ليس كتطوير واحد بل كعملية مستمرة: يجب تحديث قاعدة بيانات تهديدات الأمن السيبراني بشكل مستمر مع CVE والمقالات الجديدة، مما يعني أن خط أنابيب التحميل والتقسيم والبحث يحتاج إلى الحفاظ عليه وتحسينه حتى بعد أن تبدأ النسخة الأولى في الإجابة على الاستعلامات.

المخطط المكون من خمس خطوات — التحميل واستخراج النص والتقسيم وبناء المتجهات والبحث — نموذجي لأنظمة RAG الحديثة وينطبق على منطق خطي مفهوم يسهل وصفه على لوحة بيضاء. هذا بالضبط نسخة بسيطة من خط الأنابيب الذي جمعه المؤلفون أولاً قبل الانتقال إلى مرحلة التحسين الأكثر تفصيلاً.

ما يعنيه هذا

توضح الحالة مسار نموذجي لبناء أنظمة RAG للمجالات المهنية الضيقة: يمكن تجميع خط أنابيب عمل للتحميل والتقسيم والبحث المتجه بسرعة، لكن تحويله إلى أداة يثق بها وكلاء LLM ومحللو SOC فعلياً — مهمة تبدأ حقاً فقط بعد النموذج الأولي الأول.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…