هندسة الأنظمة: نقل ضمانات وكلاء نموذج اللغة من الرموز إلى الكود
يصف ما قبل الطباعة arXiv من يوليو 2026 هندسة الأنظمة — نمط لتحويل نماذج اللغة الأولية إلى وكلاء مؤسسيين قابلين للتدقيق. اختبر المؤلفون البنية على بيانات من خمسة تكتلات كورية (25 شركة): مرّت الضمانات على مستوى الكود 270 من 270 طلب عبر تغييرات النموذج، بينما قدمت الضمانات الخارجية 88/120 أداة مقابل 120/120 مع نهج الأنظمة.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
نشر الباحثون مسودة أولية على arXiv في 10 يوليو 2026 مع نمط harness-engineering لوكلاء LLM الخاص بالمؤسسات: يتم نقل الضمانات الحتمية من prompts إلى الكود وعناصر التحقق، مما يسمح بناء الأنظمة القابلة للتدقيق دون فقدان جودة الإجابة.
ما الخطأ في نهج Prompting فقط
تبدأ تطبيقات LLM للمؤسسات عادة كنماذج أولية حيث يتم تحديد السلوك بالكامل من خلال prompts وسياق RAG. عند الانتقال إلى الإنتاج، تظهر متطلبات جديدة: حدود المصدر، توجيه الكيانات، عقود الإجابة، والتتبع القابل للتكرار. يتعامل الـ prompts مع هذه بشكل غير موثوق.
أجرى المؤلفون تجربة تحكم: مع الحفاظ على النموذج دون تغيير واستبدال مستوى الإنفاذ فقط، سمحت prompts بوصول الانتهاكات إلى المستخدمين — لم يتم حظر لغة التوصيات غير الصحيحة وتسرب الآثار الداخلية. ألغى Harness كلا المشكلتين تماماً دون تقليل فائدة النظام.
كيفية عمل نمط Harness
الفكرة الأساسية هي نقل السلوك الحتمي من prompts إلى الكود والبيانات الوصفية والمخططات وعناصر التحقق حول "composition boundary" قابل للاستبدال. تبقى تأكيدات المصدر هي السلطة لإجابات وقت التشغيل، يتم التحقق من جميع العقود بواسطة الكود وليس تعليمات الـ prompt. تسمح هذه المعمارية باستبدال النموذج دون إعادة بناء النظام بأكمله.
تم اختبار النمط على شريحة بيانات عامة من خمس مجموعات تجارية كورية (25 شركة مدرجة). النتائج الرئيسية:
- 5 تجمعات كورية، 25 شركة مدرجة — مجموعة بيانات الاختبار
- 3 نماذج مستضافة متورطة في تجربة استبدال النموذج
- 270/270 طلب اجتاز التحقق من العقد عند تغيير النماذج
- 120/120 — فائدة الإجابة مع نهج harness
- 88/120 — فائدة الإجابة مع guardrail خارجي bolt-on بنفس مستوى الأمان
أكدت اختبارات حقن الأعطال على عمل المدققين: في جميع السيناريوهات، حددوا بشكل صحيح العقود المكسورة عن قصد.
كيف يكون Harness أفضل من Guardrails الخارجية
يمنع Guardrail الخارجي bolt-on الانتهاكات بفعالية مثل harness — لكن بتكلفة الرفضات المفرطة. عند استخدام guardrail خارجي فقط، أنتج النظام 88 إجابة مفيدة من 120، بينما حافظ harness على 120/120.
"فقط إنفاذ الملكية للكود يوفر في نفس الوقت الأمان والحفاظ على الفائدة
الكاملة"، يخلص المؤلفون.
الفرق الأساسي: يتم بناء harness في المعمارية ويفهم سياق الطلب، لذا لا يرفض الإجابات المشروعة. يرى Guardrail الخارجي فقط الإخراج النهائي ويجب أن يكون حذراً بشكل مفرط، مما يؤدي إلى فقدان 27% من الإجابات المفيدة.
ما يعنيه هذا
يوفر harness-engineering نمطاً قابلاً لإعادة الاستخدام للانتقال من نموذج LLM أولي إلى نظام إنتاج قابل للتدقيق. لا تضمن prompts الامتثال للعقود في البيئات المؤسسية — تحتاج إلى عناصر تحكم مصدرة في الكود. بالنسبة للفرق التي تبني وكلاء LLM للمؤسسات، هذا دليل عملي: يجب أن توجد ضمانات السلوك في الكود وليس في التعليمات.
أسئلة يتكرر طرحها
على أي بيانات تم اختبار Harness؟
استخدم المؤلفون شريحة بيانات عامة من خمس مجموعات تجارية كورية كبيرة بها 25 شركة مدرجة. غطت الاختبارات 270 طلب عبر composition boundary باستخدام ثلاثة نماذج مستضافة مختلفة.
كيف يختلف Harness عن Guardrail الخارجي Bolt-On؟
يحقق Guardrail الخارجي bolt-on نفس مستوى الأمان ولكنه يولد رفضات مفرطة: 88 إجابة مفيدة من 120 مقابل 120/120 لـ harness. يتم بناء Harness في المعمارية ويفهم سياق الطلب، لذا لا يضحي بالجودة لأجل الأمان.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.