وكلاء على GPT-4o-mini و GPT-5.2 ينتهكون بصمت القواعد في اختبارات τ²-bench
درس العلماء وكلاء الذكاء الاصطناعي باستخدام الأدوات على معيار τ²-bench في مجال النقل الجوي. بالنسبة لوكيل "الميزانية"، كانت 78% من جميع الفشل انتهاكات سياسية صامتة — بدون خطأ أداة واحد. رفعت مجموعة من أربع فحوصات حتمية قبل الإجراء الأداء من 29.6% إلى 42.0% على gpt-4o-mini. تم العثور على تأثير مماثل على gpt-5.2 الرائد.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
درس الباحثون وكلاء الذكاء الاصطناعي المستندة إلى نماذج اللغة الكبيرة التي تستخدم الأدوات (وكلاء LLM التي تستخدم الأدوات) واكتشفوا أن مثل هذه الوكلاء يمكنها أن تنتهك بصمت نفس السياسات التي من المفروض أن تتبعها—بينما تبدو المهمة مكتملة بنجاح. تم نشر العمل على arXiv في 7 يوليو 2026.
ما هو انتهاك السياسة الصامت
في البيئات التي يمكن فيها لأداة تنفيذ أي استدعاء منسق بشكل صحيح رغم قواعد المجال (بيئات السياسة المسموحة)، ينشأ "حالة صامتة غير صحيحة": حجز ملغى، عدد مسافرين متغير، مطالبة معالجة بدون تحقق. لا الأداة نفسها ولا تقرير الوكيل عن إجراءاته يشير إلى خطأ.
اختبر الفريق هذا السيناريو على معيار τ²-bench في مجال الخطوط الجوية. بالنسبة لوكيل "ميزانية"، تبين أن 78% من جميع الإخفاقات المسجلة كانت بالفعل انتهاكات سياسة صامتة بدون خطأ أداة واحد، وتتكرر تكرار الإخفاق التراكمي على مجموعات بذور مستقلة بدلاً من أن يكون ضوضاء العينة.
كم تساعد البوابات الحتمية
اقترح المؤلفون تدخلاً خفيفاً—بوابات حتمية وللقراءة فقط (gates) التي تفحص الاستدعاء المقترح والحالة الحالية للنظام قبل السماح بالكتابة.
- رفعت مجموعة من أربع بوابات النجاح على المعيار الكامل من 29.6% إلى 42.0% على نموذج gpt-4o-mini (+12.4 نقطة مئوية; P=0.0012)
- تم تكرار التأثير على مجموعة مستقلة من 15 بذرة (+12.3 p.p.; P=0.0008)
- في 26 من 50 مهمة حيث عملت البوابات بالفعل، زاد النجاح بمقدار +19.2 p.p.
- على نموذج gpt-5.2 الرائد مع إعدادات التفكير الافتراضية، رفعت نفس مجموعة البوابات الأربع النجاح من 61.2% إلى 71.6% (+10.4 p.p.; P=0.020، لكن على عينة من 5 عمليات تنفيذ فقط وبدون تكرار التجربة)
أظهرت عنصرا التحكم السلبي—نطاق البيع بالتجزئة الاكتفاء الذاتي حيث تراقب الأدوات السياسة بنفسها، ومعيار BFCL—حدود الطريقة: تساعد البوابات حيث تسمح الأدوات بانتهاك السياسة، وتوفر تأثيراً شبه معدوم حيث تتوافق الأدوات بشكل مستقل.
ماذا يعني هذا
حتى نماذج rأي gpt-5.2 تستمر في محاولة تنفيذ عمليات الكتابة التي تنتهك السياسة—لا تختفي المشكلة مع زيادة جودة النموذج. يؤكد المؤلفون أن البوابات الحتمية لا تضمن نجاح المهمة بالكامل، لكنها تحظر بشكل موثوق فئة محددة من الانتهاكات الصامتة على حدود الإجراء—بالضبط حيث يكون الوكيل على وشك إجراء تغيير حقيقي في النظام.
الأسئلة المتكررة
ما هو τ²-bench؟
إنه معيار لاختبار وكلاء الذكاء الاصطناعي مع الأدوات في مجال الخطوط الجوية، حيث حدد الباحثون وقياس انتهاكات السياسة الصامتة.
كيف تعمل البوابات الحتمية؟
هذه عبارة عن فحوصات للقراءة فقط تفحص الاستدعاء الأداة المقترح والحالة الحالية للنظام قبل تنفيذ الكتابة وتحظر الاستدعاءات التي تنتهك قواعد المجال.
هل تعمل الطريقة على النماذج الرائدة؟
نعم: على gpt-5.2 مع التفكير الافتراضي، رفعت نفس مجموعة البوابات الأربع النجاح من 61.2% إلى 71.6%، على الرغم من أن المؤلفين يلاحظون أن هذه النتيجة تم الحصول عليها على عينة صغيرة من 5 عمليات تنفيذ ولم تتم نسختها بعد.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.