arXiv cs.AI→ المصدر

FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода

FindStatBench — новый бенчмарк из 2 329 задач по синтезу комбинаторного кода: модель пишет Python-функцию без подсказок и инструментов. Авторы прогнали 11 систем и нашли неожиданное — несколько классических задач модели решают идеально без примеров, но проваливают, получив пять примеров в промпте. Сильнейшие открытые и закрытые модели разошлись меньше чем на 1 п.п.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

في يوليو 2026، قدّم باحثون FindStatBench، وهو معيار (benchmark) يختبر النماذج اللغوية الكبيرة في توليف الكود التوافقي (combinatorial): 2329 مهمة، و24 مجموعة، و5.52 مليون كائن اختبار مخفي. وفي هذه المجموعة، تباينت أقوى النماذج المفتوحة والمغلقة في الدقة بأقل من نقطة مئوية واحدة.

ما الذي يختبره FindStatBench

يُبنى FindStatBench على أساس مشروع FindStat الرياضي، ويتطلب من النموذج كتابة دالة بايثون واحدة باسم solve بناءً على وصف رياضي للمهمة وحد أقصى خمسة أمثلة علنية من نوع "مدخل-مخرج". لا بحث، ولا استدعاء أدوات، ولا تغذية راجعة من التنفيذ، ولا تصويت، ولا إعادة ترتيب — محاولة واحدة فقط. تُشغَّل الإجابة داخل بيئة معزولة (sandbox) على كائنات توافقية مخفية، ويجري التحقق منها عبر التنفيذ الدقيق.

اختبر المؤلفون 11 نظامًا: أربعة نماذج إنتاجية مغلقة وسبعة نماذج ذات أوزان مفتوحة، جرى تقديمها عبر مزوّد استدلال واحد.

  • 2329 مهمة موزعة على 24 مجموعة، و5.52 مليون كائن اختبار مخفي
  • نوعان: statistic synthesis (كائن ← عدد صحيح) و map synthesis (كائن ← كائن)
  • المدخل هو وصف وحد أقصى 5 أمثلة "مدخل-مخرج"
  • التقييم هو التنفيذ الدقيق لدالة بايثون داخل بيئة معزولة
  • تم اختبار 11 نظامًا: 4 مغلقة + 7 مفتوحة

لماذا تضرّ الأمثلة في الـ prompt

في جزء من المهام، تخفّض الأمثلة الموجودة في الـ prompt الدقة بدلاً من رفعها. وبحسب الدراسة، تحلّ النماذج عدة تقابلات (bijections) كلاسيكية بشكل مثالي دون أي مثال على الإطلاق، لكن النماذج نفسها تفشل في المهام ذاتها عند إعطائها خمسة أمثلة "مدخل-مخرج". وهناك جزء آخر من الإخفاقات يعود إلى آلية ميزانية المخرجات: يستنفد استدلال النموذج الإجابة الظاهرة قبل أن يصل إلى الكود نفسه. وتؤدي الـ prompts الطويلة إلى انهيار حاد في الدقة — وهو ما يسميه المؤلفون accuracy cliff.

أين تصطدم النماذج بسقف

مهمة statistic synthesis أسهل بشكل ملحوظ على النماذج من map synthesis: فربط كائن بعدد صحيح أبسط من ربط كائن بكائن آخر. تتقارب أقوى الأنظمة المفتوحة والمغلقة في حدود نقطة مئوية واحدة من حيث instance accuracy، بينما لا يقدّم دمج جميع الأنظمة في "أوراكل" (oracle) ولا أخذ خمس عينات من نموذج متوسط القوة سوى تحسّن محدود. وتبقى بعض مجموعات المهام عند الصفر.

"إن statistic synthesis أسهل بكثير بالنسبة لنا من map synthesis... ويظل الاستنتاج الدقيق للقواعد الرمزية هشًا"، بحسب ملخص

FindStatBench على arXiv.

ماذا يعني هذا

لا تزال حتى أفضل نماذج LLM ضعيفة في استنتاج قواعد رمزية دقيقة من أوصاف رياضية — ولا مزيد من الأمثلة ولا مزيد من الحوسبة يخترقان هذا الجدار. يمنح FindStatBench الصناعة اختبارًا صارمًا وقابلاً للتنفيذ يستهدف هذا النوع من الاستدلال تحديدًا، لا استرجاع حلول معروفة سلفًا.

أسئلة متكررة

ما هو FindStatBench؟

هو معيار قابل للتنفيذ مبني على مشروع FindStat: 2329 مهمة في التوليف التوافقي للكود، حيث يكتب النموذج دالة بايثون، ويجري التحقق من الإجابة عبر التنفيذ الدقيق على 5.52 مليون كائن مخفي، دون السماح بأي تلميحات أو أدوات أو محاولات إعادة.

لماذا لا تساعد الأمثلة الإضافية النماذج دائمًا؟

بحسب الدراسة، تحلّ النماذج عدة تقابلات كلاسيكية بشكل مثالي دون أي مثال، لكنها تنهار أمام prompt يحتوي على خمسة أمثلة: يؤدي السياق الأطول إلى انهيار حاد في الدقة، ويستنفد الاستدلال أحيانًا ميزانية الإجابة قبل إنتاج الكود أصلاً.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…