OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%
OpenAI утверждает: официальный harness бенчмарка ARC-AGI-3 занижал её модель. Он выбрасывал приватные рассуждения GPT-5.6 Sol после каждого хода, и та разбиралась в игре заново. Стоило включить две настройки Responses API — retained reasoning и compaction — и результат утроился: с 13,3% до 38,3%, при этом выходных токенов на игру уходит примерно в 6 раз меньше. С такой конфигурацией GPT-5.6 обошла Anthropic Opus 5 (30,2%).
معالج بواسطة الذكاء الاصطناعي من OpenAI Blog؛ بتحرير Hamidun News
أعلنت OpenAI في 30 يوليو 2026 أن تفعيل إعدادين في واجهة Responses API الخاصة بها — الاحتفاظ بالاستدلال (retained reasoning) والضغط (compaction) — أدى إلى مضاعفة نتيجة نموذج GPT-5.6 Sol ثلاث مرات على معيار ARC-AGI-3: من 13.3% إلى 38.3% على مجموعة المهام العامة. وفي الوقت نفسه، انخفض استهلاك رموز الإخراج (output tokens) لكل جولة لعب بنحو ست مرات، وبفضل الإعداد الجديد تفوق النموذج على Anthropic Opus 5.
ماذا يختبر ARC-AGI-3
ARC-AGI-3 هو معيار تفاعلي للاستدلال المجرد، حيث يعمل وكيل الذكاء الاصطناعي على حل مهام لعبة غير مألوفة خطوة بخطوة: يقوم بإجراء، يرى النتيجة، ثم يخطط للخطوة التالية. وعلى عكس الاختبارات الثابتة، تُعد الذاكرة بين الجولات أمرًا حاسمًا هنا — إذ يجب على الوكيل أن يراكم فهمًا لقواعد اللعبة مع تقدمه فيها. وهذه الذاكرة تحديدًا هي المسؤولة عن القفزة الكاملة من 13.3% إلى 38.3% التي تتحدث عنها OpenAI.
ما هما الإعدادان
الإعدادان — retained reasoning وcompaction — هما نفس الآليتين اللتين تستخدمهما OpenAI في منتجيها ChatGPT وCodex. يحافظ retained reasoning على سلسلة الاستدلال الخاصة بالنموذج بين نوافذ السياق المنفصلة. أما compaction فيقوم بتلخيص السياق المتراكم عندما يقترب من الحد الأقصى، بدلاً من حذف أقدم المحتويات بشكل آلي. كلا المعيارين متاحان عبر Responses API — واجهة OpenAI المخصصة لسيناريوهات الوكلاء.
- النموذج — GPT-5.6 Sol من OpenAI
- الإطار الرسمي لـ ARC-AGI-3: 13.3% على المجموعة العامة
- مع retained reasoning وcompaction عبر Responses API: 38.3%
- رموز الإخراج لكل جولة لعب — أقل بنحو 6 مرات
- النشر — مدونة OpenAI، 30 يوليو 2026
لماذا كانت النتيجة منخفضة
كان الإطار الرسمي لـ ARC-AGI-3 يتخلص من الاستدلال الخاص للوكيل بعد كل جولة، ما أبقى النتيجة عالقة عند 13.3%. كان GPT-5.6 Sol يرى سجل الإجراءات السابقة وملاحظات مختصرة عنها، لكن ليس التفكير الذي أنتج تلك الخطوات — وبالتالي كان في كل خطوة يعيد فهم اللعبة من الصفر عمليًا. وعندما كان سجل الخطوات يتجاوز نافذة السياق، كان الإطار يحذف أيضًا أقدم الإجراءات. وباختصار، كان النموذج يتذكر أنه "حرّك الكتلة البنفسجية"، لكنه كان ينسى لماذا فعل ذلك.
«المعايير لا تقيس النموذج وحده أبدًا — بل تقيس أيضًا البنية التقنية المحيطة به»، بحسب ما ورد في مدونة
OpenAI.
كيف قورن GPT-5.6 بـ Opus 5
مع تفعيل الإعدادين، حقق GPT-5.6 Sol نتيجة 38.3% وتفوق على Anthropic Opus 5 الذي حقق 30.2% على ARC-AGI-3. وبحسب OpenAI، لم تنشأ الفجوة بسبب النموذج نفسه، بل بسبب إعداد الاختبار: فالإطار الرسمي يفتقر إلى قدرات خاصة بمزود الخدمة مثل retained reasoning، المتاحة عبر Responses API. وقد أدت هذه التقنية نفسها إلى أثر جانبي — توفير يقارب ست مرات في رموز الإخراج لكل جولة لعب.
ماذا يعني ذلك
لا تعتمد نتيجة المعيار على النموذج فقط، بل أيضًا على كيفية إعداد الواجهة البرمجية (API) وتصميم إطار الاختبار. فنفس نموذج GPT-5.6 Sol يُظهر 13.3% أو 38.3% تبعًا للإعداد — وهذا يغيّر طريقة قراءة الجداول المقارنة التي تقيس بها مختبرات الذكاء الاصطناعي نفسها مقابل بعضها البعض.
أسئلة شائعة
ما هما retained reasoning وcompaction؟
يحافظ retained reasoning على سلسلة الاستدلال الخاصة بالنموذج بين نوافذ السياق، بينما يقوم compaction بتلخيص السياق القديم بدلاً من حذفه ببساطة. تستخدم OpenAI بالفعل كلا الإعدادين في ChatGPT وCodex.
إلى أي مدى تحسنت نتائج GPT-5.6 Sol؟
على المجموعة العامة لـ ARC-AGI-3، ارتفعت النتيجة من 13.3% إلى 38.3% — أي بنحو ثلاثة أضعاف. وفي الوقت نفسه، انخفض استهلاك رموز الإخراج لكل جولة لعب بنحو ست مرات.
هل تفوق GPT-5.6 Sol على نموذج Opus 5؟
نعم. بفضل الإعدادين، حقق GPT-5.6 Sol نتيجة 38.3% مقابل 30.2% لنموذج Anthropic Opus 5 على ARC-AGI-3، بحسب بيانات OpenAI.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.