أطلقت OpenAI نموذج GPT-5.6 الرائد في ثلاث نسخ — Luna و Terra و Sol
أطلقت OpenAI عائلة GPT-5.6 من ثلاثة نماذج — Luna و Terra و Sol — بأسعار تتراوح من 1 دولار إلى 30 دولار لكل 1 مليون رمز. في معيار Agents' Last Exam، تفوق Sol الأقدم على Claude Fable 5 بـ 13.1 نقطة، لكنه خسر أمامها على SWE-Bench Pro — 64.6% مقابل 80%. ادعت OpenAI أن ما يقرب من ثلث مهام SWE-Bench Pro غير صحيحة.
معالج بواسطة الذكاء الاصطناعي من Simon Willison؛ بتحرير Hamidun News
أطلقت OpenAI في 17 يوليو 2026 عائلة نماذجها الرائدة GPT-5.6 بتوفر عام في ثلاثة أحجام — Luna و Terra و Sol — وفقًا لمعيارها الخاص، تفوق النموذج الأول Sol على Claude Fable 5 من Anthropic بـ 13.1 نقطة في اختبار Agents' Last Exam للمهام الطويلة للوكيل.
كم تكلفة النماذج الجديدة
تم تحديد الأسعار بـ "1 مليون رمز" بشكل منفصل للإدخال والإخراج، وتختلف الأحجام الثلاثة من GPT-5.6 بشكل ملحوظ في التكلفة.
- Luna (نموذج junior) — $1 لكل 1M رمز إدخال / $6 لكل 1M رمز إخراج
- Terra (نموذج متوسط) — $2.50 لكل 1M رمز إدخال / $15 لكل 1M رمز إخراج
- Sol (نموذج أول) — $5 لكل 1M رمز إدخال / $30 لكل 1M رمز إخراج
- للمقارنة: تكلفة خط Claude Opus $5/$25 لكل 1M رمز، و Claude Fable 5 — $10/$50
- جميع نماذج GPT-5.6 الثلاثة لديها تاريخ قطع المعرفة 16 فبراير 2026، نافذة سياق من 1 مليون رمز، وحد إخراج 128000 رمز
كم يتفوق GPT-5.6 على المنافسين
تعتمد OpenAI على معيار Agents' Last Exam — اختبار لسير العمل طويل الأجل للوكيل عبر 55 مجال احترافي. وفقًا للشركة، حقق GPT-5.6 Sol 53.6 نقطة في هذا الاختبار — حد أقصى جديد، متفوقًا على Claude Fable 5 (في وضع التفكير التكيفي) بـ 13.1 نقطة. حتى في وضع التفكير المتوسط، يتصدر Sol Fable 5 بـ 11.4 نقطة بتكلفة أقل تقريبًا بأربع مرات. نماذج junior و Terra و Luna، وفقًا لـ OpenAI، تتفوق على Fable 5 بنفقات أقل تقريبًا بـ 16 مرة.
ومع ذلك، على معيار شهير آخر — SWE-Bench Pro، اختبار حل مشاكل الهندسة الحقيقية — حقق Claude Fable 5 80%، بينما حقق GPT-5.6 Sol فقط 64.6%. ربما لهذا السبب، في أيام الإطلاق، نشرت OpenAI مقالة منفصلة تؤكد أن حوالي 30% من المهام في SWE-bench Pro غير صحيحة (مكسورة)، وحثت مطوري النماذج الآخرين على التحقق من النتائج بعناية أكثر على هذا المعيار.
ماذا تقول الاختبارات الأولى
يصف مؤلف مدونة حصل على وصول مبكر إلى GPT-5.6 Sol النموذج بأنه "بكل تأكيد قادر جدًا"، لكنه يلاحظ أن في مهام كتابة الأكواد المعقدة التي يعمل بها، النموذج لم يبدو له أفضل من Claude Fable 5 من Anthropic. وفقًا له، تحتوي أكثر التفاصيل إثارة للاهتمام على دليل OpenAI الرسمي لاستخدام GPT-5.6 — فهو يصف عددًا من قدرات API الجديدة التي لا يزال يتعين على مطوري أدوات الجهات الخارجية استكشافها.
ما معنى هذا
يستمر إطلاق GPT-5.6 في ثلاث نسخ في السباق بين OpenAI و Anthropic من أجل القيادة في مهام الوكيل — تلك التي ينفذ فيها النموذج بشكل مستقل سلاسل طويلة من الإجراءات بدلاً من مجرد الإجابة على طلب واحد. في الوقت نفسه، توفر المقارنة عبر معايير مختلفة صورة مختلطة: تفوز OpenAI على اختبار سير العمل الخاص به، لكنها تخسر على SWE-Bench Pro — على الرغم من أن OpenAI نفسها طعنت بعلانية في جودة ثلث مهام هذا المعيار. بالنسبة للمطورين، هذه إشارة: يجب التحقق من اختيار النموذج على مهامك الخاصة، وليس الاعتماد على تقييم متوسط واحد.
الأسئلة الشائعة
كم تكلفة GPT-5.6 Sol؟
يكلف نموذج GPT-5.6 Sol الأول $5 لكل 1 مليون رمز إدخال و $30 لكل 1 مليون رمز إخراج — أغلى من Luna ($1/$6) و Terra ($2.50/$15)، لكن أرخص من Claude Fable 5 ($10/$50).
كيف يختلف GPT-5.6 عن Claude Fable 5 في الإمكانيات؟
على معيار Agents' Last Exam، يتصدر GPT-5.6 Sol Fable 5 بـ 13.1 نقطة (53.6 مقابل درجة Fable 5)، لكن على SWE-Bench Pro يسجل Fable 5 80% مقابل 64.6% لـ Sol — مما يعني أن التفوق يعتمد على نوع المهمة.
ما هو السياق والحدود لنماذج GPT-5.6؟
جميع النماذج الثلاثة — Luna و Terra و Sol — لديها نافذة سياق من 1 مليون رمز، حد إخراج 128000 رمز، وتاريخ قطع معرفة من 16 فبراير 2026.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.