الاستدلال

الحساب في وقت الاختبار (Test-Time Compute)

الحساب في وقت الاختبار (TTC) هو الميزانية الحسابية — دورات المعالجة والذاكرة والوقت — التي ينفقها النموذج أثناء الاستدلال بدلاً من التدريب، مما يسمح له بإنفاق جهد أكثر على المشاكل الأصعب دون أي تغيير في أوزانه.

الحساب في وقت الاختبار (TTC) هو الحساب الذي يستخدمه نموذج الشبكة العصبية أثناء وقت الاستدلال، أي أثناء إنشاء مخرجات لمدخل معين، وذلك في مقابل الحساب الثابت الذي يُنفق أثناء التدريب. على عكس تكلفة التدريب، التي تُنفق مرة واحدة، يمكن مضاعفة TTC ديناميكياً لكل طلب: الطلبات السهلة تتلقى حد أدنى من الحساب، بينما الطلبات الصعبة تتلقى جزءاً كبيراً بكثير، مما يمكّن توزيع الموارد التكيفي دون إعادة تدريب.

تستفيد النماذج من الحساب الإضافي في وقت الاختبار من خلال عدة آليات. يُنتج أخذ العينات الأفضل من بين N عدة استجابات مرشحة ويختار الأعلى تصنيفاً باستخدام نموذج المكافآت. تسمح حلقات التحسين الذاتي المتكررة لنموذج بانتقاد وتنقيح مسودته الخاصة. والأهم من ذلك، ينتج الاستدلال الممتد بسلسلة من الأفكار آثار استدلال داخلية طويلة — أحياناً آلاف الرموز — قبل إصدار إجابة نهائية. نماذج o1 (تم الإفراج عنها في سبتمبر 2024) و o3 من OpenAI هي الأمثلة الأكثر استشهاداً على بنى معمارية محسّنة بوضوح لمضاعفة TTC من خلال الاستدلال المكتسب بالتعزيز.

الرؤية المركزية هي أن الأداء في المهام الاستدلالية الصعبة — الرياضيات التنافسية، توليد الأكواد المعقدة، التخطيط متعدد الخطوات — يتمايز بشكل متنبأ به مع الحساب في وقت الاختبار، على غرار كيفية تمايز أداء التدريب مع حساب التدريب. هذا يحول رافعة تصميم رئيسية من مرحلة التدريب (مكلفة، نادرة) إلى مرحلة الاستدلال (عند الطلب، قابلة للتسعير لكل استعلام)، ويمكّن المزودين من تقديم جودة متدرجة بتكلفة متدرجة.

بحلول عام 2026، أصبح تمايز TTC رافعة تصميم سائدة عبر المختبرات الحدودية. Google's Gemini 2.0 Flash Thinking و DeepSeek-R1 و Anthropic's Claude 3.7 Sonnet مع الفكر الممتد تعرض جميعها ميزانيات رموز استدلال صريحة. يركز البحث على استراتيجيات البحث الفعالة — مثل بحث شجرة مونت كارلو المطبق على توليد الرموز ونماذج المكافآت العملية التي تسجل الخطوات الوسيطة — لزيادة جودة المخرجات إلى أقصى حد لكل وحدة حساب مُنفقة.

مثال

عندما يُطلب من نموذج إثبات هوية تجميعية غير تافهة، يُنتج نموذج تم تكوينه بميزانية TTC عالية أكثر من 800 رمز استدلال وسيط — استكشاف عدة استراتيجيات إثبات والتحقق من التناقضات — قبل الالتزام بإجابة نهائية تم التحقق منها، وتحقيق دقة على معايير المستوى التنافسي التي لا يمكن لاستجابة تمريرة واحدة مباشرة أن تطابقها.

مصطلحات مرتبطة

← المسرد