Могут ли трансформеры выбирать модель? Байесовский тест arXiv на 2,8M параметров
Трансформер на 2,8 млн параметров научился байесовскому выбору модели — определять, из какого класса гипотез пришли данные — с точностью до 0,01 бита от оптимума. Но как только для различения классов нужна арифметика (сложение или умножение по модулю), модель справляется только с числовыми токенами и полностью проваливается на абстрактных символах. Граница держится даже при росте сети до 316 млн параметров.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.LG؛ بتحرير Hamidun News
تعلّم محوّل (transformer) يضم 2.8 مليون معامل الاختيار البايزي للنموذج — أي تحديد فئة الفرضيات التي وُلّدت منها البيانات — بانحراف لا يتجاوز 0.01 بت عن المثالية النظرية. هذا ما أظهرته الورقة البحثية "Bayesian Wind Tunnels for Model Selection"، المنشورة على arXiv في يوليو 2026.
ما هي "أنفاق الرياح البايزية"
"أنفاق الرياح البايزية" هي بيئات محكومة يُعرف فيها التوزيع البَعدي الدقيق على فئات الفرضيات بصيغة مغلقة، بحيث تُقارَن إجابة النموذج مباشرة بالمثالية البايزية. سبق أن تبيّن أن المحوّلات (transformers) تنفّذ ترشيحًا بايزيًا دقيقًا داخل فئة فرضيات واحدة ثابتة. أما السؤال الجديد الذي طرحه المؤلفون فهو: هل يستطيع النموذج اختيار الفئة نفسها، أي التعرّف على البنية التي وُلّدت البيانات؟
بُنيت المهام على تقابلات ذاتية (involutions) بلا نقاط ثابتة — دوال تحقق الخاصية f(f(x))=x، وهي خاصية علائقية بحتة. يحقق المحوّل توافقًا مع المثالية حتى عندما تكون الرموز معتمة وتتغيّر قيمها في كل حلقة (episode). العمل بالرموز المعتمة مهم: فهو يُلغي أي إشارات يمكن أن "يتشبث" بها النموذج، ولا يترك سوى بنية المهمة نفسها.
- النموذج — محوّل يضم 2.8 مليون معامل، اختُبر على 3 seeds
- توافق الإنتروبيا مع المثالية البايزية — 0.01 بت
- مقارنة non-nested (تقابلات ذاتية مقابل دورات ثلاثية) — خطأ MAE للتوزيع البَعدي أقل من 0.001
- الحد الفاصل في المهام الحسابية يصمد عند تكبير الحجم 112 مرة (2.8M ← 316M معامل)
- فجوة المعايرة مقارنة بنماذج اللغة الكبيرة (LLM) الحالية — نحو 55×
أين ينهار اختيار النموذج
ينهار اختيار النموذج تمامًا عندما لا تُميَّز الفئات إلا عبر الحساب — الجمع أو الضرب بالباقي (modulo): فحينها يتعامل المحوّل جيدًا مع الرموز الصحيحة (integer tokens)، لكنه يفشل مع الرموز المعتمة. وبحسب ملخص الورقة، يصمد هذا الحد عند تكبير النموذج 112 مرة — من 2.8 إلى 316 مليون معامل — أي أن الأمر لا يتعلق بحجم الشبكة.
حدّد تشخيص المهام الفرعية موضع الخلل بدقة: فهو ينشأ عند تركيب انعكاس الترويسة (header) مع الحساب، لا في تحليل الترويسة نفسه.
المسألة تكمن في الدلالة المستقرة
سبب الفشل لا يكمن في الأرقام بحد ذاتها، بل في استقرار القيم. أظهرت تجربة ضبط حول السكون الإحصائي (stationarity) أن الرموز المعتمة ذات إعادة الترميز الثابتة تُنتج خطأً لا يتجاوز 0.009 بت، أي أنها تؤدي بلا سوء عن الأعداد الصحيحة.
"الدلالة المستقرة، لا الهوية العددية الصحيحة، هي ما يتيح تجميع
(compile) مخطط حسابي"، كما جاء في ملخص الورقة على arXiv.
كشف اختبار نماذج اللغة الكبيرة (LLM) المتقدمة الحالية على المهام نفسها عن سلوك بايزي من حيث النوعية، لكن مع فجوة معايرة أكبر بكثير — نحو 55×؛ ويشدد المؤلفون على أن هذا التقدير استُخلص عبر مسابر "ذات فقدان" (lossy)، ولذلك فهو يحدد اتجاهًا لا قيمة دقيقة.
ماذا يعني هذا
ترسم الورقة حدًا ملموسًا لقدرات المحوّلات: فهي تُتقن اختيار النموذج، لكن فقط عندما تتوفر للسمة المميِّزة إمكانية وصول مستقرة إلى الدلالة. وهذا مرجع لقابلية التفسير الآلي (mechanistic interpretability) — إذ يُظهر أي مخططات حسابية تستطيع الشبكة "تجميعها"، وأيها يبقى بعيد المنال بغض النظر عن عدد المعاملات.
أسئلة شائعة
ما هو الاختيار البايزي للنموذج?
هو القدرة على تحديد فئة الفرضيات التي جاءت منها البيانات، لا مجرد تقدير المعاملات داخل فئة واحدة. ففي الورقة، يقارن المحوّل، على سبيل المثال، بين التقابلات الذاتية والدورات الثلاثية، وينتج توزيعًا بَعديًا بخطأ أقل من 0.001.
لماذا يفشل النموذج في الحساب?
عندما تتطلب السمة المميِّزة بين الفئات الجمع أو الضرب بالباقي (modulo)، لا يتعامل المحوّل بنجاح إلا مع الرموز الصحيحة، ويفشل تمامًا مع الرموز المجردة. وأظهر الضبط أن الحاسم هو استقرار دلالة الرموز، لا طبيعتها العددية.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.