Habr AI→ المصدر

الشبكات العصبية آلات حاسبة سيئة: لماذا تخطئ LLMs في الحساب وما العمل حيال ذلك

يمكن لـ LLM أن يخطئ بثقة في الأرقام الوسطى من حاصل ضرب مكوّن من ستة أرقام: الأطراف صحيحة، والوسط مختلق. هذه ليست bug: فالـ transformer يتنبأ بـ tokens انطلاقًا من إحصاءات بيانات التدريب بدلًا من تنفيذ خوارزمية. الحسابات القصيرة تكون عمليًا محفوظة من البيانات — ففيها ملايين الأمثلة. أما الأرقام الطويلة فتُخمن. حل الصناعة ليس تعليم النموذج أن يحسب، بل تزويده بأدوات — Python وcode interpreter وآلة حاسبة.

معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
الشبكات العصبية آلات حاسبة سيئة: لماذا تخطئ LLMs في الحساب وما العمل حيال ذلك
المصدر: Habr AI. كولاج: Hamidun News.
◐ استمع للمقال

تفشل الشبكة العصبية حتى في الرياضيات البسيطة، وتنتج بثقة نتيجة غير صحيحة لضرب أرقام من ستة أرقام—أرقام صحيحة على الحواف، خطأ في الوسط. هذا ليس خلل أو قصور في نموذج معين: يتنبأ المحول برموز بناءً على الإحصائيات، وليس تنفيذ خوارزمية الضرب كما ستفعل الآلة الحاسبة.

الرمز مقابل الخوارزمية: ما هو الفرق

ضرب العمود هو إجراء يحتوي على أرقام وتحويلات وكميات وسيطة وترتيب عمليات صارم. يقوم المعالج بتنفيذه. يقوم التلميذ بتنفيذه. محول في ممر واحد—لا: يولد نصاً يشبه الإجابة الصحيحة، بناءً على إحصائيات بيانات التدريب.

تعمل الحسابات القصيرة تماماً مثل الذاكرة، وليس الحساب:

  • تظهر جداول الضرب في بيانات التدريب ملايين المرات
  • "7 × 8 = 56" النموذج لا يحسبه—إنه يتذكره
  • مع الأرقام المكونة من رقمين أو ثلاثة أرقام، لا تزال الأنماط المألوفة كافية
  • مع أرقام من ستة أرقام—لا توجد أمثلة مألوفة تقريباً؛ يبدأ النموذج في "المتابعة بشكل معقول"
  • الثقة عند إعطاء إجابة غير مرتبطة بدقة النتيجة

لماذا ينتهي الخطأ في منتصف الرقم؟

يمكن اشتقاق الأرقام الخارجية للنتيجة من الأرقام الأولى والأخيرة للعوامل—هذا نمط يتعلمه النموذج. الأرقام الوسطى تتطلب سلسلة صادقة من الحمل، التي لا يقوم محول بتكوينها في ممر انحدار ذاتي واحد.

خط يد مميز: الحافة اليمنى (الوحدات والعشرات) والحافة اليسرى (الأرقام ذات الترتيب العالي) غالباً ما تكون صحيحة، الأرقام الوسطى—مختلقة. وفي الوقت نفسه، لا يوجد لدى النموذج أي إشارة داخلية "أنا غير متأكد"—يواصل مؤشر الرمز ببساطة التسلسل بأكثر طريقة معقولة ممكنة.

كيف تحل الصناعة هذه المشكلة

لم تأتِ الحل من داخل البنية، بل من الخارج: الأدوات. Code Interpreter في ChatGPT وكتل Python في Claude واستدعاءات الآلة الحاسبة عبر استدعاء الدالة—يفوض النموذج الحساب إلى شخص يعرف كيفية الحساب.

"يفعل، وبنجاح كبير، فقط ليس حيث يبدو." لا يتعلق التقدم بتعليم LLM

الحساب بشكل مستقل، بل بتعليمه استدعاء الأداة الصحيحة.

Chain-of-thought (التسجيل الصريح للخطوات الوسيطة) يساعد جزئياً: تزداد الدقة على الأرقام متعددة الأرقام. لكن كل رمز في السلسلة هو بحد ذاته تنبؤ، لذا هذه التقنية لا توفر موثوقية بنسبة 100٪.

في الوقت نفسه، تستمر الأبحاث حول الضبط الدقيق المتخصص للرياضيات—نماذج يتم تدريبها بشكل أساسي على النصوص العلمية تفهم المهام بشكل أفضل. لكن حتى هم لا يحلون محل الآلة الحاسبة: قيمة هذه النماذج تكمن في صياغة المهمة بشكل صحيح لأداة، وليس في الحساب الذاتي.

ماذا يعني هذا

توقع LLM أن يتصرف مثل الآلة الحاسبة هو سوء فهم معماري. النمط الصحيح: يفهم النموذج المهمة، يبني المنطق، يفوض الأرقام إلى أداة، يفسر الناتج. الثقة في اقتصاد الوحدات مباشرة في الدردشة بدون أدوات—يعني التحقق من ليس النموذج، بل الحظ.

الأسئلة المتكررة

لماذا لا ينبه النموذج بأنه لا يستطيع الحساب؟

نموذج اللغة لا يحتوي على إشارة داخلية للعدم من اليقين عند إنشاء رقم. يُخرج الرمز التالي باحتمال أقصى—ومع ثقة متساوية، ينتج عن النتائج الصحيحة والخاطئة. هذه خاصية أساسية للجيل الانحداري الذاتي، وليس خطأ في الكود.

هل يساعد chain-of-thought في الحسابات المعقدة؟

نعم، لكن بشكل محدود. يزيد التسجيل خطوة بخطوة للحمل من الدقة لأن النموذج "يرى" النتائج الوسيطة كسياق للتنبؤ التالي. ومع ذلك، تظل كل خطوة تنبؤاً، وتتراكم الأخطاء—للحسابات الحرجة، أداة خارجية مطلوبة.

لماذا تفشل الشبكة العصبية في الرياضيات؟

يتنبأ المحول برموز بناءً على إحصائيات بيانات التدريب، وليس تنفيذ خوارزمية رياضية كما يفعل المعالج أو الإنسان.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…