حسّنت SageMath وكلاء LLM في الرياضيات بمقدار 9.7pp في المتوسط
دمج الباحثون نظام الجبر الحاسوبي SageMath في وكلاء LLM واختبروه على نماذج حدودية مثل GPT-5.5. حسّنت جميع النماذج المختبرة أداءها — بمتوسط 9.7pp. يحقق GPT-5.5 معدل حل بنسبة 75.2% للمسائل الرياضية، بينما يحصل Qwen 3.7-Max على أقصى ربح (+27.8pp). الخلاصة: أنظمة الجبر في وكلاء LLM تمثل اتجاهاً واعداً للاكتشاف الآلي للفرضيات الرياضية الجديدة.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
اقترح الباحثون منهجية لدمج SageMath (نظام الجبر الحاسوبي) مع وكلاء LLM لحل مشاكل الرياضيات البحثية. أظهرت النتائج تحسناً عالمياً في الأداء بمقدار +9.7pp في المتوسط، مع مكاسب قصوى تصل إلى 27.8pp لنموذج Qwen 3.7-Max.
كيفية دمج نظام الجبر في LLM
SageMath — برنامج مجاني للحساب الرياضي، يشمل الجبر الرمزي ونظرية الأعداد والتصور. قام الباحثون بدمجه في وكيل أسلوب ReAct — بنية معمارية تسمح لـ LLM بالتفكير خطوة بخطوة، واستدعاء الأدوات وتحليل النتائج.
يشمل التكامل:
- معمارية ReAct للتفكير المنطقي خطوة بخطوة
- SageMath للتحقق من وتنفيذ العمليات الجبرية
- Context7 للوصول إلى وثائق SageMath الحالية
- بدعة معايير RealMath مع مشاكل الرياضيات البحثية
يسمح هذا الدمج لـ LLM ليس فقط بـ "تخمين" الإجابات، بل التحقق من النتائج الوسيطة وضمان صحة الحسابات.
ما الذي أظهرته النتائج
عند اختبار نماذج الحدود، أظهر النظام مكاسب أداء ثابتة. يقود GPT-5.5 من حيث الأداء المطلقة: 75.2% قابلية الحل واستهلاك أقل للرموز من بين جميع التكوينات المجهزة بالأدوات.
تلقى نموذج Qwen 3.7-Max الحد الأقصى للمكاسب النسبية: +27.8pp بفضل تكامل SageMath. تراوح نطاق التحسينات عبر جميع النماذج المختبرة بين 1.5pp و 27.8pp.
اقترح الباحثون أيضاً تحسيناً على معايير RealMath نفسه — أضافوا التحقق متعدد المراحل والتحقق من الصحة للتأكد من أن المشاكل المستخرجة كانت ذات جودة أعلى وأكثر موثوقية.
الأرقام الرئيسية:
- التحسن المتوسط: +9.7pp
- نطاق المكاسب: 1.5pp – 27.8pp
- يصل GPT-5.5 إلى 75.2% قابلية الحل
- يتلقى Qwen 3.7-Max الحد الأقصى للمكاسب من SageMath
لماذا يحتاج علماء الرياضيات إلى هذا
يسعى علماء الرياضيات والباحثون في الذكاء الاصطناعي إلى طرق لأتمتة عملية البحث — تلك "الدورة الحسابية" حيث يصيغ العالم فرضية، يتحقق من الحسابات، يحلل النتائج، ينتقل إلى الفكرة التالية.
يمكن لوكلاء CAS أن تسرع بشكل كبير هذه الدورة: التحقق من الاشتقاقات الجبرية المعقدة في ثوانٍ، إيجاد الأنماط في التسلسلات الرقمية، المساعدة في صياغة واختبار الفرضيات، تجنب أخطاء الحساب.
يرى المؤلفون في هذا مساراً نحو الاكتشاف الآلي لفرضيات رياضية جديدة — مجال حيث كانت LLMs تخطئ في كثير من الأحيان مسبقاً أو تتطلب الكثير من المساعدة البشرية.
ما معنى هذا
يوضح البحث حقيقة أساسية: الاختيار الصحيح للأداة يمكن أن يغير بشكل نوعي قدرة LLM على التفكير المنطقي. SageMath — ليس نظام الجبر الأول، لكن هذا أول دراسة كبرى لدمجه في نماذج LLM الحدودية على نطاق الأداء. الخطوة التالية — توسيع مجموعة أنظمة CAS (Mathematica, Maple) وتحسين التكامل لأنواع المشاكل الأخرى في الفيزياء والهندسة.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.