Mamba-3: بديل المحولات بتعقيد خطي
Mamba-3 هو نموذج جديد يعتمد على نموذج مساحة الحالة (SSM)، طوره باحثون من جامعة كارنيجي ميلون و Together AI. تركز البنية على أداء الاستدلال بدلاً من التدريب: تتفوق على Mamba-2 وحتى Llama-3.2-1B في سرعة توليد النصوص. نشر الباحثون نوى GPU محسّنة، محققين تعقيدًا خطيًا مع الحفاظ على جودة عالية.
معالج بواسطة الذكاء الاصطناعي من Together AI Blog؛ بتحرير Hamidun News
في 17 مارس 2026، نشرت مجموعة بحثية من Carnegie Mellon University و Princeton University و Cartesia AI و Together AI ورقة حول بنية Mamba-3 الجديدة — نموذج فضاء الحالة (SSM)، مصمم في المقام الأول لكفاءة الاستدلال، وليس التدريب، بخلاف سابقه Mamba-2. النتيجة الرئيسية: تتفوق متغيرة Mamba-3 SISO على Mamba-2 وبنية Gated DeltaNet وحتى محول Llama-3.2-1B في الكمون الإجمالي في مراحل الملء المسبق والفك في جميع أطوال التسلسل في مقياس نموذجي يبلغ 1.5 مليار معامل.
الحقائق الرئيسية عن الإطلاق
- تاريخ النشر — 17 مارس 2026
- المؤلفون — Aakash Lahoti و Kevin Y. Li (Carnegie Mellon University)، Berlin Chen و Caitlin Wang (Princeton University)، Aviv Bick و J. Zico Kolter (Carnegie Mellon University)، Tri Dao (Princeton University، Together AI)، Albert Gu (Carnegie Mellon University، Cartesia AI)
- نطاق الاختبارات — نماذج على مستوى 1.5 مليار معامل
- الابتكارات المعمارية الرئيسية — صيغة التكرار الأكثر تعبيراً وتتبع الحالة ذات القيمة المعقدة ومتغير MIMO (إدخال متعدد، إخراج متعدد)
- المصدر المفتوح — نوى حسابية في Triton و TileLang و CuTe DSL منشورة في الوصول المفتوح
لماذا لا يلبي Mamba-2 احتياجات الصناعة بعد الآن؟
منذ إطلاق Mamba-2 في منتصف عام 2024، انتقلت معظم البنى المستندة إلى SSM إليها من Mamba-1: راهن المطورون على أن الاختناق الرئيسي ظل سرعة التدريب، وبسطوا آلية SSM الأساسية لتسريع التدريب بمقدار 2–8 مرات مقارنة بسابقتها — نجحت هذه الرهان وضمنت اعتماداً واسع النطاق لـ Mamba-2 في الصناعة. لكن منذ ذلك الحين، تغير منظر نماذج اللغات الكبيرة بشكل ملحوظ: على الرغم من بقاء التدريب المسبق مهماً، تم توجيه اهتمام أكثر بكثير للتدريب اللاحق والنشر — كلا العمليتين تتطلبان استدلالاً عالي الطلب. يتطلب توسيع نطاق أساليب التدريب اللاحق، خاصة التعلم المعزز حول المكافآت القابلة للتحقق (RLVR) لمهام الترميز والرياضيات، توليد أعداد ضخمة من الاختبارات، وأسلوب سير العمل الموجهة بالعوامل — مثل Codex و Claude Code أو OpenClaw — قد زادت بشكل حاد من طلب الاستدلال.
رغم هذا، تم تطوير العديد من البنى الخطية، بما فيها Mamba-2، في الأصل بأولويات التدريب: لتسريع التدريب المسبق، تم تبسيط آلية SSM الأساسية تدريجياً — على سبيل المثال، تم تقليل انتقال الحالة إلى مقياس مضروب بمصفوفة الهوية، مما قلل من التعبيرية النموذجية لسرعة التدريب.
ما الذي يغيره Mamba-3 ولماذا تهم البنية المحسنة للاستدلال؟
يعكس Mamba-3 هذا المنطق: استعادت الفريق للنموذج صيغة تكرار أكثر تعبيراً وتتبع حالة بقيمة معقدة — آليات بسطتها Mamba-2 لسرعة التدريب — وأضاف أيضاً متغير MIMO يزيد من الدقة دون إبطاء الفك. النتيجة — بنية ذات كمون استدلال أقل من Mamba-2 و Gated DeltaNet وحتى محول Llama-3.2-1B الكلاسيكي، مع الحفاظ على الميزة عبر جميع أطوال التسلسل المختبرة في مقياس 1.5 مليار معامل. نظراً لأن بنى SSM تعالج التسلسلات بتعقيد حسابي خطي بدلاً من التربيعي كما هو الحال في المحولات، فإن ميزة Mamba-3 ملحوظة بشكل خاص على السياقات الطويلة وتحت حمل عالي في مرحلة الإنشاء — تماماً حيث تتركز الطلب الرئيسي للصناعة على الاستدلال السريع والرخيص اليوم.
ما الذي يعنيه هذا للصناعة
النشر المفتوح للنوى الحسابية في Triton و TileLang و CuTe DSL يقلل من حاجز الدخول للفرق التي تريد تنفيذ Mamba-3 في بنيتها الأساسية للاستدلال، والتعاون بين المختبرات الأكاديمية (Carnegie Mellon University و Princeton University) واللاعبين الصناعيين (Together AI و Cartesia AI) يعكس اتجاهاً أوسع: البحث المعماري المتقدم يصحبه بشكل متزايد على الفور بنية أساسية جاهزة للنشر العملي، بدلاً من البقاء نتيجة نظرية فقط على الورق. بالنسبة للسوق، يشير هذا إلى أن البدائل للمحولات ذات التعقيد الحسابي الخطي تنتقل من فئة التجارب المخبرية إلى فئة المرشحين الحقيقيين لدور البنية الأساسية للمنتجات الموجهة نحو الاستدلال من الجيل التالي — من مساعدي العوامل إلى خدمات التدريب اللاحق على نطاق واسع.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.