Together AI تطلق MiniMax M3 بسياق من مليون رمز ودعم متعدد الوسائط
أصبحت Together AI الشريك السحابي الرسمي لـ MiniMax لإطلاق M3، مع سياق يصل إلى مليون رمز ودعم متعدد الوسائط بشكل أصلي. وكتب فريق Together نوى مخصصة للانتباه المتناثر وبوابة للمعالجة المسبقة بلغة Rust: ارتفع معدل النقل بنسبة تتراوح بين 81% و125% بحسب الحمل. وبعد إصدار الأوزان المفتوحة، سيتوفر النموذج عبر API للمطورين مباشرة على منصة Together AI.
معالج بواسطة الذكاء الاصطناعي من Together AI Blog؛ بتحرير Hamidun News
لقد أطلقت Together AI نموذج MiniMax M3 بسياق يصل إلى 1 مليون رمز ومحتوى متعدد الأوجه
أعلنت Together AI عن شراكة مع MiniMax وأطلقت نموذج M3 في الإنتاج — مع سياق يصل إلى مليون رمز، ومحتوى متعدد الأوجه أصلي، وتسريع الاستدلال يصل إلى 125%.
ما هو MiniMax M3
MiniMax M3 هو النموذج الرئيسي للشركة، وقد تم إنشاؤه لمهام الوكلاء في العالم الحقيقي: المستندات الطويلة، وقواعد الأكواد، والصور، واستدعاءات الأدوات — كل ذلك في سياق واحد. كان للنماذج السابقة صعوبات مع السياقات الطويلة بسبب التعقيد التربيعي للاهتمام الذاتي. يحل M3 هذه المشكلة بطريقة مختلفة بشكل أساسي.
في قلب العمارة يوجد MiniMax Sparse Attention (MSA)، آلية انتباه متفرقة بالكتل. كل رمز استعلام يهتم فقط بعدد محدود من كتل KV-cache ذات الصلة بدلاً من التسلسل الكامل. بسبب هذا، لا ينمو التعقيد الحسابي بشكل تربيعي مع طول السياق.
مقارنة مع M2.7: تسريع prefill هو 9x، تسريع فك التشفير هو 15x. الخصائص الرئيسية لـ M3:
- نافذة السياق — حتى 1 مليون رمز
- محتوى متعدد الأوجه أصلي: نص، كود، صور
- دعم سيناريوهات الوكلاء واستدعاءات الأدوات
- نتائج منافسة في مهام البرمجة
كيفية إعداد Together AI للبنية الأساسية
إطلاق مثل هذا النموذج في الإنتاج دون فقدان الكفاءة ليس تافهاً. يفترض MSA مرحلتين عند حساب الاهتمام: أولاً، حساب الصلة لتحديد كتل KV، ثم الاهتمام الكثيف بين رموز الاستعلام والكتل المختارة. التطبيقات القياسية لا تتعامل مع هذا بشكل جيد.
كتب فريق الهندسة في Together AI أربع تحسينات رئيسية:
- نواة الانتباه المتفرقة الرئيسية KV-Block — نواة CUDA للاهتمام المتفرق على كتل KV-cache مع إعادة تنظيم الذاكرة الخاصة بـ MSA
- فك التشفير MSA الموزع — تكامل الاهتمام الموزع لفك التشفير مع سياق مليون رمز بدون تجزئة الذاكرة
- نواة حساب الفهرس المحسنة — حساب الصلة المتسارع لتحديد كتل KV في كل خطوة فك تشفير
- بوابة متعددة الأوجه قائمة على Rust — بوابة معالجة مسبقة للصور والمدخلات المختلطة بأدنى زمن انتقال
في المجموع، وفرت هذه التحسينات مكاسب في الإنتاجية من 81% إلى 125% عند مستويات تحميل مختلفة — تم إجراء القياسات على NVIDIA B200.
ما هو التالي
MiniMax M3 متاح بالفعل من خلال Together AI كخدمة سحابية. في الأيام القادمة، سيتم الإفراج عن الأوزان المفتوحة — بعد ذلك يمكن نشر النموذج بشكل مستقل أو استخدامه كنقطة نهاية API على منصة Together مباشرة.
"يؤكد إطلاق M3 في الإنتاج على
Together AI كمنصة مفضلة للنماذج التي تفرض متطلبات نظام حقيقية," — من مدونة الشركة الرسمية.
ماذا يعني هذا
قدرة Together AI على نشر نموذج بسياق 1M-token بكفاءة أعلى بنسبة 81–125% من الطريقة القياسية هي إشارة تنافسية للسوق. بالنسبة للمطورين، هذا يعني الوصول السريع إلى وكيل قوي متعدد الأوجه عبر API بسيط دون الحاجة إلى التعامل مع التعقيدات المعمارية لـ MSA بنفسك.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.