MarkTechPost→ المصدر

Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя

Thinking Machines Lab выпустила Inkling-Small — открытую мультимодальную MoE-модель с 276B параметрами (12B активных). Это четверть размера исходного Inkling (975B), но на SWE-bench Verified она набирает 80,2% против 77,6% у «учителя», а на HLE — 31,6% против 29,7%. Контекст — 1M токенов, поддержка текста, изображений и аудио. Веса под Apache 2.0 на Hugging Face; минимальный запуск — одна карта B300 в режиме NVFP4.

معالج بواسطة الذكاء الاصطناعي من MarkTechPost؛ بتحرير Hamidun News
Thinking Machines Lab выпустила Inkling-Small: открытая MoE-модель 276B превзошла учителя
المصدر: MarkTechPost. كولاج: Hamidun News.
◐ استمع للمقال

أصدرت Thinking Machines Lab في الثاني من أغسطس 2026 أوزان نموذج Inkling-Small — وهو نموذج متعدد الوسائط مبنيٌّ على بنية Mixture-of-Experts، يضمّ 276 مليار معامل إجمالي و12 مليار معامل نشط. وعلى الرغم من أن حجمه أصغر بأربع مرات من النموذج الأصلي Inkling (975B إجمالي، 41B نشط)، يتفوق النموذج الجديد عليه في معظم المعايير المرجعية الرئيسية في البرمجة والاستدلال.

كيف يختلف Inkling-Small عن Inkling

Inkling-Small هو محوّل فك ترميز (decoder-transformer) من 42 طبقة يتضمن طبقة MoE متفرقة بدلاً من FFN القياسية. يُوجَّه كل رمز (token) إلى 6 من أصل 256 خبيراً، إضافةً إلى خبيرَين مشتركَين نشطَين باستمرار. تُبنى آلية الانتباه (attention) كمزيج من الطبقات المحلية والعالمية.

النموذج متعدد الوسائط بشكل أصيل ولا يحتاج إلى مشفّر (encoder) منفصل:

  • 276B معامل إجمالي، 12B نشط أثناء الاستدلال
  • نافذة السياق — 1M رمز مع مستوى «جهد» تفكير قابل للضبط
  • المدخلات: نص، وصور (رقع بحجم 40×40 بكسل عبر hMLP رباعي الطبقات)، وصوت (طيفيات dMel، WAV بمعدل 16 كيلوهرتز، حتى دقيقتين)
  • التنسيقات العددية: BF16 وMXFP8 وNVFP4
  • رخصة Apache 2.0، الأوزان منشورة على Hugging Face

كيفية تشغيل Inkling-Small

تتطلب نقطة التحقق BF16 ما لا يقل عن 600 غيغابايت من إجمالي ذاكرة GPU — أي 4× NVIDIA B300 أو 8× NVIDIA H200. تُخفّض النسخة المكمَّمة NVFP4 هذا الحدّ إلى 180 غيغابايت: يعمل وضع W4A4 على بطاقة B300 واحدة (تتطلب بنية SM100+)، فيما يعمل W4A16 على بطاقتَي H200.

تشمل بيئات التشغيل المدعومة: SGLang وvLLM وTokenSpeed وUnsloth وHugging Face Transformers. يُخرج مسار GPU الواحدة نموذج 276B من فئة «الخاص بالمختبرات الكبرى فقط»: إذ يمكن للشركات الناشئة استئجار مثيل B300 واحد، وتتجنب الشركات التي تمتلك مجموعات H200 الحالية عمليات شراء جديدة. تحصل القطاعات الخاضعة للتنظيم — المالية والرعاية الصحية والتأمين والاتصالات — على خيار الأوزان الخاصة دون الاعتماد على API خارجي.

المعايير التي تفوّق فيها Inkling-Small على Inkling

تجاوز Inkling-Small «المعلّم» في معظم الاختبارات الرئيسية. في Humanity's Last Exam (النسخة النصية) حقّق 31.6% مقابل 29.7% لـ Inkling. SWE-bench Verified — 80.2% مقابل 77.6% (باستخدام harness bash فقط). Toolathlon Verified — 54.4% مقابل 45.5%. GPQA Diamond — 89.5%، AIME 2026 — 95.5%، ARC-AGI-2 — 40.1% مقابل 36.5%. Terminal-Bench 2.1 — 64.7%.

ثمة تراجعان واضحان: انخفض SimpleQA Verified إلى 20.6% من 43.9% في Inkling، وTau 3 Banking إلى 15.5% من 23.7%. تبقى الأداءات متعددة الوسائط قريبة من المعلّم: MMMU Pro — 74.0%، VoiceBench — 90.1%، MMAU — 77.0%، وفقاً لـ Artificial Analysis وScale AI وARC Prize.

«لا يُفرز النموذج ميزةً جوهريةً مقارنةً بمنظومة الأوزان المفتوحة الموجودة»، هكذا لخّصت

Thinking Machines Lab في بطاقة نموذج Inkling-Small، موصيةً بإضافة إشراف تنازلي — كـ Llama Guard — في التطبيقات الاستهلاكية.

ماذا يعني هذا

يُثبت Inkling-Small أن التقطير الموجَّه مع المعلّم Inkling وأسبوعَين من تدريب التعلم بالتعزيز (RL) على البرمجة الوكيلية (agentic coding) يُتيحان لنموذج مدمج أن يتخطى سلفاً أكبر حجماً. الأوزان المفتوحة بموجب رخصة Apache 2.0 تجعل وكيل 276B متاحاً للنشر الذاتي — وتُوسّع نطاق الشركات القادرة على بناء منتجات دون الاعتماد على APIs مغلقة.

الأسئلة الشائعة

كم من ذاكرة VRAM يحتاج Inkling-Small؟

180 غيغابايت على الأقل من VRAM في وضع NVFP4 المكمَّم على بطاقة B300 واحدة (SM100+). تتطلب الدقة الكاملة BF16 إجمالي 600 غيغابايت — مثلاً 4× NVIDIA B300 أو 8× NVIDIA H200.

بماذا يتفوق Inkling-Small على Inkling الأصلي؟

في ستة معايير رئيسية: SWE-bench Verified (80.2% مقابل 77.6%)، وGPQA Diamond (89.5%)، وAIME 2026 (95.5%)، وARC-AGI-2 (40.1% مقابل 36.5%)، وToolathlon Verified (54.4% مقابل 45.5%)، وHLE — 31.6% مقابل 29.7%. ويتأخر في SimpleQA Verified (20.6% مقابل 43.9%) وTau 3 Banking (15.5% مقابل 23.7%).

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…