arXiv cs.AI→ المصدر

SmolLM2-1.7B обгоняет модели на 34B в генерации MLIR-кода без дообучения

Крошечная модель SmolLM2-1.7B обошла code-модели на 15-34B параметров в генерации кода MLIR — промежуточного представления, на котором работают TensorFlow, JAX и PyTorch. Вместо дообучения авторы механически вывели правила декодирования из спецификаций каждого диалекта. На диалекте linalg модель достигла 80% валидных программ — на 21-44 пункта выше крупных конкурентов и в 8-25 раз быстрее.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
SmolLM2-1.7B обгоняет модели на 34B в генерации MLIR-кода без дообучения
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

في يوليو 2026، قدّم باحثون على arXiv طريقة مكّنت نموذج اللغة SmolLM2-1.7B من توليد كود MLIR صحيح بمستوى يضاهي نماذج أكبر بـ 15-34 مرة — دون ضبط دقيق (fine-tuning)، وذلك عبر قيود فك ترميز مُستنتَجة آليًا من مواصفات اللهجات (dialects).

لماذا يصعب على النماذج التعامل مع MLIR

MLIR (Multi-Level Intermediate Representation) هو التمثيل الوسيط الذي تقوم عليه بنية مترجمات التعلم الآلي الحديثة: TensorFlow وJAX/StableHLO وPyTorch Inductor وIREE. لكن MLIR يظهر بكميات ضئيلة جدًا فقط في مجموعات بيانات تدريب نماذج اللغة، لذا فإن النماذج تولّده بشكل سيئ.

الصعوبة الرئيسية تكمن في قابلية التوسّع. صُمم MLIR ليتم توسيعه بلهجات (dialects) جديدة لكل مجال تطبيقي، وضبط نموذج منفصل دقيقًا لكل لهجة أمر لا يمكن توسيعه (not scalable). طرح الباحثون السؤال التالي: هل يمكن لأولويات وقت الاستدلال (inference-time priors)، المُستنتَجة آليًا من مواصفة عمليات اللهجة (Operation Definition Specification، ODS)، أن تحل محل التكيّف عبر الضبط الدقيق بالتدرّج (gradient-based fine-tuning)؟

كيف تعمل القيود المستمدة من المواصفة

تبني الطريقة كومة قيود من ثلاث طبقات مباشرة من مخطط اللهجة، دون تدريب. تستبعد كل طبقة المتغيرات غير الصالحة بالفعل في مرحلة التوليد.

  • C1 — قواعد نحوية خالية من السياق (CFG) على تواقيع العمليات
  • C2 — تقسيم حسب الأنواع مستمد من شبكة أنواع (type lattice) مستخرجة من ODS
  • C3 — مدقق نطاق SSA مع أخذ عينات الرفض (rejection sampling) وخمس محاولات إعادة

وفقًا للشرح التوضيحي على arXiv، فإن نقل الكومة من مجموعة اللهجات arith+func+memref+linalg إلى StableHLO لم يتطلب سطرًا واحدًا من كود قيود جديد — إذ يُستنتج المخطط تلقائيًا من المواصفة.

إلى أي مدى تفوّق النموذج الصغير على النماذج الكبيرة

في اللهجات التي تُحدَّد فيها دلالات المدقق بقيود بنيوية، سمحت الأولويات المستمدة من المخطط لنموذج SmolLM2-1.7B بمضاهاة أو تجاوز نماذج بحجم 15-34B معلمة. وفي لهجة linalg، حقق النموذج 80.0% من البرامج الصالحة (متوسط عبر ثلاث بذور عشوائية (seeds)، n=125).

  • التفوق على CodeLlama-34B وGranite-Code-34B وStarCoder2-15B — من 21 إلى 44 نقطة مئوية، مع فواصل ثقة لا تتداخل
  • سرعة التوليد — أعلى بـ 8-25 مرة مقارنة بالنماذج الأساسية الكبيرة
  • تم إصدار 4 معايير قياس (benchmarks) من NL إلى MLIR: MLIR-Spec-150 وLinalg-Spec-30 وStableHLO-Spec-30 وStableHLO-Held-Out-200 — أي 410 زوجًا من "نص → MLIR" إجمالًا
  • مجموعات البيانات مرخّصة بموجب Apache-2.0، مع أوراق بيانات (datasheets) وفق منهجية Gebru وبيانات وصفية Croissant 1.0
  • أُتيحت للجمهور معايير القياس (benchmarks)، ومفكك الترميز (decoder)، وجميع نواتج التوليد، وصورة Docker لإعادة الإنتاج

لكن الطريقة لا تفوز في كل الحالات. ففي arith+func وفي مجموعة StableHLO-Held-Out-200 ذات الطابع البارامتري، حيث تعتمد الصحة على قيم السمات (attributes) وليس على بنية الكود، تساوت النماذج الكبيرة مع النموذج الصغير أو تفوّقت عليه — ويصنّف الباحثون هذه الحالات بأمانة على أنها "non-win cells".

«تتيح الأولويات المستمدة من المخطط لنموذج

SmolLM2-1.7B مضاهاة نماذج الكود بحجم 15-34B أو تجاوزها بسرعة توليد أعلى بـ 8-25 مرة»، بحسب ما جاء في الشرح التوضيحي للدراسة على arXiv.

ما الذي يعنيه هذا

بالنسبة للغات الضيقة والصارمة بنيويًا مثل MLIR، يمكن للقيود المستمدة من المواصفة أن تحل محل الضبط الدقيق المكلف: فنموذج صغير مزوّد بـ"قضبان توجيه" صحيحة يتفوق على نموذج كبير ويعمل بسرعة أكبر بمرات عديدة. وهذا يقلّل تكلفة توليد كود المترجمات ويزيل مشكلة التوسّع مع كل لهجة جديدة.

الأسئلة الشائعة

ما هو MLIR؟

MLIR (Multi-Level Intermediate Representation) هو تمثيل وسيط للكود تعمل عليه مترجمات التعلم الآلي TensorFlow وJAX/StableHLO وPyTorch Inductor وIREE. ويتم توسيعه بـ"لهجات" (dialects) لمهام محددة.

لماذا تفوّق نموذج بحجم 1.7B على نموذج بحجم 34B؟

لم يخضع لضبط دقيق، بل حصل على قيود فك ترميز مستمدة من مواصفة اللهجة. وفي linalg، أدى ذلك إلى 80.0% من البرامج الصالحة — أي أعلى بـ 21-44 نقطة من CodeLlama-34B وGranite-Code-34B وStarCoder2-15B.

أين لم تنجح الطريقة؟

في لهجتي arith+func وفي مجموعة StableHLO-Held-Out-200، حيث تعتمد الصحة على قيم السمات (attributes) وليس على بنية الكود. وهناك تساوت النماذج الكبيرة مع SmolLM2-1.7B أو تفوّقت عليه.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…