arXiv cs.AI→ المصدر

LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения

Исследователи показали LISA — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и «молниеносный индексатор», который отбирает только важные токены и снижает сложность вычислений с O(n²) до O(nM). На моделях DeepSeek-distilled-Qwen метод дал 50% ускорения вывода при контексте 16K токенов и +5,6% к качеству рассуждений — без обучения с нуля.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

قدّم باحثون LISA (الانتباه المتناثر المفهرس خطيًا Linear-Indexed Sparse Attention) — وهو وحدة بديلة لآلية الانتباه أظهرت في يوليو 2026 تسريعًا في الاستدلال بنسبة 50% عند سياق يبلغ 16 ألف رمز (توكن)، وتحسنًا في جودة الاستدلال بنسبة 5.6%، دون الحاجة إلى تدريب النموذج من الصفر. نُشر العمل على arXiv (2607.19358).

كيف يعمل LISA

يُدمَج LISA في نموذج قائم كبديل جاهز (plug-and-play) للانتباه الذاتي (self-attention) القياسي، ويجمع بين فرعين متوازيين. الأول هو Linear Attention بتعقيد O(n)، وهو مسؤول عن "الذاكرة طويلة المدى" والتبعيات البعيدة. والثاني هو آلية Lightning Indexer، التي تختار أهم top-M رمزًا من كامل السياق وتمررها إلى Sparse Self-Attention. ويتم دمج الفرعين عبر آلية بوابة (gating).

  • الاسم: LISA (Linear-Indexed Sparse Attention)، النسخة الأولية على arXiv برقم 2607.19358
  • ينخفض تعقيد الاستدلال من O(n²) إلى O(nM)، حيث M أصغر بكثير من n
  • مكونان اثنان: Linear Attention (ذاكرة O(n)) + Lightning Indexer + Sparse Self-Attention
  • لا يتطلب تدريبًا مسبقًا من الصفر — تُدمَج الوحدة في نموذج جاهز بالفعل
  • أُجريت الاختبارات على نماذج DeepSeek-distilled-Qwen

لماذا يهم هذا الاستدلال

يتميز الانتباه الذاتي القياسي بتعقيد تربيعي O(n²)، ما يجعل تكلفة الاستدلال ترتفع بشدة مع السلاسل الطويلة. وقد أصبح هذا عائقًا أمام النماذج ذات سلاسل الاستدلال الطويلة (long chain-of-thought) مثل DeepSeek-R1: إذ يفرض نموذج test-time scaling عليها توليد سياق استدلال أطول فأطول، وترتفع التكاليف معه. ووفق تقدير الباحثين، فإن هذا هو تحديدًا ما يحدّ من نشر نماذج long-CoT في بيئة الإنتاج.

يهاجم LISA المشكلة على المستوى المعماري، وليس عبر عتاد أقوى. فمن خلال استبدال جزء من الانتباه الكامل بانتباه متناثر وخطي، تنقل الطريقة توليد n رمزًا من نمط O(n²) إلى نمط O(nM) — مع كون M (عدد الرموز المختارة) أصغر بشكل ملحوظ من طول السياق n.

ماذا أظهرت الاختبارات

على نماذج عائلة DeepSeek-distilled-Qwen، حقق LISA تسريعًا في الاستدلال بنسبة 50% عند سياق يبلغ 16K رمز، ورفع في الوقت نفسه متوسط النتيجة في معايير الاستدلال (reasoning benchmarks) بنسبة 5.6% — بما في ذلك AIME وMATH-500. أي أن الطريقة لا تكتفي بالتسريع فحسب، بل لا تتراجع في الجودة أيضًا.

بُني التدريب على مرحلتين. في الأولى، يُدمَج في النموذج انتباه خطي للتبعيات البعيدة، مكمَّل بآلية نافذة منزلقة (sliding-window)؛ ويُحسَّن عبر تقطير المعرفة (knowledge distillation) للاقتراب من توزيع الانتباه الذاتي الكامل لنموذج معلّم "مجمَّد". وفي المرحلة الثانية، يُستبدل الإطار المنزلق الثابت بـIndexer، يُدرَّب عبر دالة خسارة جديدة — تباعد KL لكل رأس (per-head)، تُوائم اختياره للرموز مع أنماط انتباه المعلّم.

"يوفر LISA تسريعًا في الاستدلال بنسبة 50% عند سياق يبلغ 16K رمز، مع

تحسين متوسط النتيجة بنسبة 5.6% في معايير الاستدلال، بما في ذلك AIME وMATH-500" — كما ورد في ملخص الدراسة على arXiv.

ما الذي يعنيه هذا

الاستدلال الطويل مكلف تحديدًا بسبب الانتباه التربيعي، ويُظهر LISA طريقًا لخفض هذه التكلفة دون إعادة تدريب النموذج من الصفر — إذ يكفي دمج الوحدة في شبكة جاهزة بالفعل. وبالنسبة للفرق التي تنشر نماذج الاستدلال في بيئة الإنتاج، يمثّل هذا وسيلة مباشرة لخفض تكاليف الاستدلال دون التضحية بالدقة.

أسئلة شائعة

ما هو LISA؟

LISA (Linear-Indexed Sparse Attention) هو وحدة بديلة لآلية الانتباه في نماذج اللغة. يجمع بين الانتباه الخطي والانتباه المتناثر مع اختيار الرموز المهمة، ما يخفض تعقيد الاستدلال من O(n²) إلى O(nM).

هل يلزم إعادة تدريب النموذج لاستخدام LISA؟

لا، لا حاجة إلى تدريب من الصفر. LISA بديل جاهز (plug-and-play) للانتباه الذاتي؛ يُدمَج في نموذج جاهز بالفعل ويُضبط على مرحلتين عبر تقطير المعرفة من نموذج معلّم.

إلى أي مدى يسرّع LISA الاستدلال؟

وفق الملخص، يحقق LISA على نماذج DeepSeek-distilled-Qwen تسريعًا في الاستدلال بنسبة 50% عند سياق يبلغ 16K رمز، مع رفع متوسط جودة الاستدلال بنسبة 5.6% في معياري AIME وMATH-500.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…