Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Исследователи представили Spectral-LSH — метод сжатия длинных промптов для языковых моделей без дообучения. Он группирует похожие токены через SimHash в спектральном пространстве внимания и сокращает вход в 8–16 раз. При сжатии 16× Qwen2.5-14B снижает коэффициент перплексии с 9,533 до 3,427 — качество сохраняется там, где простое разбиение текста на блоки его теряет.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
قدّم باحثون طريقة Spectral-LSH — وهي طريقة لضغط المُوجّهات (prompts) الطويلة الخاصة بنماذج اللغة الكبيرة، تعمل دون إعادة تدريب النموذج (fine-tuning) وتُقلّص طول النص المُدخَل بمقدار 8–16×، مع الحفاظ على الجودة في الحالات التي تفقدها فيها الطرق البسيطة. صدرت الورقة الأولية (preprint) على arXiv (الرقم 2607.19368) في يوليو 2026.
لماذا نضغط المُوجّهات
معالجة المُوجّهات الطويلة مكلفة لأن تكلفة الانتباه (attention) في مرحلة prefill تنمو بشكل تربيعي — أي كـ O(N²) بالنسبة لطول التسلسل. تحلّ Spectral-LSH هذه المشكلة قبل أن يصل المُوجّه إلى النموذج أصلاً: فهي تجد الرموز (tokens) المتقاربة في المعنى وتدمجها في «رموز كبرى» (macro-tokens)، ما يُقلّص طول المُدخَل حتى قبل بدء الحسابات.
أهم الحقائق الواردة في الورقة الأولية:
- الطريقة training-free — لا تتطلّب إعادة تدريب النموذج
- تعمل كمعالج أوّلي (preprocessor)، قبل دخول النص إلى النموذج اللغوي الكبير (LLM)
- جرى اختبارها على Mistral-7B-Instruct-v0.3 وQwen2.5-7B-Instruct وQwen2.5-14B-Instruct
- مجموعة البيانات المستخدمة للتقييم هي C4
- جرى اختبار معاملات الضغط ρ في نطاق من 4× إلى 16×
كيف تعمل الطريقة
تُقرّب Spectral-LSH المكوّنات الرئيسية للمُشغّل الضمني (implicit operator) لنواة الانتباه عبر طريقة فضاء كريلوف الفرعي (Krylov subspace) إلى جانب random features. ويتيح ذلك الاستغناء عن البناء الصريح لمصفوفة الانتباه ذات الحجم O(N²) — وهي الجزء الأكثر تكلفة عند التعامل مع سياق طويل. بعد ذلك، وفي فضاء الانتباه «الطيفي» (spectral) الناتج، يُطبَّق SimHash: تُجزَّأ الرموز المتشابهة (hashed) إلى نفس السلال (buckets) وتُجمَّع في رموز كبرى مع الحفاظ على الترتيب السببي للمواضع، حتى لا يفقد النموذج بنية التسلسل.
أين يحدث الانتقال الطوري
النتيجة الرئيسية هي انتقال طوري (phase transition) بحسب معامل الضغط، يصفه المؤلفون. تحت ρ=4× يكون التكرار المحلي للرموز ضئيلًا، ويُقدّم التقطيع الخفيف (chunking) — أي التقسيم البسيط إلى كتل — أفضل توازن بين السرعة والجودة. وفوق ρ=8× يبدأ المسار الطيفي في الحفاظ على الجودة التي يفقدها التقطيع.
عند ρ=16× يصبح الفارق واضحًا بشكل خاص: وفقًا لبيانات الورقة الأولية، يخفّض Qwen2.5-7B في الوضع التكيّفي (adaptive) معامل الحيرة (perplexity، PPL) من 353,409 إلى 196,963، بينما يخفّضه Qwen2.5-14B من 9,533 إلى 3,427. وكلما انخفضت الحيرة، قلّ التشويه في تنبؤات النموذج بعد الضغط.
«تكشف تجاربنا عن انتقال طوري بحسب معامل الضغط»، كما جاء في ملخص
الدراسة على arXiv.
ما الذي أظهره اختبار الإجهاد
في اختبار إجهاد صغير على سياق طويل مكوّن من بيانات مُهيكَلة — مقاطع بأسلوب JSON وأكواد برمجية وجداول — حسّن LSH المحلي كل مقياس مقارنةً بالتقطيع (chunking) عند معامل ضغط 8×. وتجمع الواجهة الخلفية التكيّفية (adaptive backend) بين الوضعين: التقطيع عند الضغط المنخفض والتجميع الطيفي (spectral clustering) عند الضغط المرتفع. ومع ذلك، يبقى التقطيع الأسرع من حيث زمن الاستجابة الإجمالي (latency) — إذ يأتي الحفاظ على الجودة عند المعاملات المرتفعة على حساب الوقت.
ما الذي يعنيه هذا
تُظهر Spectral-LSH أن الضغط العدواني للمُوجّهات (بمقدار 8× فأكثر) يمكن تحقيقه دون فقدان الجودة ودون إعادة تدريب النموذج — شريطة تجميع الرموز حسب طيف الانتباه بدلًا من تقطيع النص إلى كتل. وبالنسبة لاستدلال (inference) السياقات الطويلة، يمثّل هذا طريقًا مباشرًا نحو تكاليف حوسبة أقل.
أسئلة شائعة
ما هي Spectral-LSH؟
هي طريقة training-free لضغط المُوجّهات المُدخَلة لنماذج اللغة: تجمّع الرموز المتشابهة عبر تجزئة SimHash في فضاء الانتباه الطيفي وتدمجها في رموز كبرى، ما يُقلّص طول المُدخَل بمقدار 4–16×. ولا تتطلّب إعادة تدريب النموذج.
على أي النماذج جرى اختبار الطريقة؟
قيّم المؤلفون Spectral-LSH على Mistral-7B-Instruct-v0.3 وQwen2.5-7B-Instruct وQwen2.5-14B-Instruct على مجموعة بيانات C4، وكذلك في اختبار إجهاد ببيانات مُهيكَلة بأسلوب JSON وأكواد برمجية وجداول.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.