Jet-Long يوسّع نافذة السياق في نماذج اللغة إلى 128K من دون fine-tuning
قدّم الباحثون Jet-Long، وهي طريقة tuning-free لتوسيع نافذة السياق في نماذج اللغة من دون fine-tuning. وعلى Qwen3 مع سياق 128K، تفوقت على جميع طرق zero-shot الحالية في RULER وHELMET-RAG، فيما تسارع prefill على وحدات H100 GPU حتى 1.39× مقارنة بـ FlashAttention 2. ولا تتجاوز الزيادة في كلفة التوليد 4% عند أي طول للسياق.
معالج بواسطة الذكاء الاصطناعي من arXiv cs.LG؛ بتحرير Hamidun News
Jet-Long هي طريقة لتوسيع نافذة السياق لنماذج اللغة بدون ضبط دقيق، نُشرت على arXiv في 10 يوليو 2026. في الاختبارات على Qwen3 مع سياق يصل إلى 128K tokens، تفوقت الطريقة على جميع خطوط الأساس zero-shot الموجودة في الدقة، وتسارع prefill-throughput على GPU H100 إلى 1.39× بالنسبة إلى FlashAttention 2.
لماذا يعتبر توسيع السياق مشكلة
تم تدريب معظم LLMs المفتوحة مع نوافذ سياق من 4K–32K tokens، بينما المهام الحقيقية — RAG، الأنظمة الوكيل مع آثار الأدوات المتراكمة، تحليل المستودعات بالكامل — تتطلب بانتظام عشرة أضعاف المزيد. الضبط الدقيق لكل نقطة تفتيش للسياق الطويل مكلف: تحتاج إلى أمثلة تدريب طويلة وذاكرة GPU إضافية ووقت معالجة. هذا هو السبب في أن طرق تحجيم RoPE zero-shot أصبحت مسار النشر القياسي.
RoPE (Rotary Position Embedding) هي الطريقة القياسية لترميز مواضع الرموز في المحولات. أثناء الاستدلال بعد نافذة التدريب، تقع متجهات الموضع في نطاقات لم يرها النموذج من قبل. إعادة تحجيم "تضغط" المواضع إلى قيم مألوفة، لكن مع مقايضات حتمية: معامل قوي يكسر الجودة على المدخلات القصيرة، واحد محافظ يفشل مع تسلسلات طويلة حقاً. القيمة المثلى تعتمد على طول الطلب المحدد في وقت الاستدلال، ولا يمكن لأي ثابت التقاطها.
كيف يعمل Jet-Long
يقترح المؤلفون Dynamic Bifocal RoPE — نمطا معالجة متوازيين للتضمين الموضع داخل طبقة انتباه واحدة.
- النافذة المحلية — تحافظ على ترددات RoPE القياسية للمواضع القصيرة بحيث يتصرف النموذج بالضبط كما حدث أثناء التدريب
- النافذة البعيدة — تحجم الترددات ديناميكياً بناءً على طول التسلسل الحالي، وليس ثابت محدد مسبقاً
- دمج الإدراج والاستبعاد — يجمع المخرجات من كلا النافذتين دون عد الرموز مرتين
- دوران تصحيح RoPE في الوقت الفعلي — يزيل التحول الطوري أثناء الدمج
يتم تنفيذ البناء بالكامل في نواة CuTe واحدة لـ CUDA، مما يجعل الانتباه ثنائي البؤرة مجاني عملياً: لا توجد ممر GPU إضافي. يسرع Prefill إلى 1.39× من FlashAttention 2 على H100 — يقترب من FlashAttention 4، الذي يتطلب شرائح Hopper وغير متاح على بطاقات الرسومات الأقدم. لا تتجاوز الأحمال العامة أثناء الجيل 4٪ في أي طول السياق.
ما النتائج التي أظهرها Jet-Long في سياق 128K؟
تم اختبار الطريقة على عائلة Qwen3 — 1.7B و 4B و 8B معاملات — مع السياق يصل إلى 128K tokens.
- RULER: +4.79 pp لـ Qwen3-1.7B، +2.18 pp لـ 4B، +2.03 pp لـ 8B بالنسبة إلى أفضل طريقة منافسة
- HELMET-RAG: أفضل نتيجة عامة بين جميع الأساليب المقارنة (أبرز مؤلفو HELMET هذا الأداء كأدق مؤشر للأداء الفعلية في اتجاه السفر)
- تعقيد PG-19: الحد الأدنى بين جميع الطرق المختبرة
تم تعميم Jet-Long أيضاً على بنية Jet-Nemotron الهجينة مع طبقات انتباه كثيفة وقليلة متناوبة — وحقق مكاسب إضافية دون إعادة تدريب. يؤكد المؤلفون أن الطريقة لا تتطلب ضبط معامل المقياس اليدوي وتعمل "من الصندوق".
ماذا يعني هذا
يوفر Jet-Long طريقة عملية لتوسيع سياق نماذج الأوزان المفتوحة بدون ضبط دقيق وبطاقات رسومات خاصة ومعاملات يدوية. إذا أعادت الطريقة إنتاج على معماريات شعبية أخرى — Llama، Mistral، Gemma — فقد تصبح أداة قياسية في مكدس الاستدلال للمهام طويلة السياق: الأنظمة الوكيل وتحليل المستندات ومراجعة الأكواد على مستوى المستودع.
أسئلة مكررة
هل أحتاج إلى ضبط دقيق للنموذج من أجل Jet-Long؟
لا. Jet-Long هي طريقة zero-shot بدون ضبط: يكفي توصيلها بنقطة تفتيش موجودة دون أي عمليات تدريب إضافية.
تم اختبار Jet-Long على أي نماذج؟
في الورقة المسبقة من 10 يوليو 2026، تم اختبار Qwen3-1.7B و Qwen3-4B و Qwen3-8B ومعمارية Jet-Nemotron الهجينة. لم يتم توفير الاختبار على Llama أو Mistral أو غيرها من الأسر في الورقة.
هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟
أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.