arXiv cs.AI→ المصدر

Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency

Исследователи опубликовали на arXiv latency-aware роутер LLM-запросов. В отличие от обычной балансировки нагрузки, он оценивает время до первого токена (TTFT) и распределяет запросы с учётом задержки, точности и стоимости сразу. Итог — до 40% прироста accuracy-cost utility при тех же задержках, что у round-robin.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
Роутинг LLM-запросов с учётом задержки: +40% к accuracy-cost при тех же latency
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

في يوليو 2026، نشر باحثون على arXiv ورقة بحثية عن موجّه طلبات LLM يراعي زمن الاستجابة (latency-aware)، يعمل على تحسين مشترك لزمن الاستجابة والدقة والتكلفة، ويحقق تحسناً يصل إلى 40% في accuracy-cost utility عند نفس زمن الاستجابة الذي توفره موازنة الحمل القياسية.

ما الخلل في الموجّهات الحالية

تقتصر موجّهات طلبات LLM الحالية على موازنة جودة الإجابة والتكلفة المالية فقط، دون مراعاة زمن استجابة التوليد على نسخة (instance) محددة من النموذج. عملياً، تُدار زمن الاستجابة عبر سياسات موازنة حمل منفصلة — round-robin أو join-the-shortest-queue — وهي سياسات تتجاهل دقة النموذج وتكلفة الاستدلال (inference) في آن واحد. والنتيجة أن التوجيه وتوزيع الحمل يعملان بشكل أعمى كلٌ عن الآخر.

  • الهدف هو التحسين المشترك لثلاثة معايير: latency وaccuracy وcost
  • سياسات الموازنة الأساسية: round-robin، join-the-shortest-queue
  • التحسن في accuracy-cost utility: حتى 40%
  • يبقى زمن الاستجابة عند مستوى الأساليب القياسية
  • المصدر: نسخة أولية على arXiv (قسم cs.AI)، يوليو 2026

كيف يُقدَّر زمن استجابة الطلب

بنى الباحثون مُقدِّراً خفيفاً (lightweight) يحاكي المعالجة الدفعية (batch) الانحدارية الذاتية للرموز (tokens) في serving framework، ويتنبأ بـ TTFT (time-to-first-token) لكل طلب. تكمن الصعوبة في أن زمن الاستجابة لا يعتمد فقط على طول الـ prompt: بل يتأثر أيضاً بحمل الـ prefill والـ decode الحالي على نسخة النموذج، وكذلك بسياسة الجدولة (scheduling) والتجميع الدفعي (batching) الخاصة بالإطار (framework) نفسه. يأخذ المُقدِّر كل هذه العوامل بعين الاعتبار ويبقى رخيصاً بما يكفي للعمل في الزمن الحقيقي أثناء التوجيه.

لماذا يهم هذا

يدمج الموجّه latency-aware تقدير زمن الاستجابة مباشرة في قرار التوجيه، ويوزّع الطلبات على النسخ (instances) بحيث يبقي زمن الاستجابة والدقة والتكلفة تحت السيطرة في آن واحد. ووفقاً للباحثين، يرفع هذا التحسين المشترك accuracy-cost utility بنسبة تصل إلى 40%، دون الإضرار بزمن الاستجابة مقارنة بموازنة الحمل الاعتيادية.

«يوفر التحسين المشترك تحسناً يصل إلى 40% في accuracy-cost utility مع

الحفاظ على نفس زمن الاستجابة الذي توفره أساليب موازنة الحمل القياسية»، بحسب ملخص العمل البحثي على arXiv.

بالنسبة للخدمات التي توزّع إجابات عشرات النماذج تحت الحمل، فإن هذا يمثّل وسيلة لاستخراج جودة أكبر مقابل كل دولار يُنفَق، دون إجبار المستخدم على الانتظار لفترة أطول.

ما الذي يعنيه هذا

لم يعد توجيه طلبات LLM مجرد اختيار بين «أرخص أو أدق»، بل يضيف محوراً ثالثاً: السرعة. وهذا يمنح فرق البنية التحتية رافعة: نفس أسطول النماذج يقدّم قيمة أكبر دون زيادة في زمن الاستجابة ودون دفع مبالغ زائدة مقابل الاستدلال.

الأسئلة الشائعة

ما هو TTFT (time-to-first-token)؟

TTFT هو الوقت حتى ظهور أول رمز (token) من الإجابة، وهو مقياس أساسي لزمن الاستجابة في خدمات LLM. يتنبأ المُقدِّر الوارد في الورقة البحثية بـ TTFT لكل طلب من خلال محاكاة المعالجة الدفعية للرموز في serving framework.

إلى أي مدى يُعد التوجيه latency-aware أكثر فعالية من الموازنة الاعتيادية؟

وفقاً للباحثين، فإن التحسين المشترك لزمن الاستجابة والدقة والتكلفة يرفع accuracy-cost utility بنسبة تصل إلى 40% عند نفس زمن الاستجابة الذي توفره round-robin أو join-the-shortest-queue.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…