Hugging Face Blog→ المصدر

Hugging Face: الواجهة الخلفية لـ transformers في vLLM تعمل الآن بالسرعة الأصلية

في 8 يوليو 2026، أعلنت Hugging Face عن تكافؤ أداء الواجهة الخلفية لـ transformers في vLLM: يكفي خيار واحد `--model-impl transformers` كي لا يتأخر الاستدلال عن التنفيذات الأصلية. وفي الاختبار على ثلاثة نماذج Qwen3 — 4B (1 GPU)، و32B (2 GPU)، و235B MoE على 8×H100 — كان الأداء في كل الحالات عند المستوى نفسه أو أفضل. ويجري دعم أكثر من 450 بنية، مع الحفاظ على إمكانية fine-tuning.

معالج بواسطة الذكاء الاصطناعي من Hugging Face Blog؛ بتحرير Hamidun News
Hugging Face: الواجهة الخلفية لـ transformers في vLLM تعمل الآن بالسرعة الأصلية
المصدر: Hugging Face Blog. كولاج: Hamidun News.
◐ استمع للمقال

في 8 يوليو 2026، نشرت Hugging Face نتائج المقاييس على مدونتها الرسمية: backend مكتبة transformers في vLLM الآن يطابق تماماً تطبيقات vLLM الأصلية في الأداء للعمارات المتوافقة — يحتاج المطورون فقط إلى إضافة علم واحد `--model-impl transformers` عند تشغيل الخادم، بدون تغييرات البنية التحتية.

ما الذي تغير للمطورين

في السابق، كان الاستدلال عالي الأداء في vLLM يتطلب تطبيقات "يدوية" منفصلة لكل عمارة. كانت نسخة البحث من نموذج في transformers ونسختها الإنتاجية في vLLM تتباعد وتتطلب مزامنة قاعدتي كود مع كل تحديث عمارة.

الآن تقوم مكتبة transformers بترجمة تلقائية إلى نوى vLLM المحسّنة عبر `torch.fx` (تحليل الرسم البياني الثابت) ومعالجات AST لإعادة كتابة العمليات. تحت الغطاء، يبني النظام رسم بياني للحساب، ويبحث عن أنماط للاستبدال بنواة محسّنة واحدة، وللنماذج ذات توازي الموتر يدمج بالإضافة إلى ذلك طبقات متوازية العمود وQKV.

الحقائق الرئيسية:

  • التاريخ: 8 يوليو 2026، المدونة الرسمية لـ Hugging Face
  • علم الإطلاق: `--model-impl transformers` في أمر `vllm serve`
  • نماذج الاختبار: Qwen3-4B (1 GPU)، Qwen3-32B (2 GPU، توازي الموتر)، Qwen3-235B MoE FP8 (8×H100)
  • النتيجة: backend يساوي أو يتفوق على vLLM الأصلي في الإنتاجية
  • التوافق: `torch.compile`، CUDA Graphs، دعم التدريب (غائب في تطبيقات vLLM الأصلية)
  • الغطاء: 450+ عمارة في مكتبة transformers

كيفية إجراء الاختبار عملياً

قيّمت Hugging Face ثلاث تكوينات Qwen3، متصاعدة في التعقيد: Qwen3-4B على GPU واحد، Qwen3-32B مع توازي الموتر على معالجين GPU، و Qwen3-235B بصيغة FP8 مع عمارة Mixture-of-Experts على ثمانية H100 مع توازي البيانات وتوازي الخبير المتزامن. على جميع التكوينات الثلاثة، أظهر backend transformers إنتاجية مساوية أو أعلى من vLLM الأصلي.

"يمكن للمطورين الآن الحصول على الاستدلال السريع جداً لـ vLLM مجاناً"، — من المدونة الرسمية لـ

Hugging Face.

ميزة مهمة على تطبيقات vLLM الأصلية: يحافظ backend transformers على دعم التدريب. تم تصميم تطبيقات vLLM الأصلية حصرياً للاستدلال — كانت الفرق التي تحتاج إلى كل من الضبط الدقيق والخدمة عالية الأداء تضطر سابقاً إلى الحفاظ على مسارات كود منفصلة.

لماذا هذا مهم للنظام البيئي

تعمل مكتبة transformers كتطبيق مرجعي لـ 450+ عمارة وهي مدمجة في SGLang و MLX و llama.cpp. يزيل الماثلية مع vLLM الأصلي أحد الحجج الرئيسية ضد استخدامها في الإنتاج — الحاجة إلى إعادة كتابة النماذج لمحرك خدمة معين. هذا مهم بشكل خاص في سياق التجزئة: كان كل محرك يتطلب سابقاً تطبيقه الخاص.

يقصر المسار من نشر نموذج جديد على Hugging Face Hub إلى نشر عالي الأداء بشكل كبير. لا يحتاج المطورون بعد الآن إلى انتظار فريق vLLM لإضافة دعم العمارة الأصلي — علم واحد وتطبيق متوافق من transformers كافٍ. هذا مهم بشكل خاص للباحثين المستقلين والفرق الصغيرة بدون موارد لكتابة والحفاظ على تطبيقات vLLM منفصلة.

القيود الحالية: النماذج ذات الانتباه الخطي لم تكن مدعومة حتى الآن؛ النماذج المخصصة من مستودعات Hub قد تواجه مشاكل التوافق.

ما يعنيه هذا

اختفت الحاجز بين كود البحث في transformers والاستدلال الإنتاجي في vLLM عملياً. ما كان يتطلب سابقاً تحسين يدوي لكل محرك يتم الآن تحقيقه بعلم سطر أوامر واحد — انخفاض مباشر في تكاليف الهندسة للفرق التي تطور وتنشر نماذج اللغة الكبيرة.

أسئلة شائعة

ما النماذج التي يدعمها backend الجديد؟

يدعم backend 450+ عمارة من مكتبة transformers. تم الاختبار على Qwen3-4B و Qwen3-32B و Qwen3-235B MoE FP8. النماذج ذات الانتباه الخطي غير مدعومة في الإصدار الحالي؛ النماذج المخصصة من Hub قد تتطلب التحقق من التوافق.

كيف أقوم بتشغيل vLLM مع backend transformers؟

لـ GPU واحد: `vllm serve Qwen/Qwen3-4B --model-impl transformers`. لـ عدة GPU: `vllm serve Qwen/Qwen3-32B --model-impl transformers --tensor-parallel-size 2`. لا توجد تغييرات بنية تحتية أخرى مطلوبة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…