NVIDIA Developer Blog→ المصدر

NVIDIA TensorRT يحوّل نقاط تحقق FP8 إلى محركات للاستدلال السريع

أصدرت NVIDIA دليلًا مفصلًا لتحويل نقاط تحقق مكمّمة بـ FP8 إلى محركات TensorRT — وهي المرحلة الأخيرة قبل النشر في بيئة الإنتاج. يقلّص التكميم أوزان النموذج إلى النصف، بينما يعيد TensorRT بناء الرسم البياني للحوسبة ليتوافق مع GPU محدد. معًا، يحققان تسريعًا للاستدلال بمقدار 2–4 مرات مع الحفاظ على الدقة نفسها. ويستند الشرح إلى نموذج CLIP من خطوط الأنابيب القائمة على diffusion.

معالج بواسطة الذكاء الاصطناعي من NVIDIA Developer Blog؛ بتحرير Hamidun News
NVIDIA TensorRT يحوّل نقاط تحقق FP8 إلى محركات للاستدلال السريع
المصدر: NVIDIA Developer Blog. كولاج: Hamidun News.
◐ استمع للمقال

نشرت NVIDIA دليلا مفصلا عن تحويل نقاط التحقق الكمية FP8 إلى محركات TensorRT — الخطوة الأخيرة التي تحدد السرعة الفعلية والتكلفة الفعلية للاستدلال في الإنتاج.

لماذا هذه الخطوة مطلوبة

تكميم النموذج هو نصف العمل فقط. بعد أن يتم ضغط الأوزان من دقة 16 بت إلى 8 بت، يتم تخزين ملف نقطة التحقق في تنسيق محسّن، لكن وحدة معالجة الرسومات لا يمكنها التعامل معها مباشرة. هناك حاجة إلى خطوة إضافية: التجميع إلى محرك متخصص. يأخذ TensorRT رسم البياني الحسابي الكمي ويعيد هيكلته لأجهزة معينة. يجمع بين العمليات المتوافقة (دمج الطبقة)، ويختار أكثر أنوية CUDA فعالية لكل عملية، وينصب الذاكرة مسبقا. والنتيجة هي ملف `.engine` مضغوط محسّن لوحدة معالجة رسومات محددة وإصدار CUDA.

ما الذي يوفره FP8 + TensorRT

FP8 — تنسيق نقطة عائمة بثمانية بت — أصبح المعيار الفعلي لتكميم بطاقات معمارية Hopper (H100) و Ada Lovelace (RTX 4090). المميزات مقابل FP16:

  • نصف ذاكرة الفيديو لأوزان النموذج
  • ضعف إنتاجية عمليات المصفوفة على أنوية tensor
  • فقدان دقة أقل بكثير مقارنة بـ INT8
  • دعم على مستوى الأجهزة — لا توجد محاكاة برمجية مطلوبة

عندما يتم تجميع نموذج FP8 في محرك TensorRT، تتضاعف الآثار. يلاحظ مهندسو NVIDIA تسارع الاستدلال بـ 2-4x مقارنة بقاعدة FP16 على PyTorch مع مقاييس دقة قابلة للمقارنة.

CLIP كمثال تعليمي

يتم بناء الدليل على مثال نموذج CLIP (Contrastive Language-Image Pretraining) — محرر مزدوج يربط الأوصاف النصية بالصور. CLIP هو جزء من معظم خطوط الأنابيب الانتشارية: Stable Diffusion و FLUX وما شابهها. تؤثر سرعة تنفيذه بشكل مباشر على وقت توليد كل صورة.

"ننتج نقطة تحقق CLIP كمية عالية الجودة باستخدام

TensorRT Model Optimizer، ثم نحولها إلى محرك استدلال كامل", يصف مهندسو NVIDIA الهدف من الدليل.

من الناحية الفنية، تبدو العملية كما يلي: تحميل نقطة التحقق عبر API TensorRT Model Optimizer، تتبع رسم البياني ONNX، ثم التجميع عبر الأداة `trtexec` أو ربط Python. يكرر TensorRT تلقائيا عبر التكتيكات لكل طبقة ويختار الأسرع. تستغرق هذه العملية عدة دقائق، لكن يتم تخزين النتيجة وعدم إعادة حسابها.

قيد مهم: ملف `.engine` مرتبط بوحدة معالجة رسومات محددة وإصدار CUDA. لن يعمل محرك مترجم لـ H100 على A100 أو RTX 4090. للعناقيد غير المتجانسة، يجب بناء محركات منفصلة لكل نوع مسرع — يجب أخذ هذا في الاعتبار في خط أنابيب CI/CD للنشر.

ما معنى هذا

تصبح مجموعة TensorRT + FP8 المعيار لنشر الإنتاج للنماذج الكبيرة. التسارع بـ 2-4x على وحدة معالجة رسومات واحدة هو إما توفير مباشر على عنقود أو القدرة على خدمة ضعف عدد المستخدمين على نفس الأجهزة. يقلل دليل NVIDIA من حاجز الدخول: الآن هذا ليس إكزوتيكا خبيرة بل عملية موثقة مع كود جاهز.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…