arXiv cs.AI→ المصدر

Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости

Новое исследование на arXiv замерило, во сколько обходится конфиденциальный LLM-инференс. На одной NVIDIA H100 80GB в изолированной среде Intel TDX защищённый режим снижает глобальную пропускную способность на 17,7% для Mistral-7B и на 21,1% для Qwen3-30B-A3B. Время до первого токена растёт на 21,8–27,8%. Под нагрузкой разрыв держится в пределах 11,5–20,2%, но крупные модели упираются в потолок раньше.

معالج بواسطة الذكاء الاصطناعي من arXiv cs.AI؛ بتحرير Hamidun News
Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости
المصدر: arXiv cs.AI. كولاج: Hamidun News.
◐ استمع للمقال

نشر باحثون على arXiv في يوليو 2026 معيارًا قياسيًا (بنشمارك) قاس تكلفة الحوسبة السرية لاستدلال نماذج اللغة الكبيرة (LLM): على بطاقة NVIDIA H100 80GB واحدة داخل بيئة معزولة من Intel TDX، يخفض الوضع السري الإنتاجية الإجمالية بنسبة 17.7–21.1% ويبطئ ظهور الرمز الأول بنسبة 21.8–27.8%.

ما الذي تم قياسه بالضبط

قارن الباحثون بين وضعي تشغيل على نفس معالج NVIDIA H100 80GB المستضاف في نسخة سرية (instance) من Intel TDX: الوضع العادي (non-confidential) والوضع المحمي (confidential computing). لأجل الاختبار، استُخدم نموذجا لغة تمثيليان — Mistral-7B v0.1 وQwen3-30B-A3B — وتم قياس خمسة مقاييس: الزمن حتى ظهور الرمز الأول (TTFT)، زمن الاستجابة الكلي للطلب من طرف إلى طرف، سرعة توليد الرموز، الإنتاجية الإجمالية، وعدد الطلبات المخدومة مع ازدياد التزامن.

  • العتاد — بطاقة NVIDIA H100 80GB واحدة في نسخة سرية من Intel TDX
  • النماذج — Mistral-7B v0.1 وQwen3-30B-A3B
  • يرتفع TTFT بنسبة 21.8% (Mistral-7B) و27.8% (Qwen3-30B-A3B)
  • تنخفض الإنتاجية الإجمالية بنسبة 17.7% و21.1%
  • تحت الحمل التنافسي، تتراوح الفجوة بين 11.5–20.2%

إلى أي مدى ينخفض الأداء؟

في التجارب ذات شدة الطلبات الثابتة، رفع الوضع السري متوسط الزمن حتى ظهور الرمز الأول بنسبة 21.8% لنموذج Mistral-7B وبنسبة 27.8% لنموذج Qwen3-30B-A3B الأكبر حجمًا. وفي الوقت نفسه، انخفضت الإنتاجية الإجمالية بالرموز بنسبة 17.7% و21.1% على التوالي.

الفجوة أكثر وضوحًا في النموذج الأكبر: فكلما كانت الشبكة المنشورة أكبر، كانت عزلة الحوسبة أكثر تكلفة. وبحسب الدراسة، ينشأ هذا العبء الإضافي من تشفير الذاكرة وتبادل البيانات المحمي بين المعالج المركزي (CPU) ومعالج الرسوميات (GPU) داخل البيئة الموثوقة.

لماذا يهم هذا تخطيط السعة

تحت الحمل التنافسي المتزايد (closed-loop)، تبقى الفجوة في الإنتاجية ضمن نطاق 11.5–20.2%، لكن نموذج Qwen3-30B-A3B الأكبر يصل إلى نقطة التشبع بشكل أبكر في الوضع السري. أي أن الخادم نفسه في الوضع السري سيخدم عددًا أقل من المستخدمين المتزامنين قبل أن يبدأ زمن الاستجابة بالارتفاع بشكل حاد.

«يحافظ الاستدلال السري على وحدة معالجة الرسوميات (GPU) على إنتاجية

قابلة للاستخدام تحت الحمل، لكن تخطيط السعة يجب أن يأخذ بعين الاعتبار كلًا من العقوبة الدائمة في الأداء والتشبع الأبكر للنماذج الكبيرة»، بحسب ما ورد في الورقة البحثية على arXiv.

ماذا يعني ذلك

لم تعد الحوسبة السرية مجرد نظرية، بل باتت متطلبًا عمليًا للاستدلال على البيانات الحساسة أو النماذج المملوكة. وتكلفة الخصوصية — نحو خُمس الإنتاجية — قابلة للقياس، وبحسب استنتاجات الباحثين، مقبولة إذا ما أُدرجت مسبقًا في حساب السعة.

الأسئلة الشائعة

ما هو الاستدلال السري على وحدة معالجة الرسوميات (GPU)؟

هو وضع تبقى فيه بيانات الإدخال وأوزان النموذج مشفّرة وغير قابلة للوصول حتى بالنسبة لمشغّل الخادم. وهو ضروري عندما يتم الاستدلال على بيانات حساسة أو لحماية النماذج المملوكة من التسرب — وهو بالضبط السيناريو الذي اختبره الباحثون على NVIDIA H100 تحت Intel TDX.

كم يخسر أداء نماذج اللغة الكبيرة في الوضع السري؟

بحسب القياسات المنشورة على arXiv، تنخفض الإنتاجية الإجمالية بنسبة 17.7–21.1%، بينما يرتفع الزمن حتى ظهور الرمز الأول بنسبة 21.8–27.8%. وتحت الحمل التنافسي، تبقى الفجوة ضمن حدود 11.5–20.2%، مع وصول النماذج الأكبر إلى السقف بشكل أبكر.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…