arXiv cs.AI→ original

Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости

Новое исследование на arXiv замерило, во сколько обходится конфиденциальный LLM-инференс. На одной NVIDIA H100 80GB в изолированной среде Intel TDX защищённый режим снижает глобальную пропускную способность на 17,7% для Mistral-7B и на 21,1% для Qwen3-30B-A3B. Время до первого токена растёт на 21,8–27,8%. Под нагрузкой разрыв держится в пределах 11,5–20,2%, но крупные модели упираются в потолок раньше.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

Des chercheurs ont publié sur arXiv en juillet 2026 un benchmark mesurant le coût du calcul confidentiel pour l'inférence des LLM : sur un seul GPU NVIDIA H100 80GB au sein d'un environnement isolé Intel TDX, le mode confidentiel réduit le débit global de 17,7 à 21,1 % et ralentit la génération du premier token de 21,8 à 27,8 %.

Qu'a-t-on mesuré exactement

Les auteurs ont comparé deux modes d'exécution sur un même GPU NVIDIA H100 80GB, hébergé dans une instance confidentielle Intel TDX : normal (non confidentiel) et protégé (confidential computing). Pour le test, ils ont pris deux modèles de langage représentatifs — Mistral-7B v0.1 et Qwen3-30B-A3B — et mesuré cinq métriques : le temps jusqu'au premier token (TTFT), la latence de bout en bout de la requête, la vitesse de génération de tokens, le débit global et le nombre de requêtes servies à mesure que la concurrence augmente.

  • Matériel — un NVIDIA H100 80GB dans une instance confidentielle Intel TDX
  • Modèles — Mistral-7B v0.1 et Qwen3-30B-A3B
  • Le TTFT augmente de 21,8 % (Mistral-7B) et de 27,8 % (Qwen3-30B-A3B)
  • Le débit global chute de 17,7 % et 21,1 %
  • Sous charge concurrente, l'écart est de 11,5–20,2 %

De combien la performance chute-t-elle ?

Dans des expériences à intensité de requêtes fixe, le mode confidentiel a augmenté le temps moyen jusqu'au premier token de 21,8 % pour Mistral-7B et de 27,8 % pour le plus grand Qwen3-30B-A3B. Le débit global en tokens a quant à lui chuté de 17,7 % et 21,1 % respectivement.

L'écart est plus marqué pour le grand modèle : plus le réseau déployé est grand, plus l'isolation des calculs coûte cher. Selon l'étude, ce surcoût provient du chiffrement de la mémoire et des échanges de données protégés entre le CPU et le GPU au sein de l'environnement de confiance.

Pourquoi c'est important pour la planification de capacité

Sous une charge concurrente croissante (closed-loop), l'écart de débit reste dans la fourchette de 11,5–20,2 %, mais le plus grand Qwen3-30B-A3B atteint plus tôt son point de saturation en mode confidentiel. Autrement dit, un même serveur en mode confidentiel servira moins d'utilisateurs simultanés avant que les latences ne commencent à grimper brutalement.

« L'inférence GPU confidentielle conserve un débit exploitable sous

charge, mais la planification de capacité doit tenir compte à la fois d'une pénalité de performance constante et d'une saturation plus précoce des grands modèles », indique l'article publié sur arXiv.

Ce que cela signifie

Le calcul confidentiel cesse d'être une théorie pour devenir une exigence pratique pour l'inférence sur des données sensibles ou des modèles propriétaires. Le coût de la confidentialité — environ un cinquième du débit — est mesurable et, selon les conclusions des auteurs, acceptable si on l'intègre à l'avance dans le calcul des capacités.

Questions fréquentes

Qu'est-ce que l'inférence GPU confidentielle ?

C'est un mode dans lequel les données d'entrée et les poids du modèle restent chiffrés et inaccessibles même à l'opérateur du serveur. Il est nécessaire lorsque l'inférence porte sur des données sensibles ou protège des modèles propriétaires contre les fuites — exactement le scénario testé par les auteurs sur NVIDIA H100 sous Intel TDX.

Quelle est la perte de performance des LLM en mode confidentiel ?

Selon les mesures publiées sur arXiv, le débit global chute de 17,7 à 21,1 %, tandis que le temps jusqu'au premier token augmente de 21,8 à 27,8 %. Sous charge concurrente, l'écart reste compris entre 11,5 et 20,2 %, les grands modèles atteignant le plafond plus tôt.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…