arXiv cs.AI→ original

Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости

Новое исследование на arXiv замерило, во сколько обходится конфиденциальный LLM-инференс. На одной NVIDIA H100 80GB в изолированной среде Intel TDX защищённый режим снижает глобальную пропускную способность на 17,7% для Mistral-7B и на 21,1% для Qwen3-30B-A3B. Время до первого токена растёт на 21,8–27,8%. Под нагрузкой разрыв держится в пределах 11,5–20,2%, но крупные модели упираются в потолок раньше.

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

Investigadores publicaron en arXiv en julio de 2026 un benchmark que midió el costo de la computación confidencial para la inferencia de LLM: en una sola GPU NVIDIA H100 80GB dentro de un entorno aislado Intel TDX, el modo confidencial reduce el rendimiento global en un 17,7–21,1% y ralentiza la entrega del primer token en un 21,8–27,8%.

Qué se midió exactamente

Los autores compararon dos modos de ejecución en una misma GPU NVIDIA H100 80GB, alojada en una instancia confidencial Intel TDX: normal (no confidencial) y protegido (confidential computing). Para la prueba tomaron dos modelos de lenguaje representativos — Mistral-7B v0.1 y Qwen3-30B-A3B — y midieron cinco métricas: tiempo hasta el primer token (TTFT), latencia de extremo a extremo de la solicitud, velocidad de generación de tokens, rendimiento global y número de solicitudes atendidas a medida que aumenta la concurrencia.

  • Hardware — una NVIDIA H100 80GB en una instancia confidencial Intel TDX
  • Modelos — Mistral-7B v0.1 y Qwen3-30B-A3B
  • El TTFT aumenta un 21,8% (Mistral-7B) y un 27,8% (Qwen3-30B-A3B)
  • El rendimiento global cae un 17,7% y un 21,1%
  • Bajo carga concurrente la brecha es de 11,5–20,2%

¿Cuánto cae el rendimiento?

En experimentos con intensidad de solicitudes fija, el modo confidencial aumentó el tiempo promedio hasta el primer token en un 21,8% para Mistral-7B y en un 27,8% para la Qwen3-30B-A3B, de mayor tamaño. El rendimiento global en tokens, por su parte, cayó un 17,7% y un 21,1% respectivamente.

La brecha es más notoria en el modelo grande: cuanto más grande es la red desplegada, más costosa resulta la aislación del cómputo. Según el estudio, el overhead se compone del cifrado de memoria y del intercambio protegido de datos entre la CPU y la GPU dentro del entorno de confianza.

Por qué esto importa para la planificación de capacidad

Bajo una carga concurrente creciente (closed-loop), la brecha de rendimiento se mantiene en el rango de 11,5–20,2%, pero la Qwen3-30B-A3B, de mayor tamaño, alcanza antes su punto de saturación en modo confidencial. Es decir, un mismo servidor en modo confidencial atenderá a menos usuarios simultáneos antes de que las latencias empiecen a subir bruscamente.

«La inferencia confidencial en GPU conserva un rendimiento utilizable

bajo carga, pero la planificación de capacidad debe tener en cuenta tanto la penalización constante de rendimiento como la saturación más temprana de los modelos grandes», señala el artículo en arXiv.

Qué significa esto

La computación confidencial deja de ser teoría y se convierte en un requisito práctico para la inferencia sobre datos sensibles o modelos propietarios. El costo de la privacidad —alrededor de una quinta parte del rendimiento— es medible y, según las conclusiones de los autores, aceptable si se incorpora de antemano en el cálculo de capacidad.

Preguntas frecuentes

¿Qué es la inferencia confidencial en GPU?

Es un modo en el que los datos de entrada y los pesos del modelo permanecen cifrados e inaccesibles incluso para el operador del servidor. Es necesario cuando la inferencia se ejecuta sobre datos sensibles o protege modelos propietarios de filtraciones — precisamente el escenario que probaron los autores en NVIDIA H100 bajo Intel TDX.

¿Cuánto rendimiento pierde un LLM en modo confidencial?

Según las mediciones en arXiv, el rendimiento global cae un 17,7–21,1%, mientras que el tiempo hasta el primer token aumenta un 21,8–27,8%. Bajo carga concurrente la brecha se mantiene entre 11,5–20,2%, y los modelos más grandes alcanzan el límite antes.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…