Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости
Новое исследование на arXiv замерило, во сколько обходится конфиденциальный LLM-инференс. На одной NVIDIA H100 80GB в изолированной среде Intel TDX защищённый режим снижает глобальную пропускную способность на 17,7% для Mistral-7B и на 21,1% для Qwen3-30B-A3B. Время до первого токена растёт на 21,8–27,8%. Под нагрузкой разрыв держится в пределах 11,5–20,2%, но крупные модели упираются в потолок раньше.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Pesquisadores publicaram no arXiv em julho de 2026 um benchmark que mediu o custo da computação confidencial para a inferência de LLMs: em uma única GPU NVIDIA H100 80GB dentro de um ambiente isolado Intel TDX, o modo confidencial reduz o throughput global em 17,7–21,1% e torna a entrega do primeiro token 21,8–27,8% mais lenta.
O que exatamente foi medido
Os autores compararam dois modos de execução em uma mesma GPU NVIDIA H100 80GB, hospedada em uma instância confidencial Intel TDX: normal (não confidencial) e protegido (confidential computing). Para o teste, foram usados dois modelos de linguagem representativos — Mistral-7B v0.1 e Qwen3-30B-A3B — e medidas cinco métricas: tempo até o primeiro token (TTFT), latência ponta a ponta da requisição, velocidade de geração de tokens, throughput global e número de requisições atendidas com o aumento da concorrência.
- Hardware — uma NVIDIA H100 80GB em uma instância confidencial Intel TDX
- Modelos — Mistral-7B v0.1 e Qwen3-30B-A3B
- O TTFT aumenta 21,8% (Mistral-7B) e 27,8% (Qwen3-30B-A3B)
- O throughput global cai 17,7% e 21,1%
- Sob carga concorrente a diferença é de 11,5–20,2%
Quanto a performance cai?
Em experimentos com intensidade fixa de requisições, o modo confidencial aumentou o tempo médio até o primeiro token em 21,8% para o Mistral-7B e em 27,8% para o maior Qwen3-30B-A3B. O throughput global em tokens, por sua vez, caiu 17,7% e 21,1%, respectivamente.
A diferença é mais perceptível no modelo maior: quanto maior a rede implantada, mais cara fica o isolamento computacional. Segundo o estudo, o overhead vem da criptografia de memória e da troca protegida de dados entre CPU e GPU dentro do ambiente confiável.
Por que isso importa para o planejamento de capacidade
Sob carga concorrente crescente (closed-loop), a diferença de throughput permanece na faixa de 11,5–20,2%, mas o maior Qwen3-30B-A3B atinge antes o ponto de saturação em modo confidencial. Ou seja, o mesmo servidor em modo confidencial atenderá menos usuários simultâneos antes que a latência comece a subir bruscamente.
"A inferência confidencial em GPU preserva um throughput utilizável
sob carga, mas o planejamento de capacidade precisa considerar tanto a penalidade constante de desempenho quanto a saturação mais precoce de modelos maiores", afirma o artigo no arXiv.
O que isso significa
A computação confidencial deixa de ser teoria e passa a ser um requisito prático para inferência sobre dados sensíveis ou modelos proprietários. O custo da privacidade — cerca de um quinto do throughput — é mensurável e, segundo as conclusões dos autores, aceitável se for previamente considerado no planejamento de capacidade.
Perguntas frequentes
O que é inferência confidencial em GPU?
É um modo em que os dados de entrada e os pesos do modelo permanecem criptografados e inacessíveis até mesmo para o operador do servidor. É necessário quando a inferência é feita sobre dados sensíveis ou protege modelos proprietários contra vazamento — exatamente o cenário que os autores testaram na NVIDIA H100 sob Intel TDX.
Quanto de performance o LLM perde em modo confidencial?
Segundo as medições no arXiv, o throughput global cai 17,7–21,1%, enquanto o tempo até o primeiro token aumenta 21,8–27,8%. Sob carga concorrente a diferença fica entre 11,5–20,2%, e os modelos maiores atingem o limite antes.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.