arXiv cs.AI→ original

Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости

Новое исследование на arXiv замерило, во сколько обходится конфиденциальный LLM-инференс. На одной NVIDIA H100 80GB в изолированной среде Intel TDX защищённый режим снижает глобальную пропускную способность на 17,7% для Mistral-7B и на 21,1% для Qwen3-30B-A3B. Время до первого токена растёт на 21,8–27,8%. Под нагрузкой разрыв держится в пределах 11,5–20,2%, но крупные модели упираются в потолок раньше.

Processado por IA de arXiv cs.AI; editado por Hamidun News
Конфиденциальный инференс на NVIDIA H100 под Intel TDX: приватность стоит 17–21% скорости
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores publicaram no arXiv em julho de 2026 um benchmark que mediu o custo da computação confidencial para a inferência de LLMs: em uma única GPU NVIDIA H100 80GB dentro de um ambiente isolado Intel TDX, o modo confidencial reduz o throughput global em 17,7–21,1% e torna a entrega do primeiro token 21,8–27,8% mais lenta.

O que exatamente foi medido

Os autores compararam dois modos de execução em uma mesma GPU NVIDIA H100 80GB, hospedada em uma instância confidencial Intel TDX: normal (não confidencial) e protegido (confidential computing). Para o teste, foram usados dois modelos de linguagem representativos — Mistral-7B v0.1 e Qwen3-30B-A3B — e medidas cinco métricas: tempo até o primeiro token (TTFT), latência ponta a ponta da requisição, velocidade de geração de tokens, throughput global e número de requisições atendidas com o aumento da concorrência.

  • Hardware — uma NVIDIA H100 80GB em uma instância confidencial Intel TDX
  • Modelos — Mistral-7B v0.1 e Qwen3-30B-A3B
  • O TTFT aumenta 21,8% (Mistral-7B) e 27,8% (Qwen3-30B-A3B)
  • O throughput global cai 17,7% e 21,1%
  • Sob carga concorrente a diferença é de 11,5–20,2%

Quanto a performance cai?

Em experimentos com intensidade fixa de requisições, o modo confidencial aumentou o tempo médio até o primeiro token em 21,8% para o Mistral-7B e em 27,8% para o maior Qwen3-30B-A3B. O throughput global em tokens, por sua vez, caiu 17,7% e 21,1%, respectivamente.

A diferença é mais perceptível no modelo maior: quanto maior a rede implantada, mais cara fica o isolamento computacional. Segundo o estudo, o overhead vem da criptografia de memória e da troca protegida de dados entre CPU e GPU dentro do ambiente confiável.

Por que isso importa para o planejamento de capacidade

Sob carga concorrente crescente (closed-loop), a diferença de throughput permanece na faixa de 11,5–20,2%, mas o maior Qwen3-30B-A3B atinge antes o ponto de saturação em modo confidencial. Ou seja, o mesmo servidor em modo confidencial atenderá menos usuários simultâneos antes que a latência comece a subir bruscamente.

"A inferência confidencial em GPU preserva um throughput utilizável

sob carga, mas o planejamento de capacidade precisa considerar tanto a penalidade constante de desempenho quanto a saturação mais precoce de modelos maiores", afirma o artigo no arXiv.

O que isso significa

A computação confidencial deixa de ser teoria e passa a ser um requisito prático para inferência sobre dados sensíveis ou modelos proprietários. O custo da privacidade — cerca de um quinto do throughput — é mensurável e, segundo as conclusões dos autores, aceitável se for previamente considerado no planejamento de capacidade.

Perguntas frequentes

O que é inferência confidencial em GPU?

É um modo em que os dados de entrada e os pesos do modelo permanecem criptografados e inacessíveis até mesmo para o operador do servidor. É necessário quando a inferência é feita sobre dados sensíveis ou protege modelos proprietários contra vazamento — exatamente o cenário que os autores testaram na NVIDIA H100 sob Intel TDX.

Quanto de performance o LLM perde em modo confidencial?

Segundo as medições no arXiv, o throughput global cai 17,7–21,1%, enquanto o tempo até o primeiro token aumenta 21,8–27,8%. Sob carga concorrente a diferença fica entre 11,5–20,2%, e os modelos maiores atingem o limite antes.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…