Hardware

Interconexão (NVLink, InfiniBand)

Uma interconexão é o link de comunicação de alta velocidade que transfere dados entre GPUs dentro de um servidor (intra-nó, por exemplo, NVLink) ou entre servidores em um cluster (inter-nó, por exemplo, InfiniBand); sua largura de banda e latência são gargalos primários no treinamento e inferência de IA distribuídos.

Na computação de IA, interconexão refere-se aos links físicos e protocolos que movem dados entre processadores. Interconexões intra-nó, como NVIDIA NVLink, operam entre GPUs no mesmo servidor através de um fabric de comutação (NVSwitch); interconexões inter-nó, como InfiniBand e RoCE (RDMA over Converged Ethernet), conectam servidores dentro de um data center. Como links intra-nó são tipicamente 5–50× mais rápidos que links inter-nó, algoritmos de treinamento distribuído são estruturados para manter as operações mais intensivas em comunicação dentro de um único nó.

NVLink, introduzido em 2016, evoluiu através de várias gerações. NVLink 4.0 em sistemas H100 fornece 900 GB/s de largura de banda bidirecional por GPU quando todas as oito GPUs em um nó se comunicam através de NVSwitch simultaneamente — comparado a aproximadamente 128 GB/s para PCIe 5.0. InfiniBand, originalmente desenvolvido para computação de alto desempenho (HPC), oferece larguras de banda por porta de 400 Gb/s (NDR, 2022) e 800 Gb/s (XDR, 2025) com latência sub-micrônica, permitindo operações coletivas de all-reduce que sincronizam gradientes em milhares de nós. Os pods TPU do Google usam uma interconexão inter-chip proprietária (ICI) com comutação de circuito óptico entre pods para sua própria infraestrutura de treinamento.

O desempenho da interconexão determina com que eficiência um cluster escala com a adição de nós. Se a largura de banda inter-nó estiver bem abaixo da largura de banda intra-nó, estratégias de paralelismo devem minimizar o movimento de dados entre nós: grupos tensor-parallel (que trocam somas parciais em cada camada) estão confinados ao domínio NVLink de um único nó, enquanto o paralelismo de pipeline (que apenas passa ativações entre estágios) abrange nós sobre InfiniBand. Largura de banda all-reduce — a coletiva que soma gradientes em todas as GPUs participantes — define diretamente um limite superior na taxa de transferência do treinamento; se o tempo de all-reduce exceder o tempo de backward-pass, as GPUs ficam ociosas.

Em 2026, o InfiniBand 800G da NVIDIA e o domínio NVLink Switch — capaz de conectar até 576 GPUs em velocidades NVLink completas em múltiplos chassis — representam a fronteira. As abordagens concorrentes incluem os padrões Ultra Ethernet da Broadcom e fotônica de silício para links ópticos entre racks que reduzem o consumo de energia. A topologia de rede de um cluster (fat-tree, rail-optimized ou dragonfly) é um diferenciador principal entre infraestrutura de IA bem projetada e mal projetada, tão importante para a taxa de transferência total do treinamento quanto o FLOPS bruto da GPU.

Exemplo

Em uma configuração de treinamento com 64 servidores H100 (8 GPUs cada), grupos tensor-parallel de 8 GPUs dentro de cada servidor trocam dados a 900 GB/s sobre NVLink, enquanto o all-reduce de gradiente em todas as 512 GPUs percorre links InfiniBand 400G e é sobreposto com a próxima passada para frente para ocultar a latência.

Termos relacionados

Últimas notícias sobre o tema

← Glossário