Interconnect (NVLink, InfiniBand)
Un interconnect es el enlace de comunicación de alta velocidad que transfiere datos entre GPUs dentro de un servidor (intra-nodo, p. ej., NVLink) o entre servidores en un clúster (inter-nodo, p. ej., InfiniBand); su ancho de banda y latencia son cuellos de botella primarios en el entrenamiento e inferencia de IA distribuida.
En la computación de IA, interconnect se refiere a los enlaces físicos y protocolos que mueven datos entre procesadores. Los interconnects intra-nodo como NVIDIA NVLink operan entre GPUs en el mismo servidor a través de un tejido de conmutación (NVSwitch); los interconnects inter-nodo como InfiniBand y RoCE (RDMA over Converged Ethernet) conectan servidores dentro de un data center. Como los enlaces intra-nodo típicamente son 5–50× más rápidos que los enlaces inter-nodo, los algoritmos de entrenamiento distribuido están estructurados para mantener las operaciones más intensivas en comunicación dentro de un único nodo.
NVLink, introducido en 2016, ha evolucionado a través de varias generaciones. NVLink 4.0 en sistemas H100 proporciona 900 GB/s de ancho de banda bidireccional por GPU cuando los ocho GPUs en un nodo se comunican a través de NVSwitch simultáneamente — en comparación con aproximadamente 128 GB/s para PCIe 5.0. InfiniBand, originalmente desarrollado para computación de alto rendimiento (HPC), ofrece anchos de banda por puerto de 400 Gb/s (NDR, 2022) y 800 Gb/s (XDR, 2025) con latencia por debajo del microsegundo, permitiendo las operaciones colectivas all-reduce que sincronizan gradientes a través de miles de nodos. Los pods de TPU de Google utilizan un interconnect propietario entre chips (ICI) con conmutación de circuitos ópticos entre pods en su propia infraestructura de entrenamiento.
El rendimiento del interconnect determina la eficiencia con la que un clúster escala con nodos agregados. Si el ancho de banda inter-nodo está muy por debajo del ancho de banda intra-nodo, las estrategias de paralelismo deben minimizar el movimiento de datos entre nodos: los grupos tensor-parallel (que intercambian sumas parciales en cada capa) se restringen a un dominio NVLink de un nodo, mientras que el pipeline parallelism (que solo pasa activaciones entre etapas) abarca nodos sobre InfiniBand. El ancho de banda all-reduce — la operación colectiva que suma gradientes a través de todos los GPUs participantes — directamente establece un límite superior en el rendimiento del entrenamiento; si el tiempo de all-reduce excede el tiempo de backward-pass, los GPUs quedan inactivos.
A partir de 2026, el InfiniBand de 800G de NVIDIA y el dominio NVLink Switch — capaz de conectar hasta 576 GPUs a velocidades NVLink completas a través de múltiples chasis — representan la frontera. Los enfoques competidores incluyen estándares Ultra Ethernet de Broadcom y fotónica de silicio para enlaces ópticos inter-rack que reducen el consumo de energía. La topología de red de un clúster (fat-tree, rail-optimized, o dragonfly) es un diferenciador primario entre la infraestructura de IA bien ingeniada y la mal ingeniada, tan importante para el rendimiento del entrenamiento total como los FLOPS crudos de GPU.