Hardware

Data center de IA

Un data center de IA es una instalación propósito-construida o fuertemente modificada para alojar clústeres de GPU y aceleradores, diseñada específicamente para manejar la densidad de potencia extrema, demandas de enfriamiento, y redes de alto ancho de banda que las cargas de trabajo de entrenamiento e inferencia de IA a gran escala requieren.

Los data centers convencionales están diseñados alrededor de servidores que consumen 5–15 kW por rack. Un rack de ocho GPUs H100 consume 60–80 kW, y los sistemas acelerador de próxima generación empujan más allá de 100–150 kW por rack, requiriendo infraestructura fundamentalmente diferente. Los data centers de IA despliegan enfriamiento líquido directo — placas frías en GPUs y CPUs, intercambiadores de calor de puerta trasera, o tanques de inmersión completa — junto con distribución de energía de alta capacidad y diseños de instalación que priorizan la densidad térmica sobre la eficiencia del área de piso. Un clúster de 30.000 H100s puede dibujar más de 100 MW continuamente, comparable a la carga residencial de una pequeña ciudad.

La capa de red es igualmente distintiva. Los data centers de IA soportan topologías fat-tree u optimizadas en rail de InfiniBand o RoCE Ethernet con switches agregando cientos de puertos de alto ancho de banda por rack. El almacenamiento debe entregar datos de entrenamiento lo suficientemente rápido para evitar inanición de GPU, requiriendo arrays all-flash o sistemas de archivos distribuidos de alto rendimiento como Lustre, WEKA, o IBM Spectrum Scale. La selección de sitio está fuertemente impulsada por potencia: las instalaciones son cada vez más co-ubicadas con subestaciones o construidas cerca de fuentes de energía abundantes — hidroeléctrica en Escandinavia y el Noroeste del Pacífico de EE.UU., sitios adyacentes a nucleares en el Medio Oeste de EE.UU. — porque las demandas de multi-cientos de megavatio estresan las redes regionales.

Los data centers de IA se convirtieron en una categoría de inversión de capital importante en 2024–2025, con Microsoft, Google, Amazon, Meta, y Oracle colectivamente anunciando compromisos de construcción de cientos de miles de millones de dólares. La asociación de Microsoft con OpenAI incluye objetivos de capacidad multi-gigavatio en múltiples continentes. La selección de sitio geográfico se rige por el costo de potencia y disponibilidad, acceso a agua para enfriamiento, conectividad de cable submarino, entorno regulatorio, y política fiscal. EE.UU., Suecia, Finlandia, Singapur, y los EAU han surgido como centros significativos, y varias jurisdicciones han introducido caminos de permisos específicamente para instalaciones a escala de IA.

A partir de 2026, una nueva generación de instalaciones está siendo diseñada alrededor de 100+ kW por rack, óptica co-empaquetada para potencia reducida de interconnect, y en algunos casos generación de energía en sitio (turbinas de gas, reactores nucleares modulares pequeños en desarrollo). La 'fábrica de IA' — una instalación cuya producción primaria es computación de inferencia vendida — ha surgido como una clase de activo de infraestructura y bienes raíces distinto. Los desafíos persistentes incluyen capacidad de la red eléctrica, consumo de agua para enfriamiento, y el cronograma de construcción de 18–36 meses, que crea un desajuste estructural con ciclos de hardware de GPU que se renuevan cada 12–18 meses.

Ejemplo

Un proveedor de nube construyendo un clúster de 30.000-H100 selecciona un campus con 120 MW de potencia contratada, ingeniería de cada rack para enfriamiento líquido directo a carga de 80 kW, y despliega una red InfiniBand fat-tree de 400G para mantener la latencia de all-reduce dentro del presupuesto necesario para mantener alta utilización de GPU.

Términos relacionados

Últimas noticias sobre el tema

← Glosario