IEEE Spectrum AI→ original

Prometheus: servidor Majestic Labs con 128 TB de memoria para IA

La startup Majestic Labs está trabajando en el servidor Prometheus, diseñado para resolver el problema de memoria limitada al trabajar con grandes modelos de lenguaje. A diferencia del NVIDIA DGX B300 con 2 TB de memoria, Prometheus puede contener hasta 128 TB. La empresa está preparando una arquitectura orientada a DRAM que reemplazará el enfoque combinado tradicional (HBM+DRAM).

Procesado por IA desde IEEE Spectrum AI; editado por Hamidun News
Prometheus: servidor Majestic Labs con 128 TB de memoria para IA
Fuente: IEEE Spectrum AI. Collage: Hamidun News.
◐ Escuchar artículo

La startup de hardware de inteligencia artificial Majestic Labs está desarrollando un nuevo servidor de IA Prometheus con capacidad de memoria de hasta 128 terabytes — más de 60 veces la capacidad del servidor insignia DGX B300 de Nvidia, uno de los sistemas de serie más poderosos para procesar cargas de trabajo de IA en el mercado. Como reporta IEEE Spectrum, la compañía está apostando por una arquitectura construida completamente alrededor de memoria DRAM para resolver el problema del llamado "muro de memoria" (memory wall) — uno de los principales cuellos de botella de rendimiento para la inferencia en modelos de lenguaje grandes.

Por qué la memoria se convirtió en el principal cuello de botella para la IA

  • Producto — servidor Prometheus de Majestic Labs
  • Capacidad de memoria — hasta 128 terabytes
  • Comparación — más de 60 veces más memoria que Nvidia DGX B300
  • Arquitectura — unificada, basada completamente en DRAM (específicamente LPDDR6), a diferencia de la combinación HBM y DRAM de Nvidia
  • Figura clave — Sha Rabii, cofundador y presidente de Majestic Labs

Según un influyente trabajo científico citado por IEEE Spectrum, la generación de tokens en modelos de lenguaje grandes está fundamentalmente limitada por la velocidad de la memoria: la velocidad a la que un modelo produce texto está determinada por cuán rápido se pueden leer datos — principalmente pesos del modelo — de la memoria, no por qué tan rápido operan las unidades de computación. Cuanto más grande es el modelo, más agudo se vuelve este problema, y eventualmente surge un "muro de memoria", que limita el rendimiento de la inferencia independientemente del crecimiento de la potencia computacional del procesador — no importa cuántos núcleos y bloques de tensor agreguen los ingenieros, la velocidad final de salida de texto está limitada por el ancho de banda de memoria y la capacidad de memoria disponible.

Cómo la arquitectura DRAM de

Prometheus difiere del enfoque de Nvidia

El cofundador y presidente de Majestic Labs, Sha Rabii, cree que la escala de memoria le da a la compañía una ventaja competitiva. Según él, Nvidia "ha hecho un trabajo fenomenal creando un sistema capaz de escalar", pero a medida que crecen los modelos, este enfoque se vuelve cada vez menos económico: el sistema "termina con una potencia computacional excesiva y muriendo de hambre por memoria". Los servidores Nvidia hoy utilizan memoria rápida de alto ancho de banda (HBM) — generalmente para almacenar pesos del modelo — y un grupo DRAM separado, típicamente más grande, pero más lento, que maneja otras tareas LLM y la sobrecarga del servidor.

Majestic Labs eligió un camino fundamentalmente diferente: una arquitectura unificada construida completamente en DRAM, específicamente memoria LPDDR6, sin división en grupos rápidos y lentos. Según Rabii, la mayoría de las interfaces de memoria están diseñadas para operar a distancias físicas muy cortas — a veces solo unos pocos milímetros — y esto es precisamente lo que limita físicamente cuánta memoria se puede colocar en un sistema mientras se mantiene un alto ancho de banda.

Lo que esto podría significar para el mercado de infraestructura de IA

Si la apuesta de Majestic Labs se cumple, la compañía ofrecerá al mercado una fuente alternativa de potencia de computación para cargas de trabajo que hoy carecen de memoria — trabajo con contexto largo, modelos de expertos mixtos con gran volumen total de parámetros bajo activación dispersa, uso intensivo de caché KV al servir múltiples solicitudes paralelas. Esto desafía la suposición común de que la carrera en infraestructura de IA es principalmente sobre el número de procesadores gráficos y la potencia computacional en FLOPs: Prometheus desplaza parte del enfoque competitivo hacia volumen de memoria y arquitectura. Dada la posición dominante de Nvidia en el mercado de servidores de IA, la apuesta de una startup por una arquitectura centrada en memoria en lugar de centrada en computación se destaca entre la mayoría de los jugadores que generalmente siguen la hoja de ruta computacionalmente orientada establecida por Nvidia en años recientes.

El hecho mismo de que tal proyecto esté apareciendo muestra que el "muro de memoria" ha dejado de ser un tema académico estrecho y se ha convertido en un incentivo comercial para lanzar una nueva startup de hardware. Si Majestic Labs lleva Prometheus a la producción en serie, los operadores de centros de datos y los proveedores de nube tendrán por primera vez en mucho tiempo una verdadera alternativa al conjunto estándar "GPU más HBM", y la competencia en el segmento de infraestructura de IA dejará de ser exclusivamente una comparación del número y generación de aceleradores gráficos.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…