Habr AI→ original

4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров

Энтузиаст объединил четыре Mac Studio в один кластер с 1,5 ТБ общей памяти через новую технологию RDMA поверх Thunderbolt 5. Цель — запускать локально гигантские языковые модели уровня DeepSeek V3 и Kimi K2 Thinking примерно на триллион параметров, которые не помещаются ни в одну видеокарту. Автор делится тестами производительности, сравнивает связку с решениями Nvidia и AMD и честно рассказывает про боль с настройкой и стабильностью.

Procesado por IA desde Habr AI; editado por Hamidun News
4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Un entusiasta combinó cuatro ordenadores Mac Studio en un único clúster con 1,5 TB de memoria compartida mediante la tecnología RDMA sobre Thunderbolt 5, y ejecutó en él modelos de lenguaje del nivel de DeepSeek V3 y Kimi K2 Thinking, de aproximadamente un billón de parámetros. El experimento se publicó en Habr en julio de 2026 como traducción del artículo original del autor.

Por qué combinar cuatro Mac Studio

Se conectaron cuatro Mac Studio en un único clúster para obtener 1,5 TB de memoria compartida, un volumen en el que cabe por completo un modelo de lenguaje de un billón de parámetros. Los modelos de este tamaño físicamente no caben en la memoria de ninguna tarjeta gráfica de consumo, ni siquiera de servidor, por separado, así que la única forma de ejecutarlos localmente es reunir un fondo común de memoria a partir de varias máquinas.

Se eligió Mac Studio por la arquitectura de Apple con memoria unificada (unified memory): en las configuraciones tope de gama el volumen se mide en cientos de gigabytes, y está disponible tanto para la CPU como para el núcleo gráfico sin necesidad de copiarlo. Cuatro máquinas de este tipo dan un total de 1,5 TB.

*Configuración — cuatro ordenadores Mac Studio en un clúster

*Memoria compartida — 1,5 TB

*Conexión entre nodos — RDMA sobre Thunderbolt 5

*Modelos objetivo — DeepSeek V3 y Kimi K2 Thinking (alrededor de 1 billón de parámetros)

*Comparación de rendimiento — con soluciones de Nvidia y AMD

Cómo funciona la conexión mediante Thunderbolt 5

Los nodos del clúster están conectados por Thunderbolt 5 usando RDMA, es decir, acceso directo a la memoria de la máquina vecina sin pasar por el procesador central. Precisamente RDMA elimina el principal cuello de botella de la inferencia distribuida: el intercambio de pesos y estados intermedios del modelo entre los nodos se produce con una latencia mínima, sin cargar la CPU.

Thunderbolt 5 ofrece un ancho de banda de unos 80 Gbit/s, y la combinación de RDMA con ese canal es un enfoque relativamente nuevo para Mac. En esencia, el autor convirtió cuatro ordenadores de escritorio independientes en una sola máquina con un espacio de direcciones de memoria compartido, distribuyendo entre ellos las capas del modelo gigante.

Qué problemas surgieron

El autor describe el principal dolor no en el rendimiento, sino en la configuración y la estabilidad de la conexión de los cuatro nodos. RDMA sobre Thunderbolt 5 en macOS es una tecnología reciente, y el camino desde "compré cuatro Mac Studio" hasta "el modelo de un billón de parámetros responde de forma estable" resultó no ser nada evidente.

En el artículo, el autor presenta resultados de pruebas de velocidad y compara el clúster con soluciones basadas en Nvidia y AMD, para entender dónde la combinación de Apple gana en memoria por dólar y dónde pierde en ancho de banda y madurez del software.

El objetivo del experimento es ejecutar localmente modelos de lenguaje gigantescos que no caben en ninguna tarjeta gráfica existente, tal como describe el autor en el artículo publicado en

Habr.

Qué significa esto

Ejecutar localmente modelos de un billón de parámetros deja de ser prerrogativa exclusiva de los centros de datos con costosos racks de GPU: una combinación de varios Mac Studio con memoria unificada y Thunderbolt 5 se está convirtiendo en una alternativa viable para quienes valoran la inferencia privada de grandes modelos MoE sin depender de la nube. Todavía no se puede llamar una solución masiva: la inmadurez del software y la complejidad de la configuración siguen siendo una barrera.

Preguntas frecuentes

¿Por qué combinar varios Mac Studio en un clúster?

Para obtener un único fondo de memoria compartida de 1,5 TB. Modelos como DeepSeek V3 y Kimi K2 Thinking, de un billón de parámetros, no caben en la memoria de una sola tarjeta gráfica, mientras que cuatro Mac Studio con memoria compartida y conexión RDMA sobre Thunderbolt 5 sí ofrecen ese volumen.

¿Qué modelos se lograron ejecutar localmente?

El autor ejecutó en el clúster modelos de lenguaje del nivel de DeepSeek V3 y Kimi K2 Thinking, ambos de aproximadamente 1 billón de parámetros. Precisamente para ellos se armó la configuración con 1,5 TB de memoria compartida.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…