Habr AI→ original

4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров

Энтузиаст объединил четыре Mac Studio в один кластер с 1,5 ТБ общей памяти через новую технологию RDMA поверх Thunderbolt 5. Цель — запускать локально гигантские языковые модели уровня DeepSeek V3 и Kimi K2 Thinking примерно на триллион параметров, которые не помещаются ни в одну видеокарту. Автор делится тестами производительности, сравнивает связку с решениями Nvidia и AMD и честно рассказывает про боль с настройкой и стабильностью.

Processado por IA de Habr AI; editado por Hamidun News
4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров
Fonte: Habr AI. Colagem: Hamidun News.
◐ Ouvir artigo

Um entusiasta uniu quatro computadores Mac Studio em um único cluster com 1,5 TB de memória compartilhada por meio da tecnologia RDMA sobre Thunderbolt 5, e rodou nele modelos de linguagem do nível do DeepSeek V3 e do Kimi K2 Thinking, com cerca de um trilhão de parâmetros. O experimento foi publicado no Habr em julho de 2026 como tradução do artigo original do autor.

Por que combinar quatro Mac Studio

Quatro Mac Studio foram conectados em um único cluster para obter 1,5 TB de memória compartilhada — um volume no qual cabe integralmente um modelo de linguagem de um trilhão de parâmetros. Modelos desse tamanho fisicamente não cabem na memória de nenhuma placa de vídeo de consumo, nem mesmo de servidor, isoladamente, então a única forma de rodá-los localmente é reunir um pool de memória a partir de várias máquinas.

O Mac Studio foi escolhido pela arquitetura da Apple com memória unificada (unified memory): nas configurações de topo, o volume é medido em centenas de gigabytes, disponível tanto para a CPU quanto para o núcleo gráfico sem necessidade de cópia. Quatro máquinas desse tipo somam um total de 1,5 TB.

*Configuração — quatro computadores Mac Studio em um cluster

*Memória compartilhada — 1,5 TB

*Conexão entre os nós — RDMA sobre Thunderbolt 5

*Modelos-alvo — DeepSeek V3 e Kimi K2 Thinking (cerca de 1 trilhão de parâmetros)

*Comparação de desempenho — com soluções da Nvidia e da AMD

Como funciona a conexão via Thunderbolt 5

Os nós do cluster estão conectados via Thunderbolt 5 usando RDMA — acesso direto à memória da máquina vizinha, sem passar pelo processador central. É justamente o RDMA que elimina o principal gargalo da inferência distribuída: a troca de pesos e estados intermediários do modelo entre os nós ocorre com latência mínima, sem sobrecarregar a CPU.

O Thunderbolt 5 oferece uma largura de banda de cerca de 80 Gbit/s, e combinar RDMA com esse canal é uma abordagem relativamente nova para o Mac. Na prática, o autor transformou quatro desktops separados em uma única máquina com um espaço de endereçamento de memória compartilhado, distribuindo entre eles as camadas do modelo gigante.

Quais problemas surgiram

O autor descreve a maior dor não no desempenho, mas na configuração e na estabilidade da conexão dos quatro nós. RDMA sobre Thunderbolt 5 no macOS é uma tecnologia recente, e o caminho entre "comprei quatro Mac Studio" e "o modelo de um trilhão de parâmetros responde de forma estável" mostrou-se longe de óbvio.

No artigo, o autor apresenta resultados de testes de velocidade e compara o cluster com soluções baseadas em Nvidia e AMD — para entender onde a montagem da Apple vence em memória por dólar, e onde perde em largura de banda e maturidade do software.

O objetivo do experimento é rodar localmente modelos de linguagem gigantescos que não cabem em nenhuma placa de vídeo existente — como descreve o autor no artigo publicado no

Habr.

O que isso significa

Rodar localmente modelos de um trilhão de parâmetros deixa de ser prerrogativa exclusiva de data centers com racks de GPU caros: uma montagem de vários Mac Studio com memória unificada e Thunderbolt 5 está se tornando uma alternativa viável para quem valoriza a inferência privada de grandes modelos MoE sem depender da nuvem. Ainda não dá para chamar de solução em massa — a imaturidade do software e a complexidade da configuração continuam sendo uma barreira.

Perguntas frequentes

Por que combinar vários Mac Studio em um cluster?

Para obter um único pool de memória compartilhada de 1,5 TB. Modelos como o DeepSeek V3 e o Kimi K2 Thinking, com um trilhão de parâmetros, não cabem na memória de uma única placa de vídeo, enquanto quatro Mac Studio com memória compartilhada e conexão RDMA sobre Thunderbolt 5 oferecem esse volume.

Quais modelos foi possível rodar localmente?

O autor rodou no cluster modelos de linguagem do nível do DeepSeek V3 e do Kimi K2 Thinking — ambos com cerca de 1 trilhão de parâmetros. Foi justamente para eles que a configuração com 1,5 TB de memória compartilhada foi montada.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…