4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров
Энтузиаст объединил четыре Mac Studio в один кластер с 1,5 ТБ общей памяти через новую технологию RDMA поверх Thunderbolt 5. Цель — запускать локально гигантские языковые модели уровня DeepSeek V3 и Kimi K2 Thinking примерно на триллион параметров, которые не помещаются ни в одну видеокарту. Автор делится тестами производительности, сравнивает связку с решениями Nvidia и AMD и честно рассказывает про боль с настройкой и стабильностью.
Traité par IA depuis Habr AI ; édité par Hamidun News
Un passionné a réuni quatre ordinateurs Mac Studio en un seul cluster doté de 1,5 To de mémoire partagée grâce à la technologie RDMA par-dessus Thunderbolt 5, et y a fait tourner des modèles de langage du niveau de DeepSeek V3 et Kimi K2 Thinking, comptant environ mille milliards de paramètres. L'expérience a été publiée sur Habr en juillet 2026, en traduction de l'article original de l'auteur.
Pourquoi combiner quatre Mac Studio
Quatre Mac Studio ont été reliés en un seul cluster afin d'obtenir 1,5 To de mémoire partagée — un volume dans lequel tient entièrement un modèle de langage de mille milliards de paramètres. Des modèles de cette taille ne tiennent physiquement dans la mémoire d'aucune carte graphique grand public, ni même serveur, prise isolément ; la seule façon de les faire tourner localement est donc de constituer un pool de mémoire à partir de plusieurs machines.
Le Mac Studio a été choisi pour l'architecture Apple à mémoire unifiée (unified memory) : sur les configurations haut de gamme, le volume se compte en centaines de gigaoctets, accessibles à la fois au processeur et au cœur graphique sans copie. Quatre machines de ce type totalisent ainsi 1,5 To.
*Configuration — quatre ordinateurs Mac Studio réunis en un cluster
*Mémoire partagée — 1,5 To
*Liaison entre les nœuds — RDMA par-dessus Thunderbolt 5
*Modèles visés — DeepSeek V3 et Kimi K2 Thinking (environ 1 000 milliards de paramètres)
*Comparaison de performance — avec des solutions Nvidia et AMD
Comment fonctionne la liaison via Thunderbolt 5
Les nœuds du cluster sont reliés via Thunderbolt 5 en utilisant RDMA — un accès direct à la mémoire de la machine voisine, sans passer par le processeur central. C'est précisément RDMA qui élimine le principal goulot d'étranglement de l'inférence distribuée : l'échange des poids et des états intermédiaires du modèle entre les nœuds se fait avec une latence minimale, sans solliciter le CPU.
Thunderbolt 5 offre une bande passante de l'ordre de 80 Gbit/s, et associer RDMA à un tel canal est une approche relativement nouvelle sur Mac. En pratique, l'auteur a transformé quatre ordinateurs de bureau distincts en une seule machine dotée d'un espace d'adressage mémoire commun, en répartissant sur eux les couches du modèle géant.
Quels problèmes sont apparus
L'auteur décrit la principale difficulté non pas au niveau des performances, mais dans la configuration et la stabilité de la liaison entre les quatre nœuds. RDMA par-dessus Thunderbolt 5 sur macOS est une technologie récente, et le chemin entre « j'ai acheté quatre Mac Studio » et « le modèle de mille milliards de paramètres répond de façon stable » s'est révélé loin d'être évident.
Dans l'article, l'auteur présente les résultats de tests de vitesse et compare le cluster à des solutions basées sur Nvidia et AMD — afin de voir où le montage Apple l'emporte en mémoire par dollar, et où il perd en bande passante et en maturité logicielle.
L'objectif de l'expérience est de faire tourner localement des modèles
de langage gigantesques qui ne tiennent dans aucune carte graphique existante, comme le décrit l'auteur dans l'article publié sur Habr.
Ce que cela signifie
Faire tourner localement des modèles de mille milliards de paramètres n'est plus l'apanage exclusif des centres de données dotés de baies de GPU coûteuses : un montage de plusieurs Mac Studio à mémoire unifiée et Thunderbolt 5 devient une alternative fonctionnelle pour ceux qui tiennent à une inférence privée des grands modèles MoE sans passer par le cloud. On ne peut pas encore parler de solution grand public : l'immaturité des logiciels et la complexité de la mise en place restent des freins.
Questions fréquentes
Pourquoi combiner plusieurs Mac Studio en un cluster ?
Pour obtenir un pool de mémoire partagée unique de 1,5 To. Des modèles comme DeepSeek V3 et Kimi K2 Thinking, avec leurs mille milliards de paramètres, ne tiennent pas dans la mémoire d'une seule carte graphique, alors que quatre Mac Studio avec mémoire partagée et liaison RDMA par-dessus Thunderbolt 5 offrent ce volume.
Quels modèles ont pu être exécutés localement ?
L'auteur a fait tourner sur le cluster des modèles de langage du niveau de DeepSeek V3 et Kimi K2 Thinking — tous deux dotés d'environ 1 000 milliards de paramètres. C'est précisément pour eux qu'a été assemblée la configuration à 1,5 To de mémoire partagée.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.