4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров
Энтузиаст объединил четыре Mac Studio в один кластер с 1,5 ТБ общей памяти через новую технологию RDMA поверх Thunderbolt 5. Цель — запускать локально гигантские языковые модели уровня DeepSeek V3 и Kimi K2 Thinking примерно на триллион параметров, которые не помещаются ни в одну видеокарту. Автор делится тестами производительности, сравнивает связку с решениями Nvidia и AMD и честно рассказывает про боль с настройкой и стабильностью.
AI-обработка оригинала Habr AI; редакция Hamidun News
Энтузиаст объединил четыре компьютера Mac Studio в единый кластер с 1,5 ТБ общей памяти через технологию RDMA поверх Thunderbolt 5 и запустил на нём языковые модели уровня DeepSeek V3 и Kimi K2 Thinking примерно на триллион параметров. Эксперимент опубликован на Habr в июле 2026 года переводом оригинальной статьи автора.
Зачем объединять четыре Mac Studio
Четыре Mac Studio связали в один кластер ради 1,5 ТБ общей памяти — объёма, в который целиком помещается языковая модель на триллион параметров. Модели такого размера физически не влезают в память ни одной потребительской или даже серверной видеокарты по отдельности, поэтому единственный способ прогнать их локально — собрать пул памяти из нескольких машин.
Mac Studio выбрали из-за архитектуры Apple с единой памятью (unified memory): у топовых конфигураций объём измеряется сотнями гигабайт, и он доступен и процессору, и графическому ядру без копирования. Четыре таких машины и дают суммарные 1,5 ТБ.
- Конфигурация — четыре компьютера Mac Studio в одном кластере
- Общая память — 1,5 ТБ
- Связь между узлами — RDMA поверх Thunderbolt 5
- Целевые модели — DeepSeek V3 и Kimi K2 Thinking (около 1 трлн параметров)
- Сравнение производительности — с решениями Nvidia и AMD
Как работает связь через Thunderbolt 5
Узлы кластера соединены по Thunderbolt 5 с использованием RDMA — прямого доступа к памяти соседней машины в обход центрального процессора. Именно RDMA убирает главное узкое место распределённого инференса: обмен весами и промежуточными состояниями модели между узлами идёт с минимальными задержками, не нагружая CPU.
Thunderbolt 5 даёт пропускную способность порядка 80 Гбит/с, и связка RDMA плюс такой канал — относительно новый для Mac подход. По сути автор превратил четыре отдельных десктопа в одну машину с общим адресным пространством памяти, распределив по ним слои гигантской модели.
Какие проблемы всплыли
Основную боль автор описывает не в производительности, а в настройке и стабильности связки из четырёх узлов. RDMA поверх Thunderbolt 5 на macOS — технология свежая, и путь от «купил четыре Mac Studio» до «модель на триллион параметров стабильно отвечает» оказался неочевидным.
В статье автор приводит результаты тестов скорости и сравнивает кластер с решениями на базе Nvidia и AMD — чтобы понять, где связка Apple выигрывает по памяти на доллар, а где проигрывает по пропускной способности и зрелости софта.
Цель эксперимента — запускать локально гигантские языковые модели, которые не помещаются ни в одну существующую видеокарту, — как описывает автор в статье на
Habr.
Что это значит
Локальный запуск моделей на триллион параметров перестаёт быть исключительной прерогативой дата-центров с дорогими GPU-стойками: связка из нескольких Mac Studio с единой памятью и Thunderbolt 5 становится рабочей альтернативой для тех, кому важен приватный инференс больших MoE-моделей без облака. Массовым решением это пока не назвать — сырость софта и сложность настройки остаются барьером.
Частые вопросы
Зачем объединять несколько Mac Studio в кластер?
Чтобы получить единый пул памяти в 1,5 ТБ. Модели вроде DeepSeek V3 и Kimi K2 Thinking на триллион параметров не помещаются в память одной видеокарты, а четыре Mac Studio с общей памятью и связью RDMA поверх Thunderbolt 5 такой объём дают.
Какие модели удалось запустить локально?
Автор запускал на кластере языковые модели уровня DeepSeek V3 и Kimi K2 Thinking — обе примерно на 1 триллион параметров. Именно ради них и собиралась конфигурация с 1,5 ТБ общей памяти.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.