Habr AI→ оригинал

4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров

Энтузиаст объединил четыре Mac Studio в один кластер с 1,5 ТБ общей памяти через новую технологию RDMA поверх Thunderbolt 5. Цель — запускать локально гигантские языковые модели уровня DeepSeek V3 и Kimi K2 Thinking примерно на триллион параметров, которые не помещаются ни в одну видеокарту. Автор делится тестами производительности, сравнивает связку с решениями Nvidia и AMD и честно рассказывает про боль с настройкой и стабильностью.

AI-обработка оригинала Habr AI; редакция Hamidun News
4 Mac Studio в один кластер: 1,5 ТБ памяти для LLM на триллион параметров
Источник: Habr AI. Коллаж: Hamidun News.
◐ Слушать статью

Энтузиаст объединил четыре компьютера Mac Studio в единый кластер с 1,5 ТБ общей памяти через технологию RDMA поверх Thunderbolt 5 и запустил на нём языковые модели уровня DeepSeek V3 и Kimi K2 Thinking примерно на триллион параметров. Эксперимент опубликован на Habr в июле 2026 года переводом оригинальной статьи автора.

Зачем объединять четыре Mac Studio

Четыре Mac Studio связали в один кластер ради 1,5 ТБ общей памяти — объёма, в который целиком помещается языковая модель на триллион параметров. Модели такого размера физически не влезают в память ни одной потребительской или даже серверной видеокарты по отдельности, поэтому единственный способ прогнать их локально — собрать пул памяти из нескольких машин.

Mac Studio выбрали из-за архитектуры Apple с единой памятью (unified memory): у топовых конфигураций объём измеряется сотнями гигабайт, и он доступен и процессору, и графическому ядру без копирования. Четыре таких машины и дают суммарные 1,5 ТБ.

  • Конфигурация — четыре компьютера Mac Studio в одном кластере
  • Общая память — 1,5 ТБ
  • Связь между узлами — RDMA поверх Thunderbolt 5
  • Целевые модели — DeepSeek V3 и Kimi K2 Thinking (около 1 трлн параметров)
  • Сравнение производительности — с решениями Nvidia и AMD

Как работает связь через Thunderbolt 5

Узлы кластера соединены по Thunderbolt 5 с использованием RDMA — прямого доступа к памяти соседней машины в обход центрального процессора. Именно RDMA убирает главное узкое место распределённого инференса: обмен весами и промежуточными состояниями модели между узлами идёт с минимальными задержками, не нагружая CPU.

Thunderbolt 5 даёт пропускную способность порядка 80 Гбит/с, и связка RDMA плюс такой канал — относительно новый для Mac подход. По сути автор превратил четыре отдельных десктопа в одну машину с общим адресным пространством памяти, распределив по ним слои гигантской модели.

Какие проблемы всплыли

Основную боль автор описывает не в производительности, а в настройке и стабильности связки из четырёх узлов. RDMA поверх Thunderbolt 5 на macOS — технология свежая, и путь от «купил четыре Mac Studio» до «модель на триллион параметров стабильно отвечает» оказался неочевидным.

В статье автор приводит результаты тестов скорости и сравнивает кластер с решениями на базе Nvidia и AMD — чтобы понять, где связка Apple выигрывает по памяти на доллар, а где проигрывает по пропускной способности и зрелости софта.

Цель эксперимента — запускать локально гигантские языковые модели, которые не помещаются ни в одну существующую видеокарту, — как описывает автор в статье на

Habr.

Что это значит

Локальный запуск моделей на триллион параметров перестаёт быть исключительной прерогативой дата-центров с дорогими GPU-стойками: связка из нескольких Mac Studio с единой памятью и Thunderbolt 5 становится рабочей альтернативой для тех, кому важен приватный инференс больших MoE-моделей без облака. Массовым решением это пока не назвать — сырость софта и сложность настройки остаются барьером.

Частые вопросы

Зачем объединять несколько Mac Studio в кластер?

Чтобы получить единый пул памяти в 1,5 ТБ. Модели вроде DeepSeek V3 и Kimi K2 Thinking на триллион параметров не помещаются в память одной видеокарты, а четыре Mac Studio с общей памятью и связью RDMA поверх Thunderbolt 5 такой объём дают.

Какие модели удалось запустить локально?

Автор запускал на кластере языковые модели уровня DeepSeek V3 и Kimi K2 Thinking — обе примерно на 1 триллион параметров. Именно ради них и собиралась конфигурация с 1,5 ТБ общей памяти.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…