Как собрать кластер из четырёх Mac Studio с 1,5 ТБ памяти для запуска ИИ-моделей на триллион параметров
Энтузиаст под ником kyehehehe успешно объединил четыре компьютера Mac Studio в единый вычислительный кластер с общей памятью 1,5 ТБ. В своём блоге он подробно описал процесс сборки, настройки и тестирования системы, которая способна запускать локально гигантские языковые модели (LLM) с триллионом па

Энтузиаст под ником kyehehehe успешно объединил четыре компьютера Mac Studio в единый вычислительный кластер с общей памятью 1,5 ТБ. В своём блоге он подробно описал процесс сборки, настройки и тестирования системы, которая способна запускать локально гигантские языковые модели (LLM) с триллионом параметров — например, DeepSeek V3 и Kimi K2 Thinking. Ключевая инновация — использование технологии RDMA (Remote Direct Memory Access) через интерфейс Thunderbolt 5, что позволило обойти ограничения отдельных устройств и создать единое адресное пространство памяти.
Как собрать кластер из четырёх Mac Studio
Для эксперимента были использованы четыре Mac Studio с чипами M2 Ultra, каждый из которых оснащён 192 ГБ оперативной памяти. Суммарный объём ОЗУ составил 768 ГБ, однако автор утверждает, что с помощью RDMA можно адресовать до 1,5 ТБ, если задействовать дополнительное дисковое пространство как RAM-диск. Соединение осуществлялось через Thunderbolt 5-кабели, поддерживающие скорость до 80 Гбит/с, что обеспечило низкую задержку при обмене данными между узлами.
Настройка кластера потребовала значительных усилий: автору пришлось модифицировать ядро macOS, настроить сетевые мосты и оптимизировать протоколы передачи данных. Основная сложность заключалась в обеспечении когерентности кэшей и синхронизации памяти между четырьмя независимыми операционными системами. В результате удалось добиться стабильной работы с пропускной способностью около 40 Гбит/с между узлами — достаточно для загрузки весов моделей размером в сотни гигабайт.
Почему RDMA через Thunderbolt 5 меняет правила игры для ИИ?
RDMA позволяет одному компьютеру напрямую обращаться к памяти другого без участия процессора и операционной системы, что резко снижает задержки и нагрузку. В контексте ИИ это означает, что веса модели и промежуточные данные могут быть распределены между узлами, а каждый узел может обращаться к памяти другого почти так же быстро, как к своей собственной. Thunderbolt 5 обеспечивает достаточную пропускную способность (80 Гбит/с) для передачи больших объёмов данных, хотя и уступает специализированным решениям вроде InfiniBand (200-400 Гбит/с). Тем не менее, для задач вывода (inference) LLM это приемлемо, особенно учитывая низкую стоимость Mac Studio по сравнению с серверными GPU.
Технические подробности: производительность и сравнение с Nvidia и AMD
Автор провёл серию тестов, сравнивая свой кластер с одиночными системами на базе Nvidia RTX 4090 и AMD Radeon Pro W7900. При запуске модели DeepSeek V3 (671B параметров) кластер из четырёх Mac Studio показал скорость генерации около 5 токенов в секунду — значительно медленнее, чем RTX 4090 (около 20 токенов/с), но последняя не может загрузить модель целиком из-за ограничения в 24 ГБ памяти. Для модели с триллионом параметров Kimi K2 Thinking скорость упала до 1-2 токенов/с, что делает систему пригодной только для асинхронных задач, где время ответа не критично.
Сравнение с профессиональными решениями Nvidia H100 и AMD MI300X показало ожидаемое отставание: кластер Mac Studio уступает в 10-20 раз по пропускной способности памяти и вычислительной мощности. Однако автор подчёркивает, что стоимость его системы (около $30 000 за четыре Mac Studio) значительно ниже, чем $200 000+ за сервер с восемью H100. Кроме того, Mac Studio потребляет меньше энергии и не требует специального охлаждения.
Кого затронет и как
Разработчики и исследователи ИИ, особенно те, кто работает с большими моделями, могут рассматривать такой кластер как бюджетную альтернативу облачным сервисам или дорогим GPU-серверам. Система позволяет запускать модели, которые иначе были бы недоступны для локального использования — например, для тонкой настройки (fine-tuning) или исследовательских экспериментов. Однако для продакшн-нагрузок с высокими требованиями к скорости вывода она не подходит.
Для российских и СНГ-специалистов, испытывающих сложности с доступом к западным облачным платформам и дорогим GPU, такое решение может быть особенно актуальным. Mac Studio официально продаётся в России через параллельный импорт, а Thunderbolt 5-кабели доступны. Тем не менее, настройка требует высокой квалификации и может быть нестабильной.
Какие ограничения есть у кластера Mac Studio для больших языковых моделей?
Главное ограничение — пропускная способность памяти. Mac Studio использует унифицированную память с пропускной способностью около 800 ГБ/с, что значительно меньше, чем у H100 (3,35 ТБ/с). При распределении модели между узлами через Thunderbolt 5 узким местом становится межсоединение, что снижает общую производительность. Кроме того, кластер не поддерживает эффективное распараллеливание вычислений — каждый узел работает с частью модели, но не может выполнять операции параллельно на всех узлах одновременно. Это делает систему пригодной в основном для вывода, а не для обучения.
Что будет дальше
Автор планирует опубликовать подробное руководство по сборке и настройке кластера, а также выложить скрипты для автоматизации процесса. В перспективе технология RDMA через Thunderbolt может быть стандартизирована и поддержана на уровне macOS, что упростит создание подобных систем. Возможно, Apple сама заинтересуется этим направлением, учитывая растущий спрос на локальный ИИ. Однако пока остаются вопросы стабильности и производительности при длительных вычислениях.
Итог
Эксперимент показал, что объединение нескольких Mac Studio в кластер с помощью RDMA через Thunderbolt 5 — рабочий, хоть и нишевый способ запуска гигантских ИИ-моделей локально. Система не заменит профессиональные GPU-фермы, но открывает новые возможности для энтузиастов и небольших исследовательских групп с ограниченным бюджетом. Следите за развитием этой технологии — возможно, она станет прообразом доступных кластеров для ИИ будущего.