Архитектура ИИ-фабрик: Lenovo и AMD Helios для масштабного ИИ
ИИ-фабрики — это новый класс вычислительных центров, спроектированных специально для обучения и инференса больших языковых моделей. В отличие от традиционных ЦОДов, они требуют колоссальной плотности вычислений, эффективного охлаждения и минимальных задержек. Lenovo совместно с AMD представила архит

ИИ-фабрики — это новый класс вычислительных центров, спроектированных специально для обучения и инференса больших языковых моделей. В отличие от традиционных ЦОДов, они требуют колоссальной плотности вычислений, эффективного охлаждения и минимальных задержек. Lenovo совместно с AMD представила архитектуру AMD Helios — масштабируемое rack-scale решение, которое обещает стать ключевым элементом таких фабрик. Разработка нацелена на гиперскейлеров и облачных провайдеров, нуждающихся в производительности для генеративного ИИ.
Что такое AMD Helios и как он устроен
AMD Helios — это комплексное решение, объединяющее вычислительные узлы на базе процессоров AMD EPYC и ускорителей AMD Instinct. Ключевая особенность — оптимизированная архитектура «стойка как единое целое», которая позволяет эффективно масштабировать инфраструктуру для обучения и инференса. Lenovo выступает системным интегратором, обеспечивая охлаждение, управление питанием и сетевое взаимодействие.
Решение включает в себя запатентованную систему жидкостного охлаждения Lenovo Neptune, что позволяет размещать до 80 GPU Instinct MI300X в одной стойке с плотностью до 40 кВт. Это критически важно для ИИ-фабрик, где тепловыделение является узким местом. Helios поддерживает высокоскоростную сеть Infinity Fabric от AMD и оптические интерконнекты для минимизации задержек.
Какие преимущества дает жидкостное охлаждение в ИИ-фабриках?
Жидкостное охлаждение становится стандартом для современных ИИ-кластеров. В случае Helios система Neptune от Lenovo позволяет отводить до 40 кВт тепла на стойку, что недостижимо при воздушном охлаждении. Это не только повышает плотность размещения GPU, но и снижает энергопотребление на 15% за счет более точного контроля температуры. Для операторов ИИ-фабрик это означает меньшие затраты на электроэнергию и возможность размещать больше вычислительных ресурсов на той же площади.
Предыстория и контекст
Концепция ИИ-фабрик возникла как ответ на взрывной рост вычислительных потребностей больших языковых моделей. Традиционные ЦОДы не справляются с плотностью энергопотребления и тепловыделения. Lenovo и AMD ранее совместно разрабатывали решения для HPC, а Helios стал логическим продолжением этой линейки, адаптированным под специфику ИИ.
На рынке уже существуют аналоги: NVIDIA DGX SuperPOD, решения на базе Intel Xeon и Habana. Однако AMD Helios делает ставку на открытую экосистему ROCm и совместимость с популярными фреймворками, что может привлечь клиентов, стремящихся избежать vendor lock-in.
Чем Helios отличается от решений конкурентов
Главное отличие — использование GPU Instinct MI300X с 192 ГБ памяти HBM3 и поддержкой FP8, что позволяет обрабатывать модели с триллионами параметров. Кроме того, Lenovo интегрировала собственную систему мониторинга и оркестрации, упрощающую развертывание. В отличие от NVIDIA, где софт (CUDA) привязан к железу, AMD и Lenovo предлагают более гибкое программное обеспечение на базе открытых стандартов.
Технические подробности и производительность
Стойка Helios поддерживает до 8 узлов, каждый с двумя процессорами EPYC Genoa и восемью ускорителями MI300X. Пиковая производительность одной стойки достигает 10,4 PFLOPS (FP8) для ИИ-нагрузок. Пропускная способность памяти — 3,5 ТБ/с на GPU, а межсоединение Infinity Fabric обеспечивает скорость 896 ГБ/с между ускорителями.
Lenovo также внедрила технологию «smart cooling» с контролем температуры на уровне каждого чипа, что снижает энергопотребление на 15% по сравнению с воздушным охлаждением. Для управления используется Lenovo ThinkSystem Manager, интегрированный с облачными платформами.
Кого затронет и как
Гиперскейлеры (AWS, Azure, Google Cloud) и NeoCloud-провайдеры смогут развертывать Helios для обучения GPT-подобных моделей, сокращая время обучения на 30–40%. Для бизнеса это означает снижение стоимости ИИ-инфраструктуры и ускорение вывода моделей в продакшн. В России и СНГ решение пока недоступно из-за санкционных ограничений, но может быть интересно крупным компаниям, имеющим доступ к альтернативным каналам поставок.
Что будет дальше
Lenovo планирует начать поставки Helios в третьем квартале 2024 года. Ожидается, что первые развертывания произойдут у крупных облачных провайдеров. В дальнейшем возможно появление младших конфигураций для среднего бизнеса. Также анонсирована поддержка новых GPU Instinct MI400, что продлит жизненный цикл платформы.
Итог
AMD Helios от Lenovo — значимый шаг в эволюции ИИ-инфраструктуры, предлагающий альтернативу доминирующим решениям NVIDIA. Высокая плотность вычислений, эффективное охлаждение и открытая программная экосистема делают его привлекательным для строителей ИИ-фабрик. Следить за развитием стоит всем, кто инвестирует в масштабный ИИ.