HPE Cray GX5000: 81 920 ядер AMD EPYC Venice на стойку — новый рекорд плотности
HPE представила новое поколение суперкомпьютерной платформы Cray GX5000, построенной на процессорах AMD EPYC Venice 9006. Система высокой плотности ориентирована на ресурсоёмкие HPC-задачи и нагрузки, связанные с искусственным интеллектом. В максимальной конфигурации с чипами EPYC 9996, имеющими 256

HPE представила новое поколение суперкомпьютерной платформы Cray GX5000, построенной на процессорах AMD EPYC Venice 9006. Система высокой плотности ориентирована на ресурсоёмкие HPC-задачи и нагрузки, связанные с искусственным интеллектом. В максимальной конфигурации с чипами EPYC 9996, имеющими 256 вычислительных ядер, суммарное количество ядер на одну серверную стойку достигает 81 920. По заявлениям производителя, это на 40% больше по сравнению с ближайшей конкурирующей системой высокой плотности. Анонс состоялся на фоне растущего спроса на вычислительные мощности для обучения больших языковых моделей и научного моделирования.
Архитектура платформы HPE Cray GX5000
Платформа HPE Cray GX5000 включает два типа серверов: HPE Cray Supercomputing GX350a Accelerated Blade и HPE Cray Supercomputing GX250 Compute Blade. GX350a ориентирован на смешанные вычисления и объединяет один процессор AMD EPYC Venice с четырьмя ускорителями AMD Instinct MI430X. В одной стойке могут быть размещены до 28 таких узлов, что в сумме даёт 112 ускорителей. Сервер GX250, напротив, рассчитан на операции с двойной точностью (FP64) и несёт на борту восемь процессоров EPYC Venice 9006 без ускорителей. В одной стойке могут размещаться до 40 узлов, содержащих в сумме 320 CPU. Такая гибкость позволяет адаптировать конфигурацию под конкретные задачи: от чистых CPU-вычислений до гибридных сценариев с ускорителями.
Какие процессоры AMD EPYC Venice используются в Cray GX5000?
Процессоры AMD EPYC Venice 9006, на которых базируется GX5000, изготавливаются по 3-нм техпроцессу и поддерживают до 12 каналов памяти DDR5. Максимальная конфигурация с чипом EPYC 9996 включает 256 ядер и 512 потоков. Архитектура Zen 5 обеспечивает прирост IPC до 20% по сравнению с предыдущим поколением EPYC 7003. Это позволяет значительно повысить производительность в задачах, чувствительных к однопоточной производительности, а также в параллельных вычислениях. Ускорители AMD Instinct MI430X, используемые в GX350a, имеют до 192 ГБ памяти HBM3e и обеспечивают производительность до 1,2 ПФЛОПС в вычислениях FP16. Сравнение с конкурентами: система на базе NVIDIA H100 с 8 GPU в стойке даёт около 40 960 ядер CUDA, что уступает 81 920 ядрам GX5000. Однако стоит учитывать, что ядра CPU и GPU не полностью сопоставимы по производительности, и для конкретных задач может потребоваться разный баланс.
Технология Slingshot и управление кластером
Архитектура Cray GX5000 использует технологию Slingshot, обеспечивающую высокоскоростное соединение между узлами с низкой задержкой. Серверы GX250 и GX350a монтируются в стойки, объединяемые в кластер через сеть Slingshot. Для управления кластером применяется ПО HPE Cray Programming Environment, оптимизированное для параллельных вычислений. Среда поддерживает популярные фреймворки, такие как MPI, OpenMP и CUDA (через ускорители AMD). Это упрощает миграцию существующих приложений на новую платформу. Кроме того, HPE предлагает инструменты для мониторинга и управления энергопотреблением, что критично для систем с такой высокой плотностью.
Предыстория и контекст: эволюция линейки Cray
HPE продолжает развивать линейку Cray, приобретённую в 2019 году. Предыдущее поколение GX4000 использовало процессоры AMD EPYC 7003 и ускорители Instinct MI200. Переход на Venice 9006 знаменует собой значительный скачок производительности: новые чипы имеют до 256 ядер против 128 у предыдущего поколения. Это позволяет HPE конкурировать с такими системами, как NVIDIA DGX SuperPOD и решениями на базе Intel Xeon. Рост числа ядер на стойку особенно важен для задач моделирования, симуляции и обучения нейросетей, где параллелизм критичен. Кроме того, HPE активно сотрудничает с национальными лабораториями США, что гарантирует востребованность платформы в научных кругах.
Кого затронет и как: практическое применение
Новая платформа в первую очередь интересна научным и исследовательским центрам, занимающимся моделированием климата, геномикой, материаловедением, а также компаниям, разрабатывающим большие языковые модели и системы ИИ. Для бизнеса в России и СНГ доступ к таким системам может быть ограничен из-за санкций, но возможно использование через облачных провайдеров или партнёров. Конкуренты, такие как NVIDIA и Intel, вынуждены будут ускорять разработку собственных решений высокой плотности. Ожидается, что GX5000 найдёт применение в центрах обработки данных, где важна экономия пространства и энергопотребления на единицу производительности.
Перспективы и будущие поставки
Ожидается, что первые поставки HPE Cray GX5000 начнутся во втором полугодии 2025 года. HPE уже анонсировала партнёрство с несколькими национальными лабораториями в США. В дальнейшем возможно расширение линейки за счёт интеграции ускорителей следующего поколения AMD Instinct MI400. Рынок суперкомпьютеров продолжит смещаться в сторону гибридных архитектур, сочетающих CPU и GPU. GX5000 задаёт новый стандарт плотности вычислений, предлагая до 81 920 ядер на стойку, что делает платформу привлекательной для самых ресурсоёмких задач HPC и ИИ. Следите за развитием этой линейки, так как она может стать основой для будущих экзафлопсных систем.