Hugging Face выпустила кастомные ядра для AMD MI300: ускорение ИИ до 2 раз

Hugging Face, известная платформа для машинного обучения, представила коллекцию кастомных ядер (kernels) для ускорителей AMD Instinct MI300. Эти ядра оптимизированы для выполнения ключевых операций современных моделей ИИ, таких как матричные умножения и функции активации. Разработка опубликована в о

Hugging Face выпустила кастомные ядра для AMD MI300: ускорение ИИ до 2 раз

Hugging Face, известная платформа для машинного обучения, представила коллекцию кастомных ядер (kernels) для ускорителей AMD Instinct MI300. Эти ядра оптимизированы для выполнения ключевых операций современных моделей ИИ, таких как матричные умножения и функции активации. Разработка опубликована в открытом доступе на GitHub под лицензией Apache 2.0, что позволяет любому разработчику использовать и модифицировать код. Это событие может стать важным шагом в усилении позиций AMD на рынке ускорителей для искусственного интеллекта, где доминирует NVIDIA.

Почему это важно для экосистемы ИИ AMD MI300 — один из главных конкурентов NVIDIA H100, но его программная экосистема, основанная на ROCm, пока отстаёт по уровню поддержки и производительности. Кастомные ядра от Hugging Face могут существенно повысить эффективность ИИ-нагрузок на MI300, сделав его более привлекательным для разработчиков и снизив зависимость от решений NVIDIA. Это особенно актуально в условиях, когда спрос на альтернативы NVIDIA растёт из-за дефицита и высокой стоимости её ускорителей. Улучшение производительности на MI300 может ускорить внедрение AMD в дата-центры и исследовательские лаборатории.

Какую производительность обеспечивают новые ядра? Ядра написаны на языке Triton, который позволяет создавать высокоэффективные GPU-программы. Они оптимизированы под архитектуру CDNA3, используемую в MI300. В состав коллекции вошли реализации для FlashAttention, fused softmax, GELU, SiLU и других операций. Бенчмарки показывают прирост скорости до 2 раз по сравнению со стандартными реализациями из библиотек ROCm. Например, FlashAttention, критически важная для трансформеров, выполняется значительно быстрее, что сокращает время обучения и инференса моделей. Такие улучшения делают MI300 более конкурентоспособным в задачах обработки естественного языка и компьютерного зрения.

Детали реализации и доступность Проект опубликован на GitHub в репозитории Hugging Face. Код написан на Triton и включает подробную документацию по установке и использованию. Разработчики могут легко интегрировать эти ядра в свои проекты, заменив стандартные операции на кастомные. Лицензия Apache 2.0 позволяет коммерческое использование без ограничений. Пока ядра протестированы на ограниченном наборе моделей, но Hugging Face планирует расширять поддержку. Сообщество уже активно обсуждает возможность добавления ядер для других архитектур, таких как MI300X.

Кого затронет эта новость? В первую очередь, это разработчики, использующие AMD MI300 для обучения и инференса моделей ИИ. Инженеры, работающие с ROCm, получат готовые оптимизации, которые раньше приходилось писать самостоятельно. Компании, рассматривающие альтернативы NVIDIA, теперь имеют более весомый аргумент в пользу AMD. Также это полезно для исследователей, которые хотят экспериментировать с аппаратным обеспечением без привязки к одному вендору. В долгосрочной перспективе, если Hugging Face продолжит развивать эту инициативу, экосистема AMD может стать значительно сильнее.

Что пока неизвестно На данный момент неясно, насколько эти ядра совместимы с другими моделями, кроме тех, что были протестированы. Hugging Face не раскрывает планы по расширению коллекции, но учитывая открытый характер проекта, сообщество может внести свой вклад. Также нет информации о поддержке для MI300X или других версий ускорителя. Возможно, в будущем появятся ядра для более широкого спектра операций и моделей. Пока разработчикам рекомендуется самостоятельно тестировать ядра на своих задачах и сообщать об ошибках.

Выводы Выпуск кастомных ядер для AMD MI300 — значимый шаг в развитии открытой экосистемы ИИ. Hugging Face демонстрирует, что даже без прямого участия производителя можно существенно улучшить производительность аппаратного обеспечения. Это может стимулировать AMD активнее развивать программную поддержку, а также привлечь новых пользователей. Для разработчиков это возможность получить бесплатный прирост скорости без сложных оптимизаций. В условиях растущей конкуренции на рынке ускорителей ИИ, такие инициативы помогают снизить зависимость от одного поставщика и ускорить инновации.