Intel и Hugging Face ускорили Stable Diffusion на CPU в 2 раза: что это значит
Intel совместно с Hugging Face представили оптимизированную версию Stable Diffusion, которая работает на процессорах Intel, включая Xeon и Core, со значительным ускорением. В блоге Hugging Face опубликовано руководство по использованию OpenVINO и INT8-квантования для ускорения инференса моделей Stab

Intel совместно с Hugging Face представили оптимизированную версию Stable Diffusion, которая работает на процессорах Intel, включая Xeon и Core, со значительным ускорением. В блоге Hugging Face опубликовано руководство по использованию OpenVINO и INT8-квантования для ускорения инференса моделей Stable Diffusion на CPU. Это открывает новые возможности для генерации изображений без дорогих GPU.
Почему ускорение Stable Diffusion на CPU так важно
Большинство пользователей запускают Stable Diffusion на GPU, но многие сценарии требуют эффективной работы на CPU. Например, серверные развёртывания, edge-устройства и ноутбуки без дискретной графики часто не имеют доступа к мощным видеокартам. Ускорение в 2 раза делает генерацию изображений на CPU практически применимой, что снижает порог входа для разработчиков и компаний.
Какие преимущества получают пользователи Intel?
Оптимизация позволяет использовать существующие процессоры Intel для задач, которые раньше требовали GPU. Это особенно актуально для организаций, уже инвестировавших в серверы на базе Intel Xeon, или для владельцев ноутбуков с интегрированной графикой Intel Iris Xe. Ускорение инференса означает, что время генерации одного изображения сокращается с 30 до 15 секунд, что делает рабочий процесс более комфортным.
Как Intel добилась двукратного ускорения
Оптимизация основана на нескольких ключевых технологиях. Во-первых, используется Intel OpenVINO toolkit для конвертации и оптимизации моделей. Во-вторых, применяется INT8-квантование, которое заменяет 32-битные числа с плавающей запятой на 8-битные целые, снижая вычислительную нагрузку. В-третьих, внесены специальные патчи для компонентов UNet и VAE, которые являются наиболее ресурсоёмкими частями Stable Diffusion.
Что такое INT8-квантование и как оно влияет на производительность?
INT8-квантование — это метод сжатия модели, при котором веса и активации представляются 8-битными целыми числами вместо 32-битных чисел с плавающей запятой. Это уменьшает объём данных, необходимых для вычислений, и позволяет процессору обрабатывать их быстрее. В тестах на Intel Xeon 4-го поколения (Sapphire Rapids) время генерации одного изображения размером 512x512 пикселей за 50 шагов сократилось с примерно 30 секунд до примерно 15 секунд по сравнению с обычным FP32-инференсом. На Core i7-13700K ускорение аналогичное.
Кому будет полезна эта оптимизация
Оптимизация полезна разработчикам, развёртывающим модели на серверах без GPU, владельцам ноутбуков с интегрированной графикой Intel, а также компаниям, использующим Intel-инфраструктуру для AI-нагрузок. Например, если вы создаёте приложение для генерации изображений на базе CPU, эта технология позволит значительно улучшить пользовательский опыт без дополнительных затрат на оборудование.
Как начать использовать ускоренную версию Stable Diffusion?
Hugging Face опубликовал подробное руководство, которое включает шаги по установке OpenVINO, конвертации модели и запуску инференса. Для этого потребуется Python и несколько библиотек. Процесс не требует глубоких знаний в области оптимизации нейросетей, что делает его доступным для широкого круга разработчиков.
Что пока остаётся неизвестным
Пока не раскрыта точная методика квантования и её влияние на качество изображений. Хотя INT8-квантование обычно незначительно снижает точность, в задачах генерации изображений даже небольшие артефакты могут быть заметны. Также нет информации о поддержке других моделей, кроме Stable Diffusion 1.5 и 2.1. Возможно, в будущем Intel расширит совместимость на более новые версии, такие как SDXL.
Перспективы развития
Ускорение Stable Diffusion на CPU — это важный шаг к демократизации AI. Если Intel сможет сохранить качество изображений при двукратном ускорении, это может изменить рынок: компании смогут развёртывать генеративные модели на существующем оборудовании, не покупая дорогие GPU. Кроме того, технология OpenVINO может быть применена и к другим моделям, что открывает широкие перспективы для edge-вычислений и локального AI.