HuggingFace открыла код и веса сжатых моделей SD-Small и SD-Tiny для генерации изображений

Компания HuggingFace выпустила в открытый доступ код и веса двух компактных моделей для генерации изображений — SD-Small и SD-Tiny. Эти модели получены с помощью техники дистилляции знаний из оригинальной Stable Diffusion, что позволяет значительно уменьшить их размер без критической потери качества

HuggingFace открыла код и веса сжатых моделей SD-Small и SD-Tiny для генерации изображений

Компания HuggingFace выпустила в открытый доступ код и веса двух компактных моделей для генерации изображений — SD-Small и SD-Tiny. Эти модели получены с помощью техники дистилляции знаний из оригинальной Stable Diffusion, что позволяет значительно уменьшить их размер без критической потери качества. Теперь разработчики и исследователи могут использовать более лёгкие версии Stable Diffusion для создания изображений на устройствах с ограниченными ресурсами, таких как мобильные телефоны или браузеры. Открытие кода и весов ускорит внедрение компактных моделей в приложения и расширит доступ к генеративному ИИ.

Что такое дистилляция знаний и как она работает

Дистилляция знаний — это метод сжатия нейронных сетей, при котором маленькая модель (ученик) обучается имитировать поведение большой модели (учителя). В случае SD-Small и SD-Tiny роль учителя выполняет оригинальная Stable Diffusion. Ученик учится предсказывать те же результаты, что и учитель, но с меньшим количеством параметров. Это позволяет сохранить качество генерации, одновременно уменьшая вычислительные затраты. В отличие от других методов сжатия, таких как квантование или прунинг, дистилляция фокусируется на переносе знаний, а не на сокращении уже обученной модели. В результате SD-Tiny занимает примерно вдвое меньше памяти, чем исходная модель, но при этом генерирует изображения, которые визуально близки к оригиналам.

Почему открытие кода и весов имеет значение

HuggingFace последовательно придерживается принципов открытого ИИ, и этот релиз — очередной шаг в этом направлении. Публикация кода обучения и весов на GitHub и HuggingFace Hub позволяет любому желающему скачать модели, дообучить их под свои задачи или использовать в коммерческих проектах. Это особенно важно для стартапов и независимых разработчиков, у которых нет доступа к мощным GPU. Раньше для запуска Stable Diffusion требовались видеокарты с большим объёмом памяти, например NVIDIA A100 или V100. Теперь же SD-Tiny может работать на устройствах с 4–6 ГБ оперативной памяти, что открывает возможности для интеграции генерации изображений в мобильные приложения, веб-сервисы и даже встраиваемые системы. Кроме того, открытый код позволяет сообществу проверять и улучшать модели, что ускоряет инновации.

Как SD-Small и SD-Tiny сравниваются с оригиналом

Хотя точные метрики качества, такие как FID (Fréchet Inception Distance) и CLIP score, пока не опубликованы, предварительные тесты показывают, что SD-Small и SD-Tiny генерируют изображения, которые визуально сопоставимы с результатами оригинальной Stable Diffusion. Разумеется, при сильном сжатии неизбежны некоторые потери: мелкие детали могут быть менее чёткими, а сложные композиции — менее точными. Однако для многих прикладных задач, таких как создание иллюстраций, эскизов или вариаций изображений, качества более чем достаточно. Разработчики могут выбирать между SD-Small, которая предлагает баланс между размером и качеством, и SD-Tiny, которая максимально оптимизирована для скорости и низкого потребления ресурсов. Важно отметить, что обе модели поддерживают те же возможности, что и оригинал, включая генерацию по текстовому описанию, inpainting и image-to-image.

Какие возможности открываются для разработчиков

С выходом SD-Small и SD-Tiny разработчики получают инструменты, которые можно использовать в реальных приложениях без необходимости арендовать облачные GPU. Например, можно встроить генерацию изображений в мобильное приложение для редактирования фото, создать браузерное расширение для быстрого создания иллюстраций или реализовать функцию генерации аватаров в социальной сети. Кроме того, малый размер моделей упрощает их доставку пользователям — веса SD-Tiny занимают около 1.5 ГБ, что позволяет загружать их по требованию. HuggingFace также предоставляет готовые пайплайны для интеграции с популярными фреймворками, такими как Diffusers и Transformers, что сокращает время разработки. Исследователи, в свою очередь, могут использовать код дистилляции для создания ещё более компактных моделей или адаптации техники к другим архитектурам.

Какие ограничения и нерешённые вопросы остаются

Несмотря на все преимущества, у SD-Small и SD-Tiny есть и ограничения. Во-первых, пока не опубликованы официальные метрики качества, поэтому сложно объективно сравнить их с другими сжатыми моделями, такими как TinySD или Distilled Stable Diffusion от других команд. Во-вторых, неизвестно, планирует ли HuggingFace дальнейшее сжатие до ещё меньших размеров, например до 25% от оригинала. Также остаётся открытым вопрос лицензирования: хотя код и веса открыты, пользователи должны соблюдать условия лицензии CreativeML Open RAIL-M, которая накладывает ограничения на использование моделей для создания вредоносного контента. Наконец, дистилляция может приводить к некоторой потере разнообразия генерируемых изображений, так как ученик учится на ограниченном наборе примеров от учителя.

Кого затронет этот релиз в первую очередь

Новость в первую очередь важна для разработчиков, создающих приложения с генерацией изображений, — теперь они могут использовать более лёгкие модели без ущерба для качества. Исследователи в области сжатия нейросетей получат доступ к готовым инструментам и данным для экспериментов. Наконец, конечные пользователи выиграют от появления более быстрых и доступных генеративных функций в приложениях, которые они уже используют. Например, можно ожидать, что в ближайшее время появятся мобильные приложения для генерации изображений на основе SD-Tiny, работающие полностью на устройстве без отправки данных в облако.

Что пока остаётся неизвестным

На данный момент HuggingFace не раскрыла точные метрики качества для SD-Small и SD-Tiny, такие как FID и CLIP score. Также не объявлено, будет ли продолжена работа над ещё более компактными версиями. Возможно, в будущем появятся модели размером 25% или даже 10% от оригинала. Кроме того, пока неясно, как модели поведут себя на специфических задачах, например при генерации лиц или текста. Сообщество ожидает дополнительных бенчмарков и сравнений. Тем не менее, уже сейчас можно сказать, что открытие SD-Small и SD-Tiny — значительный шаг в демократизации генеративного ИИ.