JuZhou 1.0: первая edge-модель T2I, обученная на китайских ускорителях
Китайская компания представила JuZhou 1.0 — первую в мире модель генерации изображений по тексту, которая полностью работает на устройстве и была обучена исключительно на китайских AI-ускорителях Sugon K100. Это событие знаменует прорыв в области edge-вычислений и технологической независимости Китая

Китайская компания представила JuZhou 1.0 — первую в мире модель генерации изображений по тексту, которая полностью работает на устройстве и была обучена исключительно на китайских AI-ускорителях Sugon K100. Это событие знаменует прорыв в области edge-вычислений и технологической независимости Китая от западных чипов. Модель способна генерировать изображения по китайским текстовым запросам за считанные секунды прямо на смартфоне, без отправки данных в облако.
Что такое JuZhou 1.0 и как она работает
JuZhou 1.0 — это модель генерации изображений по тексту (text-to-image, T2I), которая работает непосредственно на устройстве пользователя, а не на удалённых серверах. Она состоит из двух основных компонентов: шумоподавляющей U-Net с 0,385 миллиарда параметров и дистиллированного декодера с 1,90 миллиона параметров. Общий размер модели составляет около 0,387 миллиарда параметров, что значительно меньше, чем у многих облачных аналогов.
Для обучения использовались два ключевых метода: Rectified Flow и DMD2 дистилляция. Rectified Flow позволяет модели эффективно учиться преобразовывать случайный шум в осмысленные изображения, а DMD2 дистилляция сокращает количество шагов инференса до четырёх. Это означает, что модель может создать изображение всего за четыре итерации, что критически важно для работы на мобильных устройствах с ограниченными вычислительными ресурсами.
Обучение проводилось на 9 миллионах китайских пар «текст-изображение» с выравниванием семантики. Благодаря этому модель понимает китайские промпты напрямую, без необходимости перевода на английский. Это существенное преимущество для китайских пользователей, которые могут вводить запросы на родном языке.
Какие результаты показывает JuZhou 1.0 по сравнению с другими моделями?
Базовая версия JuZhou 1.0 с 28 шагами достигает показателя GenEval 0,69, что превосходит такие известные модели, как SDXL (0,55), SD3-Medium (0,62) и IF-XL (0,61). GenEval — это метрика оценки качества генерации изображений, и результат 0,69 говорит о высокой реалистичности и соответствии текстовому описанию.
На практике это означает, что модель способна создавать детализированные и правдоподобные изображения по сложным запросам. Например, для запроса «красный дракон, летящий над Великой Китайской стеной на закате» модель сгенерирует изображение с правильной композицией, цветами и текстурами.
Какова производительность JuZhou 1.0 на мобильных устройствах?
Производительность JuZhou 1.0 была протестирована на флагманских чипах Snapdragon. На Snapdragon 8 Elite Gen 5 четырёхшаговый U-Net выполняется примерно за 1,6 секунды. Полный пайплайн от текстового запроса до готового изображения (poetry-to-image) на смартфоне Xiaomi 17 Pro Max занимает 4,5 секунды.
Это впечатляющий результат для модели, работающей полностью офлайн. Для сравнения, облачные генеративные модели обычно требуют отправки запроса на сервер и ожидания ответа, что может занимать от нескольких секунд до минут в зависимости от загрузки сети и сервера. JuZhou 1.0 устраняет эту задержку, обеспечивая практически мгновенную генерацию прямо на устройстве.
Почему это важно для конфиденциальности пользователей?
Одно из ключевых преимуществ JuZhou 1.0 — полная работа офлайн. Это означает, что пользовательские данные (текстовые запросы и сгенерированные изображения) не покидают устройство. В эпоху растущих опасений по поводу конфиденциальности и утечек данных это особенно ценно. Пользователи могут использовать модель без риска передачи личной информации третьим лицам.
Кроме того, офлайн-работа снижает затраты на облачные вычисления. Разработчикам мобильных приложений не нужно платить за серверные мощности, а пользователи могут генерировать изображения без интернет-соединения.
Кого затронет появление JuZhou 1.0?
Разработчики мобильных приложений получат инструмент для интеграции генерации изображений в свои продукты без зависимости от облачных API. Производители смартфонов, такие как Xiaomi, уже внедряют модель в свои устройства, что может стать новым конкурентным преимуществом.
Исследователи в области генеративного ИИ увидят, что высокое качество возможно при сверхмалом размере модели. Это открывает путь для дальнейшей оптимизации и создания ещё более эффективных архитектур.
Китайские компании, стремящиеся к технологической независимости от NVIDIA, получают доказательство того, что отечественные ускорители Sugon K100 способны обучать конкурентоспособные модели. Это снижает зависимость от западных чипов и укрепляет технологический суверенитет Китая.
Что пока неизвестно о JuZhou 1.0?
Несмотря на впечатляющие характеристики, остаётся несколько открытых вопросов. Пока не объявлено, будет ли модель доступна для сторонних разработчиков и на каких условиях. Также неизвестны точные условия лицензирования, что может ограничить её использование в коммерческих проектах.
Отсутствует сравнение с другими edge-моделями, например, MobileDiffusion. Хотя JuZhou 1.0 превосходит облачные модели по метрике GenEval, прямое сравнение с аналогами, работающими на устройстве, дало бы более полную картину.
Наконец, производительность на других чипах, кроме Snapdragon, пока не раскрыта. Для широкого распространения необходимо, чтобы модель работала эффективно на различных мобильных платформах, включая китайские процессоры.
Перспективы развития edge-генерации изображений
JuZhou 1.0 демонстрирует, что будущее генерации изображений — за устройствами. С каждым годом мобильные чипы становятся мощнее, а модели — компактнее. Уже сейчас можно представить, что в ближайшие годы каждый смартфон будет способен генерировать фотореалистичные изображения по текстовому описанию.
Это изменит не только индустрию развлечений и социальных сетей, но и профессиональные сферы: дизайн, рекламу, образование. Пользователи смогут создавать контент на ходу, без необходимости в мощных компьютерах или облачных сервисах.
Китайский опыт с JuZhou 1.0 также показывает, что технологическая независимость достижима. Если другие страны последуют этому примеру, мы можем увидеть рассвет локальных экосистем генеративного ИИ, адаптированных под местные языки и культурные особенности.