Google выпустила PaliGemma 2: открытые модели зрения и языка для разработчиков

Google представила новое семейство vision-language моделей PaliGemma 2, которое уже доступно в открытом доступе через платформу Hugging Face. Эти модели построены на основе архитектуры Gemma 2 и предназначены для решения широкого спектра задач, связанных с анализом изображений и текста. PaliGemma 2

Google выпустила PaliGemma 2: открытые модели зрения и языка для разработчиков

Google представила новое семейство vision-language моделей PaliGemma 2, которое уже доступно в открытом доступе через платформу Hugging Face. Эти модели построены на основе архитектуры Gemma 2 и предназначены для решения широкого спектра задач, связанных с анализом изображений и текста. PaliGemma 2 — одна из первых открытых моделей от Google, объединяющих компьютерное зрение и обработку естественного языка, что открывает новые возможности для разработчиков и исследователей.

Что такое PaliGemma 2 и чем она отличается от предшественников

PaliGemma 2 представляет собой эволюцию оригинальной модели PaliGemma, выпущенной ранее в этом году. Основное отличие — использование более мощной архитектуры Gemma 2, которая обеспечивает лучшую производительность и масштабируемость. Модель доступна в трех вариантах размера: 3 миллиарда, 10 миллиардов и 28 миллиардов параметров. Это позволяет разработчикам выбирать компромисс между скоростью работы и точностью в зависимости от конкретных задач.

Модели предобучены на огромном наборе пар «изображение-текст», что позволяет им выполнять такие задачи, как распознавание объектов, ответы на вопросы по изображениям, создание подписей и оптическое распознавание символов (OCR). Для работы с PaliGemma 2 требуется библиотека Transformers и PyTorch, что делает ее доступной для большинства специалистов по машинному обучению.

Почему открытые модели зрения и языка важны для индустрии

До недавнего времени большинство мощных vision-language моделей были проприетарными и доступными только через API. PaliGemma 2 — одна из первых открытых моделей от Google, объединяющих зрение и язык. Это означает, что разработчики могут загрузить веса модели и дообучить ее на своих данных, не полагаясь на сторонние сервисы. Такой подход ускоряет внедрение ИИ в различные области: от анализа медицинских снимков до автоматического описания товаров в интернет-магазинах.

Открытость модели также способствует прозрачности исследований. Ученые могут изучать внутреннее устройство модели, выявлять возможные предвзятости и улучшать ее характеристики. Это особенно важно для таких чувствительных областей, как медицина и юриспруденция, где ошибки ИИ могут иметь серьезные последствия.

Какие задачи можно решать с помощью PaliGemma 2

PaliGemma 2 способна выполнять множество задач компьютерного зрения и обработки текста. Например, она может распознавать объекты на изображении и отвечать на вопросы о них: «Что изображено на картинке?» или «Сколько людей на фото?». Модель также умеет генерировать подписи к изображениям, что полезно для создания альт-текстов или описаний товаров. Кроме того, PaliGemma 2 поддерживает OCR — распознавание текста на изображениях, что позволяет извлекать информацию из документов, вывесок или экранов.

Благодаря своей архитектуре, модель может быть дообучена на специализированных датасетах для решения узких задач. Например, в медицине ее можно научить анализировать рентгеновские снимки, а в e-commerce — автоматически классифицировать товары по фотографиям.

Кому будет полезна новая модель

PaliGemma 2 ориентирована в первую очередь на разработчиков, работающих с компьютерным зрением и NLP, а также на исследователей в области искусственного интеллекта. Компании, создающие продукты на основе анализа изображений, такие как интернет-магазины, медицинские стартапы или разработчики автономных систем, также получат выгоду от использования этой модели. Благодаря открытому доступу, даже небольшие команды могут интегрировать передовые технологии без значительных затрат.

Что пока остается неизвестным о PaliGemma 2

Несмотря на анонс, Google не раскрыла точные датасеты, использованные для обучения модели, а также сравнительные бенчмарки с конкурентами, такими как LLaVA или GPT-4V. Пока неизвестно, планирует ли компания выпустить более крупные версии или специализированные модели для конкретных доменов. Также нет информации о том, как модель справляется с задачами, требующими понимания контекста или рассуждений, что является слабым местом многих vision-language моделей.

Тем не менее, PaliGemma 2 представляет собой значительный шаг вперед в области открытых моделей ИИ. Она демонстрирует приверженность Google принципам открытости и доступности технологий, что может стимулировать дальнейшие инновации в сообществе разработчиков.