Google DeepMind запускает Lyria 3 в Gemini: генерация музыки по тексту и изображениям

Google DeepMind представила Lyria 3 — новейшую модель для генерации музыки, которая теперь интегрирована в приложение Gemini. Это означает, что любой пользователь может создать 30-секундный трек, просто описав его словами или загрузив картинку. Например, вы пишете «спокойная фортепианная мелодия» ил

Google DeepMind запускает Lyria 3 в Gemini: генерация музыки по тексту и изображениям

Google DeepMind представила Lyria 3 — новейшую модель для генерации музыки, которая теперь интегрирована в приложение Gemini. Это означает, что любой пользователь может создать 30-секундный трек, просто описав его словами или загрузив картинку. Например, вы пишете «спокойная фортепианная мелодия» или даёте фото заката — и нейросеть превращает это в музыку. Такой шаг делает творчество доступным для всех, кто хочет быстро получить оригинальный саундтрек без специальных навыков.

Lyria 3 — это результат многолетних исследований DeepMind в области генеративного ИИ. Модель обучена на огромном массиве музыкальных произведений разных жанров и стилей: от классики до электроники. Она понимает не только текст, но и визуальные образы, что позволяет передавать настроение снимка через звук. Пока что длина трека ограничена 30 секундами, но этого достаточно для коротких видео, подкастов или рекламных роликов.

Как работает Lyria 3 в Gemini

Чтобы создать музыку, нужно открыть Gemini и выбрать опцию генерации. Затем можно ввести текстовый промпт — например, «энергичная танцевальная музыка с басами» или «меланхоличная гитарная баллада». Альтернативный способ — загрузить изображение, и нейросеть проанализирует его цвета, композицию и атмосферу, чтобы подобрать соответствующее звучание. Результат появляется через несколько секунд.

Технически Lyria 3 использует диффузионную архитектуру, адаптированную для аудио. Она генерирует не просто последовательность нот, а полноценную звуковую дорожку с тембром, ритмом и гармонией. DeepMind утверждает, что модель способна имитировать различные инструменты и стили, от оркестровых аранжировок до синтезаторных партий.

Почему это важно для пользователей Gemini

Интеграция музыки превращает Gemini из текстового ассистента в мультимодальный инструмент. Теперь в одном приложении можно работать с текстом, изображениями и аудио. Это особенно ценно для создателей контента: блогеры могут генерировать фоновую музыку для видео, маркетологи — создавать джинглы для рекламы, а разработчики игр — быстро прототипировать звуковое сопровождение.

Для обычных пользователей это способ самовыражения. Можно поэкспериментировать с разными жанрами, создать уникальный рингтон или просто развлечься, описывая свои эмоции словами. DeepMind подчёркивает, что модель безопасна и не генерирует контент, нарушающий авторские права, хотя детали лицензирования пока не раскрыты.

Какие стили и жанры поддерживаются

Lyria 3 обучена на широком спектре музыкальных направлений. Пользователи сообщают, что модель хорошо справляется с электроникой, хип-хопом, классикой, джазом и поп-музыкой. Можно указать конкретный инструмент — например, «соло на саксофоне» или «игра на укулеле». Также поддерживаются смешанные стили: если написать «лоу-фай с элементами джаза», нейросеть попробует объединить эти черты.

Генерация на основе изображений даёт более абстрактные результаты. Если загрузить фото ночного города, трек может быть с электронными битами и атмосферными синтезаторами, а для снимка леса — акустическая гитара и звуки природы. DeepMind не раскрывает точные алгоритмы, но, вероятно, модель использует визуальные признаки для определения темпа, тональности и настроения.

Кому будет полезна новая функция

В первую очередь — создателям контента для социальных сетей. Короткие видео на TikTok, Reels или YouTube Shorts требуют быстрой и оригинальной музыки, и Lyria 3 может заменить библиотеки стоковых треков. Маркетологи получат возможность создавать уникальные аудиобренды без обращения к композиторам. Разработчики игр смогут генерировать фоновую музыку для инди-проектов.

Образовательные учреждения тоже могут использовать Lyria 3: студенты музыкальных специальностей могут анализировать, как нейросеть интерпретирует текстовые описания, а преподаватели — демонстрировать связь между визуальным искусством и музыкой. Для обычных пользователей это просто увлекательный инструмент для творчества.

Чего пока не хватает

Несмотря на впечатляющие возможности, у Lyria 3 есть ограничения. Главное — длительность трека: 30 секунд недостаточно для полноценных песен или инструментальных композиций. DeepMind не сообщает, планируется ли увеличение этого лимита. Также нет информации о поддержке других языков, кроме английского, и доступности в разных регионах.

Вопросы авторского права остаются открытыми. Можно ли использовать сгенерированную музыку в коммерческих проектах? Нужно ли указывать авторство DeepMind? Пока компания не дала чётких ответов. Вероятно, в будущем появятся лицензионные соглашения, но сейчас пользователи действуют на свой страх и риск.

Когда Lyria 3 станет доступна

Функция уже развёртывается в приложении Gemini для части пользователей. Полный роллаут ожидается в ближайшие недели. DeepMind рекомендует обновить приложение до последней версии. Если опция не появилась, стоит подождать — доступ расширяется постепенно.

Какие перспективы у генерации музыки в ИИ

Запуск Lyria 3 — часть глобального тренда на демократизацию творчества. Ранее DeepMind представила модели для генерации видео и изображений, а теперь добавила аудио. В будущем можно ожидать объединения всех модальностей в одном инструменте: вы описываете сцену, а ИИ создаёт видео с музыкой и голосом.

Конкуренты тоже не стоят на месте: OpenAI разрабатывает Jukebox, а Meta — MusicGen. Однако Lyria 3 выгодно отличается интеграцией с Gemini и поддержкой изображений. Это делает её удобной для повседневного использования.

Как начать пользоваться Lyria 3

Если у вас уже есть доступ, откройте Gemini и найдите раздел «Создать музыку». Введите текстовый промпт или загрузите изображение. Через несколько секунд вы получите трек, который можно прослушать и скачать. Пока нет возможности редактировать результат, но DeepMind обещает добавить функции настройки в будущих обновлениях.

Для лучших результатов старайтесь описывать не только жанр, но и настроение, темп, инструменты. Например, «быстрая энергичная музыка с ударными и синтезатором» даст более точный результат, чем просто «музыка». Экспериментируйте с разными промптами и изображениями, чтобы понять возможности модели.

Что говорят пользователи

Первые отзывы в основном положительные. Пользователи отмечают высокое качество генерации и точность передачи настроения. Некоторые критикуют ограничение в 30 секунд и отсутствие поддержки русского языка. DeepMind, вероятно, учтёт эти пожелания в следующих версиях.

Заключение

Lyria 3 в Gemini — значительный шаг вперёд для генеративного ИИ. Музыка становится доступной каждому, а Gemini превращается в универсальный творческий инструмент. Несмотря на текущие ограничения, потенциал огромен. Следите за обновлениями, чтобы не пропустить новые возможности.