MulTTiPop: новый датасет для оценки моделей транскрипции поп-музыки
Группа исследователей из Carnegie Mellon University представила MulTTiPop — новый датасет для оценки моделей автоматической транскрипции музыки (AMT). Этот датасет включает 572 фрагмента поп-музыки общей длительностью 3,5 часа, каждый из которых сопровождается многодорожечной MIDI-записью. В отличие

Группа исследователей из Carnegie Mellon University представила MulTTiPop — новый датасет для оценки моделей автоматической транскрипции музыки (AMT). Этот датасет включает 572 фрагмента поп-музыки общей длительностью 3,5 часа, каждый из которых сопровождается многодорожечной MIDI-записью. В отличие от многих существующих наборов данных, MulTTiPop охватывает поп-музыку разных десятилетий — с 1930-х по 2000-е годы — и различные жанры, что позволяет более объективно оценивать модели на реальном музыкальном материале. Результаты первых тестов показывают, что даже лучшие современные модели далеки от совершенства, что открывает широкие возможности для дальнейших исследований.
Почему MulTTiPop важен для автоматической транскрипции музыки
Существующие датасеты для AMT часто ограничены по жанрам или качеству аннотаций. Многие из них сосредоточены на классической музыке или простых инструментальных композициях, что не отражает сложности современной поп-музыки. MulTTiPop заполняет этот пробел, предлагая тщательно подобранные фрагменты поп-музыки с точными MIDI-аннотациями. Это позволяет разработчикам моделей транскрипции тестировать свои алгоритмы на более разнообразном и реалистичном материале, что критически важно для коммерческого применения — например, в музыкальных редакторах или сервисах распознавания аккордов.
Как создавался датасет MulTTiPop
Сбор датасета MulTTiPop был сложным многоэтапным процессом. Исследователи сопоставили аудиофрагменты из двух крупных источников — Lakh MIDI и TheoryTab — используя метаданные для первичного отбора. Затем вручную определялась опорная доля (anchor beat) между аудио и MIDI, после чего применялся бит-трекинг и временная деформация MIDI для точной синхронизации. Такой подход гарантирует высокое качество аннотаций, что подтверждается тщательной ручной проверкой. В результате получился набор данных, который можно использовать как бенчмарк для оценки моделей AMT.
Какие результаты показали современные модели на MulTTiPop?
Оценка на MulTTiPop выявила, что лучшая модель, вероятно основанная на трансформерах, достигает лишь 38% F1 по обнаружению начал нот (onset F1). Это значительно ниже, чем результаты на других датасетах, что подчеркивает сложность поп-музыки с её плотной аранжировкой и частым использованием синтезированных звуков. Интересно, что модели показывают ещё более низкие результаты для таких дорожек, как бас или ударные, хотя в аннотации не приведены отдельные метрики. Эти цифры указывают на то, что даже передовые архитектуры имеют большой потенциал для улучшения, особенно в задачах полифонической транскрипции.
Какие модели транскрипции музыки сейчас считаются лучшими?
На сегодняшний день лидирующие подходы в AMT основаны на глубоких нейронных сетях, в частности на архитектурах трансформеров и свёрточных нейросетях. Модели, такие как Google's MT3, OpenAI's Jukebox или разработки на основе WaveNet, показывают высокие результаты на классических датасетах, но на MulTTiPop их производительность падает. Это говорит о том, что поп-музыка с её вокальными партиями, электронными барабанами и сложной гармонией требует более специализированных подходов. Исследователи предполагают, что для улучшения результатов необходимо использовать многодорожечные аннотации и данные с высоким временным разрешением.
Кого затронет появление MulTTiPop?
Новый датасет будет полезен разработчикам моделей автоматической транскрипции музыки, исследователям в области Music Information Retrieval (MIR), а также музыкантам и продюсерам, использующим MIDI-транскрипцию для анализа или создания музыки. Для разработчиков MulTTiPop станет новым бенчмарком, позволяющим сравнивать свои модели с state-of-the-art. Исследователи MIR смогут изучать особенности поп-музыки и разрабатывать более устойчивые алгоритмы. Музыканты и продюсеры, в свою очередь, получат инструмент для более точной транскрипции, что упростит процесс создания ремиксов или обучения игре на слух.
Что пока неизвестно о MulTTiPop?
В опубликованной аннотации не указано, какие именно модели оценивались, кроме упоминания state-of-the-art. Также не приведены метрики для других дорожек (бас, ударные и т.д.) — только onset F1. Это оставляет вопросы о том, как модели справляются с различными инструментами. Кроме того, датасет доступен по ссылке, но детали лицензии и условия использования не раскрыты. Потенциальные пользователи должны уточнить эти аспекты перед применением. Несмотря на это, MulTTiPop уже представляет собой ценный ресурс для сообщества MIR и, вероятно, будет способствовать развитию более точных моделей транскрипции поп-музыки.