UniRef-UAV: мультимодальный бенчмарк для понимания запросов на изображениях с дронов

Группа исследователей представила UniRef-UAV — первый мультимодальный бенчмарк для задачи универсального понимания запросов на изображениях, полученных с беспилотных летательных аппаратов. Этот инструмент позволяет одновременно обрабатывать текстовые, визуальные и смешанные запросы, что критически в

UniRef-UAV: мультимодальный бенчмарк для понимания запросов на изображениях с дронов

Группа исследователей представила UniRef-UAV — первый мультимодальный бенчмарк для задачи универсального понимания запросов на изображениях, полученных с беспилотных летательных аппаратов. Этот инструмент позволяет одновременно обрабатывать текстовые, визуальные и смешанные запросы, что критически важно для реальных сценариев, где дроны используются в поисково-спасательных операциях, мониторинге и наблюдении. Вместе с бенчмарком авторы предложили baseline-метод UAV-URNet, который демонстрирует стабильное качество и легкость реализации.

Почему существующие бенчмарки не подходят для БПЛА

Традиционные бенчмарки для понимания запросов, такие как RefCOCO, работают только с текстовыми запросами и одиночными объектами. Однако в сценариях с беспилотниками часто возникают более сложные ситуации: цель может отсутствовать, присутствовать в нескольких экземплярах, а запрос может быть задан не только текстом, но и эталонным изображением. Например, оператор дрона может сказать "найди такой же автомобиль, как на этом фото" или "покажи все красные машины". UniRef-UAV восполняет этот пробел, предлагая три типа запросов: только текст, только изображение и текст+изображение. Для текстовых и смешанных запросов поддерживается от нуля до нескольких целей, а для запросов только по изображению — проверка наличия одного экземпляра.

Как устроен UniRef-UAV

Бенчмарк включает протоколы оценки in-domain и cross-domain. In-domain оценка проверяет работу модели на данных из того же распределения, что и обучение, а cross-domain — на новых, невиданных ранее сценариях. Это особенно важно для дронов, которые могут работать в разных условиях: городская застройка, лес, пустыня. Baseline-метод UAV-URNet использует детекционный подход: гетерогенные запросы отображаются в общее пространство, а предсказание множества целей выполняется через set prediction. Эксперименты показали, что UAV-URNet лучше различает отсутствие цели и имеет более легковесную реализацию по сравнению с большими мультимодальными моделями (MLLM), такими как GPT-4V или LLaVA.

Какие задачи решает UniRef-UAV?

Основная задача — универсальное понимание запросов (Universal Referring), которое включает в себя несколько подзадач: понимание выражения (Referring Expression Comprehension), поиск по эталонному изображению (Referring Image Retrieval) и мультимодальное понимание инструкций. Например, если оператор говорит "найди человека в синей куртке, похожего на этого", система должна одновременно обработать текст и изображение, чтобы выдать результат. Бенчмарк также поддерживает сценарии с отсутствием цели (например, "найди красную машину", но на снимке ее нет) и множественными целями ("найди все грузовики").

Кому это пригодится

Разработчикам систем компьютерного зрения для БПЛА, исследователям в области мультимодального понимания сцен, а также инженерам, создающим приложения для автономных дронов. Например, в поисково-спасательных операциях дрон может искать выживших по описанию или фото, в мониторинге — отслеживать заданные объекты, в наблюдении — идентифицировать цели по мультимодальным запросам. UniRef-UAV позволяет тестировать и сравнивать модели в реалистичных условиях, что ускоряет разработку надежных систем.

Что пока неизвестно

Дата публикации аннотаций, визуальных запросов, разметки и кода пока не объявлена. Авторы обещают выложить их в открытый доступ для воспроизводимости. Следите за обновлениями на arXiv и GitHub проекта.