Новый бенчмарк оценил способность мультиязычных VLM использовать пространственные дейктические выражения
Пространственные дейктические выражения — слова вроде «этот» и «тот», значение которых зависит от контекста — остаются сложной задачей для современных vision-language моделей (VLM). Учёные представили новый бенчмарк, который оценивает, насколько хорошо мультиязычные VLM справляются с такими выражени

Пространственные дейктические выражения — слова вроде «этот» и «тот», значение которых зависит от контекста — остаются сложной задачей для современных vision-language моделей (VLM). Учёные представили новый бенчмарк, который оценивает, насколько хорошо мультиязычные VLM справляются с такими выражениями в разных языках. Эксперименты на четырёх языках показали, что модели выбирают указательные местоимения иначе, чем люди, особенно когда речь идёт о расстоянии до объекта. Это исследование подчёркивает важность учёта как лингвистических, так и пространственных признаков для корректного понимания дейксиса.
Почему это важно для развития VLM
Пространственные дейктические выражения требуют от VLM совместного анализа текста и визуальной сцены, а также понимания языковых особенностей. Например, в английском языке выбор между «this» и «that» зависит от расстояния до объекта, в то время как в турецком или японском существуют более тонкие градации. Отсутствие этого навыка ограничивает применение моделей в робототехнике, навигации и системах с голосовым управлением, где команды часто содержат указания типа «возьми эту чашку» или «поверни налево у того здания». Новый бенчмарк позволяет выявить пробелы в мультиязычном пространственном мышлении VLM и направить усилия исследователей на улучшение этих способностей.
Как устроен новый бенчмарк
Бенчмарк охватывает четыре языка: английский, японский, турецкий и, вероятно, ещё один (точный список не раскрыт). В тестах модели должны были выбрать правильное указательное местоимение в зависимости от расстояния до объекта на изображении. Например, на картинке с двумя чашками — ближней и дальней — модель должна определить, какое слово уместно: «эта» или «та». Результаты показали, что модели не соответствуют человеческому поведению в выборе «этот» vs «тот». В работе подчёркивается, что для корректного использования дейктических выражений VLM должны учитывать как лингвистические, так и пространственные признаки.
Какие конкретные результаты получены?
Хотя полные данные по каждой модели и языку пока не опубликованы, известно, что ни одна из протестированных VLM не достигла уровня человека. Модели часто путали дистанционные категории, особенно в языках с более сложной системой дейксиса. Например, в турецком, где есть три степени удалённости (bu, şu, o), модели показывали худшие результаты, чем в английском с двумя категориями. Это указывает на то, что современные VLM не обладают глубоким пониманием пространственных отношений, а скорее полагаются на поверхностные статистические закономерности.
Кого затронет это исследование
Разработчиков мультиязычных VLM, исследователей в области компьютерного зрения и NLP, а также создателей роботизированных систем и голосовых помощников, работающих с пространственными командами. Для них новый бенчмарк станет инструментом оценки и улучшения моделей. Кроме того, результаты могут повлиять на дизайн обучающих наборов данных: чтобы модели научились правильно использовать дейктические выражения, потребуется больше примеров с учётом расстояния и языковых нюансов.
Что пока неизвестно
Конкретные результаты по каждой модели и языку, а также полный состав бенчмарка пока не раскрыты. Также неясно, насколько сильно различается производительность моделей на языках с разной системой дейктических выражений. Будущие исследования, вероятно, прольют свет на эти вопросы и предложат пути улучшения VLM в области пространственного дейксиса.