Самообучающиеся ИИ научились группировать объекты как люди: прорыв DINO

Исследователи обнаружили, что самообучающиеся модели искусственного интеллекта на основе трансформеров, обученные методом DINO, способны группировать объекты на изображениях так же, как это делают люди. Этот прорыв в компьютерном зрении открывает путь к созданию систем, которые воспринимают визуальн

Самообучающиеся ИИ научились группировать объекты как люди: прорыв DINO

Исследователи обнаружили, что самообучающиеся модели искусственного интеллекта на основе трансформеров, обученные методом DINO, способны группировать объекты на изображениях так же, как это делают люди. Этот прорыв в компьютерном зрении открывает путь к созданию систем, которые воспринимают визуальный мир более естественно и интуитивно.

В ходе эксперимента участникам показывали пары точек на изображениях и просили определить, принадлежат ли они одному объекту или разным. Результаты сравнили с предсказаниями нескольких моделей компьютерного зрения, включая DINO, CLIP и другие. Оказалось, что модели на основе трансформеров с самообучением DINO демонстрируют наилучшее соответствие человеческому восприятию: их ответы почти совпадали с реакцией людей как по точности, так и по времени.

Как проходил эксперимент

Ученые подготовили более 1000 различных стимулов — пар точек, размещенных на натуралистических сценах: фотографиях животных, предметов, пейзажей. Участники эксперимента (люди) оценивали, находятся ли две точки на одном объекте или на разных. Время реакции фиксировалось. Затем те же стимулы подавались моделям ИИ, и их предсказания сравнивались с человеческими данными.

Ключевым показателем стала «объектно-центричность» представлений — то, насколько похожи внутренние признаки (патчи) внутри одного объекта по сравнению с разными объектами. Модель DINO показала самую высокую объектную структуру: её внутренние представления четко разделяли границы объектов, даже на сложных сценах с частичным перекрытием.

Почему самообучение оказалось эффективнее

В отличие от традиционных моделей, которые обучаются на размеченных данных (например, с указанием границ объектов), DINO использует самообучение: модель учится на самих изображениях, без внешних подсказок. Это позволяет ей выявлять естественные закономерности в данных, которые, как оказалось, совпадают с человеческим восприятием.

Дополнительно исследователи обнаружили, что перенос Gram-матрицы (структуры сходства патчей) от самообучающейся модели к контролируемой улучшает согласованность с поведением человека. Это означает, что знания о группировке объектов можно передавать между моделями, повышая их «человечность».

Какие модели сравнивались

В эксперименте участвовали несколько типов моделей: сверточные нейросети (ResNet), трансформеры (ViT), обученные с учителем и без, а также гибридные архитектуры. DINO на базе трансформеров значительно превзошла остальные по корреляции с человеческими данными. Интересно, что модель CLIP, обученная на парах текст-изображение, показала худшие результаты, несмотря на свою популярность.

Что это значит для будущего ИИ

Способность ИИ группировать объекты как люди — важный шаг к созданию систем, которые «видят» мир по-человечески. Это может улучшить распознавание образов, робототехнику, где требуется точное выделение объектов, и взаимодействие человека с ИИ. Например, робот, который понимает, что чашка и ручка — разные объекты, сможет безопаснее манипулировать предметами.

Кроме того, результаты помогают когнитивным наукам: модели, подобные DINO, могут служить инструментом для изучения механизмов зрительного восприятия у людей.

Какие ограничения остаются

Пока неясно, насколько хорошо эти результаты обобщаются на видео и 3D-сцены. В реальном мире объекты движутся, меняют форму, и их группировка может быть сложнее. Также ученые не до конца понимают, какие именно механизмы в архитектуре DINO отвечают за объектную группировку. Возможно, это связано с механизмом внимания, но точная причина требует дальнейших исследований.

Перспективы применения

Разработчики компьютерного зрения уже могут использовать подход DINO для создания более «человечных» моделей. В робототехнике такие модели помогут улучшить навигацию и взаимодействие с объектами. В медицине — точнее выделять органы на снимках. А в дополненной реальности — более естественно совмещать виртуальные объекты с реальными.

Исследование показывает, что самообучение — мощный инструмент для приближения ИИ к человеческому восприятию. Возможно, в будущем все модели компьютерного зрения будут обучаться по принципу DINO, чтобы видеть мир так, как видим его мы.