Самообучающиеся ИИ научились группировать объекты как люди: прорыв DINO
Исследователи обнаружили, что самообучающиеся модели искусственного интеллекта на основе трансформеров, обученные методом DINO, способны группировать объекты на изображениях так же, как это делают люди. Этот прорыв в компьютерном зрении открывает путь к созданию систем, которые воспринимают визуальн

Исследователи обнаружили, что самообучающиеся модели искусственного интеллекта на основе трансформеров, обученные методом DINO, способны группировать объекты на изображениях так же, как это делают люди. Этот прорыв в компьютерном зрении открывает путь к созданию систем, которые воспринимают визуальный мир более естественно и интуитивно.
В ходе эксперимента участникам показывали пары точек на изображениях и просили определить, принадлежат ли они одному объекту или разным. Результаты сравнили с предсказаниями нескольких моделей компьютерного зрения, включая DINO, CLIP и другие. Оказалось, что модели на основе трансформеров с самообучением DINO демонстрируют наилучшее соответствие человеческому восприятию: их ответы почти совпадали с реакцией людей как по точности, так и по времени.
Как проходил эксперимент
Ученые подготовили более 1000 различных стимулов — пар точек, размещенных на натуралистических сценах: фотографиях животных, предметов, пейзажей. Участники эксперимента (люди) оценивали, находятся ли две точки на одном объекте или на разных. Время реакции фиксировалось. Затем те же стимулы подавались моделям ИИ, и их предсказания сравнивались с человеческими данными.
Ключевым показателем стала «объектно-центричность» представлений — то, насколько похожи внутренние признаки (патчи) внутри одного объекта по сравнению с разными объектами. Модель DINO показала самую высокую объектную структуру: её внутренние представления четко разделяли границы объектов, даже на сложных сценах с частичным перекрытием.
Почему самообучение оказалось эффективнее
В отличие от традиционных моделей, которые обучаются на размеченных данных (например, с указанием границ объектов), DINO использует самообучение: модель учится на самих изображениях, без внешних подсказок. Это позволяет ей выявлять естественные закономерности в данных, которые, как оказалось, совпадают с человеческим восприятием.
Дополнительно исследователи обнаружили, что перенос Gram-матрицы (структуры сходства патчей) от самообучающейся модели к контролируемой улучшает согласованность с поведением человека. Это означает, что знания о группировке объектов можно передавать между моделями, повышая их «человечность».
Какие модели сравнивались
В эксперименте участвовали несколько типов моделей: сверточные нейросети (ResNet), трансформеры (ViT), обученные с учителем и без, а также гибридные архитектуры. DINO на базе трансформеров значительно превзошла остальные по корреляции с человеческими данными. Интересно, что модель CLIP, обученная на парах текст-изображение, показала худшие результаты, несмотря на свою популярность.
Что это значит для будущего ИИ
Способность ИИ группировать объекты как люди — важный шаг к созданию систем, которые «видят» мир по-человечески. Это может улучшить распознавание образов, робототехнику, где требуется точное выделение объектов, и взаимодействие человека с ИИ. Например, робот, который понимает, что чашка и ручка — разные объекты, сможет безопаснее манипулировать предметами.
Кроме того, результаты помогают когнитивным наукам: модели, подобные DINO, могут служить инструментом для изучения механизмов зрительного восприятия у людей.
Какие ограничения остаются
Пока неясно, насколько хорошо эти результаты обобщаются на видео и 3D-сцены. В реальном мире объекты движутся, меняют форму, и их группировка может быть сложнее. Также ученые не до конца понимают, какие именно механизмы в архитектуре DINO отвечают за объектную группировку. Возможно, это связано с механизмом внимания, но точная причина требует дальнейших исследований.
Перспективы применения
Разработчики компьютерного зрения уже могут использовать подход DINO для создания более «человечных» моделей. В робототехнике такие модели помогут улучшить навигацию и взаимодействие с объектами. В медицине — точнее выделять органы на снимках. А в дополненной реальности — более естественно совмещать виртуальные объекты с реальными.
Исследование показывает, что самообучение — мощный инструмент для приближения ИИ к человеческому восприятию. Возможно, в будущем все модели компьютерного зрения будут обучаться по принципу DINO, чтобы видеть мир так, как видим его мы.