DeepMind: ИИ видит мир иначе, чем люди — ключевые различия
Искусственный интеллект действительно воспринимает визуальную информацию не так, как человек. Исследователи из Google DeepMind опубликовали научную работу, в которой детально проанализировали принципы группировки объектов современными моделями компьютерного зрения и сравнили их с человеческим воспри

Искусственный интеллект действительно воспринимает визуальную информацию не так, как человек. Исследователи из Google DeepMind опубликовали научную работу, в которой детально проанализировали принципы группировки объектов современными моделями компьютерного зрения и сравнили их с человеческим восприятием. Оказалось, что нейросети опираются на статистические закономерности, которые могут быть совершенно неочевидны для людей, и часто игнорируют семантически важные детали. Это открытие имеет прямое значение для разработки более безопасных и интерпретируемых систем ИИ в таких областях, как автономное вождение, медицинская диагностика и видеонаблюдение.
Как DeepMind изучал различия в восприятии
Чтобы понять, чем отличается визуальное восприятие ИИ от человеческого, исследователи разработали серию специальных тестов. Они оценивали, как различные модели компьютерного зрения — от классических свёрточных нейросетей до современных трансформеров — группируют объекты по таким признакам, как форма, цвет, текстура и функциональное назначение. В экспериментах использовались как стандартные наборы данных, так и специально созданные изображения, где одни и те же объекты можно было сгруппировать разными способами.
Результаты показали, что люди склонны объединять объекты на основе их формы или функции: например, все круглые предметы или все предметы для письма. ИИ же часто полагается на текстуру или цвет, даже если эти признаки не имеют отношения к смыслу сцены. Например, нейросеть может сгруппировать мяч и апельсин только потому, что они оба имеют оранжевый оттенок, игнорируя разницу в форме и назначении.
Почему ИИ группирует объекты иначе, чем человек
Корень различий лежит в том, как обучаются современные модели. Большинство нейросетей тренируются на огромных массивах данных с помощью задачи классификации или распознавания объектов. В процессе обучения они выявляют статистические закономерности, которые позволяют минимизировать ошибки на тренировочных данных. Однако эти закономерности не всегда совпадают с теми, что использует человеческий мозг, который формировался в ходе эволюции для быстрой и надёжной интерпретации визуальной информации.
Человек обладает врождёнными механизмами восприятия, которые позволяют выделять значимые признаки, такие как контуры и целостность объектов. ИИ же лишён такого предварительного знания и может находить корреляции, которые для человека являются случайными. Например, если в обучающей выборке все изображения собак были сделаны на траве, модель может начать ассоциировать собаку с зелёным фоном, а не с формой тела.
Какие конкретные различия выявило исследование DeepMind
В работе были выделены несколько ключевых расхождений. Во-первых, предпочтение текстуры: ИИ часто группирует объекты по текстуре поверхности, тогда как человек — по форме. Во-вторых, игнорирование контекста: модель может не учитывать взаимное расположение объектов, если оно не коррелирует с метками в обучающих данных. В-третьих, чувствительность к незначительным изменениям: небольшое изменение цвета или угла обзора может кардинально изменить решение ИИ, в то время как человек легко справляется с такими вариациями.
Эти различия проявляются в тестах на группировку, где ИИ и людям предлагалось разбить набор изображений на категории. Люди последовательно выбирали категории на основе формы или функции, а ИИ демонстрировал высокую вариативность в зависимости от модели и обучающих данных. Некоторые модели даже показывали «человекоподобное» поведение, но только после специальной настройки или обучения с подкреплением.
Как эти открытия повлияют на развитие ИИ
Понимание различий в восприятии критически важно для создания более надёжных систем. Например, в автономных автомобилях модель может неправильно интерпретировать пешехода, если его одежда имеет необычную текстуру. В медицинской диагностике ИИ может пропустить опухоль, если она по текстуре похожа на здоровую ткань, но отличается по форме. Разработчики теперь могут целенаправленно корректировать архитектуры нейросетей, чтобы они лучше учитывали человеческие приоритеты.
Один из подходов — использование обучения с подкреплением, где модель получает награду за группировку, близкую к человеческой. Другой — внедрение предварительных знаний о форме и контексте в архитектуру сети. Исследователи DeepMind подчёркивают, что простого увеличения объёма данных недостаточно: нужны принципиально новые методы обучения, которые приблизят восприятие ИИ к человеческому.
Какие практические задачи затронут эти результаты
Разработчики систем компьютерного зрения уже сейчас могут использовать эти выводы для улучшения своих моделей. Например, при создании систем видеонаблюдения важно, чтобы ИИ правильно группировал объекты по семантическим категориям, а не по случайным признакам. В робототехнике необходимо, чтобы робот понимал функциональное назначение предметов, а не только их внешний вид.
Пользователи таких систем в будущем увидят более надёжные и интерпретируемые модели. Если сейчас ИИ может ошибаться из-за неожиданных статистических корреляций, то новые подходы позволят снизить количество ложных срабатываний и повысить доверие к автоматическим системам.
Что остаётся неясным и какие вопросы требуют дальнейшего изучения
Несмотря на важные открытия, остаётся много неопределённости. Исследователи пока не могут точно сказать, насколько выявленные различия критичны для реальных приложений. Возможно, в некоторых задачах, таких как распознавание лиц, эти расхождения не играют большой роли. Также неясно, можно ли полностью устранить различия с помощью новых архитектур, таких как vision transformers, или потребуются принципиально иные подходы к обучению.
Кроме того, в работе не раскрываются конкретные модели, которые тестировались, и точные метрики различий. Это затрудняет независимую проверку результатов и их прямое применение в коммерческих продуктах. Будущие исследования должны ответить на эти вопросы, а также изучить, как различия в восприятии влияют на безопасность и справедливость систем ИИ.
Какое будущее ждёт визуальное восприятие ИИ
DeepMind продолжает работу в этом направлении, и можно ожидать, что в ближайшие годы появятся новые методы, позволяющие ИИ видеть мир более «по-человечески». Это не означает, что ИИ должен полностью копировать человеческое восприятие — в некоторых задачах его отличия могут быть преимуществом. Однако для создания безопасных и понятных систем необходимо понимать эти различия и уметь их контролировать.
В конечном счёте, исследование DeepMind — это шаг к более глубокому пониманию того, как работают современные нейросети, и к созданию ИИ, который сможет эффективно взаимодействовать с людьми в реальном мире.