Почему AGI не станет мультимодальным: критика пути через генеративные модели
Может ли машина, лишенная тела, когда-либо достичь настоящего понимания мира? Этот вопрос становится центральным в дискуссии о путях к искусственному общему интеллекту (AGI). Несмотря на впечатляющие успехи генеративных моделей, некоторые исследователи уверены: мультимодальность и большие языковые м

Может ли машина, лишенная тела, когда-либо достичь настоящего понимания мира? Этот вопрос становится центральным в дискуссии о путях к искусственному общему интеллекту (AGI). Несмотря на впечатляющие успехи генеративных моделей, некоторые исследователи уверены: мультимодальность и большие языковые модели ведут в тупик. Статья в The Gradient поднимает фундаментальную проблему — без телесного опыта ИИ остается лишь продвинутым статистическим инструментом, а не разумом.
AGI и мультимодальность: ложный след
Современные генеративные модели, такие как GPT-4 и DALL-E, демонстрируют способность обрабатывать текст, изображения и звук. Однако, по мнению автора статьи, мультимодальность сама по себе не приближает к AGI. Ключевая проблема — отсутствие у моделей воплощенного понимания (embodied understanding), которое лежит в основе человеческого интеллекта. Без физического взаимодействия с миром, утверждается в статье, ИИ остается лишь продвинутым статистическим инструментом.
Почему мультимодальность не решает проблему?
Мультимодальные модели учатся на парах «текст-изображение» или «текст-звук», но это не дает им понимания причинно-следственных связей. Например, модель может описать, что мяч отскочит от стены, но не знает этого на опыте. Как отмечается в статье, настоящее понимание требует сенсомоторного взаимодействия — способности действовать и наблюдать последствия. Без этого модель лишь имитирует интеллект, оставаясь в рамках статистических закономерностей.
Предыстория и контекст
Идея о том, что интеллект требует телесности, восходит к работам Терри Винограда и других пионеров когнитивной науки. В 1970-х годах Виноград создал программу SHRDLU, которая оперировала в простом виртуальном мире блоков, но уже тогда он предупреждал: язык не может быть единственной моделью мышления. Современные же системы, такие как большие языковые модели, по сути, повторяют ту же ошибку — они оперируют символами без доступа к реальному опыту. Это возвращает нас к старой философской проблеме: может ли символьная система обрести смысл, не имея тела?
Технические ограничения генеративных моделей
С технической точки зрения, современные модели страдают от фундаментальных ограничений. Они не способны к планированию, не обладают долговременной памятью и не могут адаптироваться к новым ситуациям без переобучения. Даже самые большие модели, такие как GPT-4, по сути, являются системами распознавания образов, а не агентами с целями. Их «интеллект» — это отражение статистических закономерностей в данных, а не результат понимания. Кроме того, генеративные модели не имеют внутреннего представления о мире, которое можно было бы обновлять через взаимодействие. Они не могут экспериментировать, ошибаться и учиться на своих ошибках — всё это ключевые компоненты человеческого познания.
Кого затронет и как
Для разработчиков и исследователей ИИ эта дискуссия означает, что текущий фокус на масштабировании моделей может быть неверным. Компании, вкладывающие миллиарды в обучение мультимодальных моделей, рискуют упустить из виду альтернативные подходы, такие как роботизированные системы с воплощенным обучением. Для бизнеса это означает, что AGI в ближайшие годы маловероятен, а инвестиции в прикладные ИИ-решения могут быть более оправданными. Вместо погони за универсальным интеллектом, возможно, стоит сосредоточиться на узкоспециализированных системах, которые решают конкретные задачи.
Что будет дальше
Ожидается, что дискуссия о природе AGI усилится. Вероятно, исследователи обратятся к менее популярным направлениям, таким как нейросимволический ИИ или системы, интегрированные с физическими телами. В ближайшие 5-10 лет мы вряд ли увидим AGI, основанный на текущих генеративных подходах. Более реалистичным сценарием является развитие узкоспециализированных систем, которые будут имитировать отдельные аспекты человеческого интеллекта, но не достигнут общего понимания. Тем не менее, даже такие системы могут принести значительную пользу в медицине, логистике и других областях.
Итог
Статья в The Gradient подчеркивает, что путь к AGI лежит не через мультимодальность и большие языковые модели, а через воплощенное познание. Пока ИИ не научится взаимодействовать с миром физически, он останется лишь мощным инструментом, но не разумом. Эта идея заставляет переосмыслить текущие приоритеты в исследованиях ИИ и напоминает, что настоящий интеллект требует большего, чем просто обработка данных. Возможно, ключ к AGI лежит не в масштабировании моделей, а в создании систем, которые могут учиться через действие и опыт — так же, как это делаем мы.