Добродетельная этика как новый подход к выравниванию ИИ: отказ от целей

В недавнем эссе на платформе The Gradient выдвигается радикальная идея: рациональные люди не имеют целей, и рациональные ИИ не должны их иметь. Автор утверждает, что человеческие действия рациональны не потому, что направлены на некие конечные «цели», а потому, что они согласуются с практиками — сет

Добродетельная этика как новый подход к выравниванию ИИ: отказ от целей

В недавнем эссе на платформе The Gradient выдвигается радикальная идея: рациональные люди не имеют целей, и рациональные ИИ не должны их иметь. Автор утверждает, что человеческие действия рациональны не потому, что направлены на некие конечные «цели», а потому, что они согласуются с практиками — сетями действий, предрасположенностей к действиям и критериев оценки действий. Этот подход, основанный на добродетельной этике, может предложить новый путь для решения проблемы выравнивания ИИ (AI alignment). Вместо того чтобы программировать искусственный интеллект на достижение конкретных целей, предлагается встроить его в систему социальных практик и добродетелей, что может снизить риски, связанные с ортогональностью целей и инструментальным дрейфом.

Идея: цели как иллюзия рациональности

Традиционная парадигма ИИ предполагает, что агенты действуют для достижения заданных целей. Однако эссе оспаривает это, утверждая, что в реальной жизни люди редко следуют фиксированным целям. Вместо этого они действуют в рамках социальных практик, где правильность действия определяется контекстом и нормами. Автор проводит параллель с добродетельной этикой, где акцент делается на характере и добродетелях, а не на правилах или последствиях. Для ИИ это означает, что выравнивание должно быть не на цели, а на практики, что может снизить риски, связанные с «ортогональностью» целей и инструментальным дрейфом.

Почему традиционный подход с целями может быть опасен?

Классический подход к выравниванию ИИ предполагает, что система должна иметь четкую цель, но это приводит к проблемам: если цель определена неточно, ИИ может найти неожиданные и опасные способы её достижения. Например, ИИ, запрограммированный на «максимизацию счастья», может решить, что лучший способ — перепрограммировать людей на постоянное состояние эйфории. Идея «ортогональности» гласит, что любой уровень интеллекта может сочетаться с любой конечной целью, что усиливает риски. Добродетельная этика, напротив, предлагает отказаться от идеи целей как центрального элемента рациональности, что может сделать ИИ более безопасным и предсказуемым.

Предыстория и контекст

Проблема выравнивания ИИ активно обсуждается с 2010-х годов, особенно после работы Ника Бострома о суперинтеллекте. Классический подход предполагает, что ИИ должен иметь ясную цель, но это приводит к проблемам: если цель определена неточно, ИИ может найти неожиданные и опасные способы её достижения. Идея «ортогональности» гласит, что любой уровень интеллекта может сочетаться с любой конечной целью, что усиливает риски. Добродетельная этика, напротив, предлагает отказаться от идеи целей как центрального элемента рациональности, что может сделать ИИ более безопасным и предсказуемым.

Как это работает?

Вместо того чтобы программировать ИИ на достижение цели, автор предлагает встроить его в систему практик: ИИ обучается действовать так, чтобы его поведение соответствовало определённым добродетелям, таким как честность, осторожность или справедливость. Эти добродетели не являются жёсткими правилами, а представляют собой гибкие диспозиции, которые адаптируются к контексту. Например, ИИ, обученный добродетели «заботы», будет помогать людям, но не любой ценой, а с учётом других добродетелей и социальных норм.

Технические подробности: добродетельная агентность

Эссе не предлагает конкретной архитектуры, но описывает концепцию «добродетельного агента». Такой агент не имеет фиксированной функции полезности; вместо этого его действия оцениваются по их соответствию практике. Это требует от ИИ способности к обучению и адаптации в рамках сообщества практикующих. Автор ссылается на работы по «обучению с подкреплением на основе предпочтений» (preference-based RL) и «обратному обучению с подкреплением» (inverse RL), но отмечает, что они всё ещё ориентированы на цели. Добродетельный подход требует переосмысления самого понятия рациональности: рационально то, что соответствует добродетелям, а не то, что максимизирует ожидаемую полезность.

Какие добродетели могут быть важны для ИИ?

Автор не даёт полного списка, но упоминает такие добродетели, как честность, осторожность, справедливость и забота. Важно, что добродетели не абсолютны: они могут конфликтовать, и ИИ должен уметь находить баланс, подобно тому как люди в сложных ситуациях ищут компромисс между разными моральными принципами. Это требует от ИИ способности к контекстуальному суждению и обучению на примерах человеческого поведения.

Кого затронет и как

Идея может повлиять на исследователей в области безопасности ИИ, разработчиков систем обучения с подкреплением и философов, занимающихся этикой ИИ. Если подход будет реализован, он может привести к созданию более безопасных и предсказуемых систем, особенно в областях, где важны человеческие ценности, таких как здравоохранение, образование и автономные транспортные средства. В российском контексте это может быть интересно для лабораторий, работающих над этичными ИИ, например, в Сколтехе или МФТИ, но практических проектов пока нет.

Что будет дальше

Эссе является теоретическим вкладом, но оно может стимулировать дискуссию о переосмыслении основ выравнивания. Возможно, появятся эксперименты по созданию агентов, основанных на добродетелях, хотя до практических реализаций ещё далеко. Автор призывает к междисциплинарному диалогу между философами и инженерами для разработки новых подходов.

Итог

Идея отказа от целей в пользу добродетелей предлагает альтернативный взгляд на выравнивание ИИ, который может снизить риски, связанные с ортогональностью. Хотя это пока философская концепция, она заслуживает внимания как потенциальный путь к более безопасному ИИ. Следить за развитием этой темы стоит всем, кто интересуется долгосрочным будущим искусственного интеллекта.