OpenAI и DeepMind представили алгоритм обучения ИИ на основе предпочтений человека
OpenAI и DeepMind совместно разработали новый алгоритм, который позволяет обучать искусственный интеллект, используя предпочтения человека вместо заранее заданных целевых функций. Вместо того чтобы программировать сложную математическую цель, исследователи предлагают показывать модели два варианта п

OpenAI и DeepMind совместно разработали новый алгоритм, который позволяет обучать искусственный интеллект, используя предпочтения человека вместо заранее заданных целевых функций. Вместо того чтобы программировать сложную математическую цель, исследователи предлагают показывать модели два варианта поведения и получать от человека оценку, какой из них лучше. Это открывает путь к созданию более безопасных и контролируемых систем ИИ, которые могут учиться на человеческих суждениях, а не на формальных критериях.
Что произошло Исследователи из OpenAI и DeepMind анонсировали алгоритм, который меняет подход к обучению с подкреплением. В традиционном обучении с подкреплением агент учится максимизировать некоторую целевую функцию, которую разработчик должен вручную определить. Однако для сложных задач, таких как управление роботом или диалоговые системы, сформулировать правильную целевую функцию крайне трудно. Новый метод предлагает альтернативу: вместо явной функции используется обратная связь от человека. На каждом шаге обучения модели предъявляются два варианта поведения, и человек выбирает, какой из них предпочтительнее. На основе этих выборов система корректирует свою политику, постепенно приближаясь к цели, которую подразумевал человек.
Почему это важно Традиционный подход к обучению ИИ требует точного определения целевой функции, что особенно сложно для комплексных задач. Даже небольшая ошибка в формулировке цели может привести к нежелательному или опасному поведению. Например, если роботу задать цель "убрать комнату", он может начать ломать мебель, чтобы ускорить процесс. Новый метод снижает риск, позволяя системе учиться на человеческих суждениях, что приближает создание безопасного ИИ. Кроме того, такой подход делает процесс обучения более интуитивным: разработчику не нужно быть экспертом в математике, достаточно иметь представление о желаемом поведении системы.
Как алгоритм использует обратную связь от человека? Алгоритм работает в несколько этапов. Сначала модель генерирует два возможных действия или траектории. Затем человек-оператор сравнивает их и указывает, какой вариант лучше. Эта информация используется для обновления внутренней модели предпочтений. Со временем система учится предсказывать, какие действия человек сочтет предпочтительными, и действовать соответственно. Важно, что обратная связь может быть неполной или даже противоречивой, но алгоритм устойчив к таким шумам. Исследователи подчеркивают, что метод не требует большого количества человеческих оценок: достаточно нескольких сотен или тысяч примеров, чтобы значительно улучшить поведение.
Детали Алгоритм использует обратную связь от человека: на каждом шаге модели предлагается два варианта действий, и человек выбирает предпочтительный. На основе этих данных система корректирует своё поведение, постепенно приближаясь к цели, которую подразумевал человек. Работа выполнена в сотрудничестве с командой безопасности DeepMind. Технически алгоритм основан на обучении с подкреплением на основе предпочтений (preference-based reinforcement learning). Модель учится не только выполнять задачу, но и понимать, что именно человек считает правильным. Это особенно полезно в задачах, где сложно определить объективную метрику успеха, например, в генерации текста или управлении автомобилем.
Кого затронет Разработчиков систем ИИ, особенно в области безопасности и контроля поведения. В перспективе — всех пользователей, взаимодействующих с ИИ, так как метод может повысить надёжность и предсказуемость систем. Например, чат-боты, обученные с помощью этого алгоритма, будут реже давать неуместные ответы, а роботы-пылесосы — меньше застревать. Кроме того, метод может быть использован для тонкой настройки уже существующих моделей, делая их более соответствующими человеческим ценностям.
Что пока неизвестно Не раскрыты конкретные тесты и сравнения с традиционными методами. Также не указано, насколько эффективен алгоритм в сложных многошаговых задачах, где требуется последовательность действий. Остается открытым вопрос о масштабируемости: сможет ли метод работать с миллионами параметров современных нейросетей. Исследователи обещают опубликовать подробности в ближайшее время, но пока доступен только анонс. Впрочем, даже без деталей ясно, что это важный шаг к созданию ИИ, который действительно понимает, чего хотят люди.