PLURAL: глобальный датасет предпочтений для выравнивания ИИ по ценностям 20 стран
Исследователи представили PLURAL — первый масштабный датасет предпочтений, охватывающий 20 стран, который призван решить проблему культурной предвзятости больших языковых моделей. В отличие от существующих наборов данных, ориентированных на западные ценности, PLURAL позволяет обучать ИИ учитывать ра

Исследователи представили PLURAL — первый масштабный датасет предпочтений, охватывающий 20 стран, который призван решить проблему культурной предвзятости больших языковых моделей. В отличие от существующих наборов данных, ориентированных на западные ценности, PLURAL позволяет обучать ИИ учитывать разнообразие мировоззрений. Разработка основана на Integrated Values Survey, репрезентативном опросе из 92 стран, и включает около 500 000 троек предпочтений. Этот ресурс открывает путь к плюралистическому выравниванию ИИ, где модели смогут адаптироваться к ценностям разных культур.
Как создавался PLURAL
Создание датасета началось с анализа ответов респондентов Integrated Values Survey, который охватывает широкий спектр вопросов о ценностях, нормах и убеждениях. Исследователи разработали двухэтапный пайплайн генерации. На первом этапе на основе ответов генерируются реалистичные сценарии, отражающие типичные жизненные ситуации. На втором этапе для каждого сценария формируются тройки предпочтений: респондент выбирает один из двух вариантов поведения, наиболее соответствующий его ценностям. Такой подход позволяет сохранить как межстрановые различия, так и внутристрановое разнообразие.
Почему это важно для выравнивания ИИ
Современные большие языковые модели, такие как GPT-4 и Llama, обучаются преимущественно на данных из англоязычного интернета, что приводит к непропорциональному отражению западных ценностей. Это ограничивает их применимость в других культурах и может вызывать этические проблемы. PLURAL предоставляет масштабируемый ресурс для плюралистического выравнивания, позволяя моделям учитывать культурные различия. Например, модель, обученная на PLURAL, может давать разные ответы на моральные дилеммы в зависимости от страны пользователя, что повышает доверие и релевантность.
Какие результаты показало тестирование
Оценка PLURAL проводилась тремя способами. Валидация на уровне датасета подтвердила, что данные сохраняют как различия между странами, так и разнообразие внутри одной страны. Автоматическая оценка показала, что обучение на PLURAL снижает среднюю абсолютную ошибку при выравнивании под профиль целевой страны до 27,7% по сравнению с сильными базовыми моделями. Наконец, слепое человеческое оценивание с участием 176 человек из Индии, Бразилии и Японии показало, что респонденты сочли ответы, выровненные по PLURAL, более репрезентативными для их национальных ценностей.
Какие страны вошли в датасет
Начальная версия PLURAL включает данные из 20 стран: Аргентина, Австралия, Бразилия, Канада, Чили, Китай, Колумбия, Египет, Эфиопия, Германия, Индия, Индонезия, Япония, Кения, Мексика, Нигерия, Южная Корея, Турция, Великобритания и США. Выбор стран основан на доступности данных IVS и стремлении охватить разные регионы и уровни дохода. Полный датасет на все 92 страны пока не опубликован, но ожидается в будущем.
Кого затронет появление PLURAL
Разработчики больших языковых моделей получат инструмент для создания более культурно-чувствительных ИИ-систем. Исследователи в области этики ИИ и выравнивания смогут изучать, как ценности различаются между странами и как модели могут адаптироваться. Пользователи из не-западных стран выиграют от того, что ИИ будет лучше понимать их культурные нормы и давать более релевантные ответы. Кроме того, PLURAL может повлиять на регулирование ИИ, предоставляя данные для оценки соответствия моделей местным ценностям.
Какие ограничения есть у PLURAL
Несмотря на значительный прогресс, у PLURAL есть ограничения. Полный датасет на 92 страны ещё не опубликован, что ограничивает его глобальную применимость. Неясно, насколько хорошо PLURAL обобщается на модели, не участвовавшие в оценке, и как он поведёт себя на других архитектурах. Также не раскрыта подробная методология отбора стран для начальной версии, что вызывает вопросы о репрезентативности. Кроме того, датасет основан на опросах, которые могут не полностью отражать реальные ценности из-за социальной желательности ответов.
Перспективы развития
Исследователи планируют расширить PLURAL на все 92 страны IVS, что сделает его наиболее полным датасетом предпочтений для выравнивания ИИ. Также ведётся работа над интеграцией PLURAL в популярные фреймворки обучения с подкреплением на основе обратной связи от человека. В долгосрочной перспективе такие датасеты могут стать основой для создания глобально-плюралистических моделей, которые уважают культурное разнообразие и способствуют более справедливому развитию ИИ.