PLURAL: глобальный датасет предпочтений для выравнивания ИИ по ценностям 20 стран

Исследователи представили PLURAL — первый масштабный датасет предпочтений, охватывающий 20 стран, который призван решить проблему культурной предвзятости больших языковых моделей. В отличие от существующих наборов данных, ориентированных на западные ценности, PLURAL позволяет обучать ИИ учитывать ра

PLURAL: глобальный датасет предпочтений для выравнивания ИИ по ценностям 20 стран

Исследователи представили PLURAL — первый масштабный датасет предпочтений, охватывающий 20 стран, который призван решить проблему культурной предвзятости больших языковых моделей. В отличие от существующих наборов данных, ориентированных на западные ценности, PLURAL позволяет обучать ИИ учитывать разнообразие мировоззрений. Разработка основана на Integrated Values Survey, репрезентативном опросе из 92 стран, и включает около 500 000 троек предпочтений. Этот ресурс открывает путь к плюралистическому выравниванию ИИ, где модели смогут адаптироваться к ценностям разных культур.

Как создавался PLURAL

Создание датасета началось с анализа ответов респондентов Integrated Values Survey, который охватывает широкий спектр вопросов о ценностях, нормах и убеждениях. Исследователи разработали двухэтапный пайплайн генерации. На первом этапе на основе ответов генерируются реалистичные сценарии, отражающие типичные жизненные ситуации. На втором этапе для каждого сценария формируются тройки предпочтений: респондент выбирает один из двух вариантов поведения, наиболее соответствующий его ценностям. Такой подход позволяет сохранить как межстрановые различия, так и внутристрановое разнообразие.

Почему это важно для выравнивания ИИ

Современные большие языковые модели, такие как GPT-4 и Llama, обучаются преимущественно на данных из англоязычного интернета, что приводит к непропорциональному отражению западных ценностей. Это ограничивает их применимость в других культурах и может вызывать этические проблемы. PLURAL предоставляет масштабируемый ресурс для плюралистического выравнивания, позволяя моделям учитывать культурные различия. Например, модель, обученная на PLURAL, может давать разные ответы на моральные дилеммы в зависимости от страны пользователя, что повышает доверие и релевантность.

Какие результаты показало тестирование

Оценка PLURAL проводилась тремя способами. Валидация на уровне датасета подтвердила, что данные сохраняют как различия между странами, так и разнообразие внутри одной страны. Автоматическая оценка показала, что обучение на PLURAL снижает среднюю абсолютную ошибку при выравнивании под профиль целевой страны до 27,7% по сравнению с сильными базовыми моделями. Наконец, слепое человеческое оценивание с участием 176 человек из Индии, Бразилии и Японии показало, что респонденты сочли ответы, выровненные по PLURAL, более репрезентативными для их национальных ценностей.

Какие страны вошли в датасет

Начальная версия PLURAL включает данные из 20 стран: Аргентина, Австралия, Бразилия, Канада, Чили, Китай, Колумбия, Египет, Эфиопия, Германия, Индия, Индонезия, Япония, Кения, Мексика, Нигерия, Южная Корея, Турция, Великобритания и США. Выбор стран основан на доступности данных IVS и стремлении охватить разные регионы и уровни дохода. Полный датасет на все 92 страны пока не опубликован, но ожидается в будущем.

Кого затронет появление PLURAL

Разработчики больших языковых моделей получат инструмент для создания более культурно-чувствительных ИИ-систем. Исследователи в области этики ИИ и выравнивания смогут изучать, как ценности различаются между странами и как модели могут адаптироваться. Пользователи из не-западных стран выиграют от того, что ИИ будет лучше понимать их культурные нормы и давать более релевантные ответы. Кроме того, PLURAL может повлиять на регулирование ИИ, предоставляя данные для оценки соответствия моделей местным ценностям.

Какие ограничения есть у PLURAL

Несмотря на значительный прогресс, у PLURAL есть ограничения. Полный датасет на 92 страны ещё не опубликован, что ограничивает его глобальную применимость. Неясно, насколько хорошо PLURAL обобщается на модели, не участвовавшие в оценке, и как он поведёт себя на других архитектурах. Также не раскрыта подробная методология отбора стран для начальной версии, что вызывает вопросы о репрезентативности. Кроме того, датасет основан на опросах, которые могут не полностью отражать реальные ценности из-за социальной желательности ответов.

Перспективы развития

Исследователи планируют расширить PLURAL на все 92 страны IVS, что сделает его наиболее полным датасетом предпочтений для выравнивания ИИ. Также ведётся работа над интеграцией PLURAL в популярные фреймворки обучения с подкреплением на основе обратной связи от человека. В долгосрочной перспективе такие датасеты могут стать основой для создания глобально-плюралистических моделей, которые уважают культурное разнообразие и способствуют более справедливому развитию ИИ.