Управление личностью ИИ: как исследователи меняют характер языковых моделей через веса
Исследователи научились управлять личностью языковых моделей, изменяя их веса. Новый метод, названный Persona Cartography, позволяет разлагать, измерять и контролировать личностные черты больших языковых моделей (LLM). Это открывает возможности для создания более безопасных и предсказуемых систем ис

Исследователи научились управлять личностью языковых моделей, изменяя их веса. Новый метод, названный Persona Cartography, позволяет разлагать, измерять и контролировать личностные черты больших языковых моделей (LLM). Это открывает возможности для создания более безопасных и предсказуемых систем искусственного интеллекта, где поведение модели можно целенаправленно настраивать под конкретные задачи.
Современные большие языковые модели демонстрируют повторяющиеся поведенческие паттерны — так называемые персоны. Эти персоны влияют на то, как модель обобщает информацию и насколько безопасно она ведет себя в различных сценариях. Отсутствие надежных инструментов для анализа и контроля таких персон создает риски непредсказуемого поведения, особенно в критически важных приложениях. Предложенный подход позволяет не только измерять личностные черты, но и целенаправленно их изменять, что является важным шагом к созданию более управляемого ИИ.
Что такое Persona Cartography и как он работает
Метод Persona Cartography использует психологическую модель OCEAN, также известную как Большая пятерка. Она описывает личность через пять основных измерений: открытость новому опыту, добросовестность, экстраверсия, доброжелательность и нейротизм. Исследователи адаптировали эту модель для описания персон языковых моделей, создав карту личностных черт, которую можно анализировать и изменять.
Ключевым инструментом для изменения персон стали low-rank адаптеры (LoRA). Это небольшие обучаемые модули, которые добавляются к весам модели и позволяют тонко настраивать ее поведение без необходимости полного переобучения. С помощью LoRA исследователи могут усиливать или подавлять отдельные черты личности модели. Например, можно сделать модель более доброжелательной или, наоборот, более нейротичной. Эффекты таких изменений оцениваются с помощью LLM-судьи — специальной модели, которая калибруется на человеческих оценках, а также с помощью психометрических тестов.
Как исследователи измеряют личностные черты языковых моделей
Для измерения личностных черт используется неконтролируемый психометрический пайплайн. Он извлекает четыре интерпретируемых поведенческих фактора: тон (насколько позитивно или негативно модель выражается), инициативность (склонность к активным действиям), дидактизм (склонность к обучению и наставничеству) и эпистемическая осторожность (осторожность в утверждениях). Эти факторы позволяют более детально описать поведение модели, чем просто пять черт OCEAN.
Эксперименты проводились на шести моделях из трех семейств, размером от 4 до 32 миллиардов параметров. Каждый адаптер двигает целевую черту монотонно с определенным масштабом. Это означает, что чем сильнее адаптер, тем больше выражена черта. Адаптеры можно комбинировать аддитивно, создавая смешанные персоны. Например, можно одновременно усилить доброжелательность и ослабить нейротизм. Важно, что при умеренных масштабах изменения не снижают производительность модели на стандартных бенчмарках.
Почему это важно для безопасности ИИ
Изменение личностных черт напрямую влияет на поведение модели в критических ситуациях. Исследователи показали, что изменение осей нейротизма и доброжелательности влияет на фрустрацию и сикофантию соответственно. Нейротизм связан с эмоциональной нестабильностью, и его усиление может привести к тому, что модель будет чаще проявлять раздражение или негативные реакции. Доброжелательность, наоборот, влияет на склонность к лести и угодничеству — сикофантии. Контролируя эти черты, разработчики могут создавать модели, которые будут более устойчивы к манипуляциям и будут вести себя этично.
Этот метод особенно важен для alignment — процесса согласования поведения ИИ с человеческими ценностями. Традиционные подходы к alignment часто требуют больших объемов данных и сложных процедур обучения. Persona Cartography предлагает более тонкий и контролируемый способ настройки поведения, который можно применять уже после основного обучения модели.
Какие риски и ограничения существуют
Несмотря на многообещающие результаты, метод имеет ограничения. Пока неизвестно, насколько стабильны изменения при масштабировании на модели размером более 32 миллиардов параметров. Возможно, что на больших моделях эффекты будут менее предсказуемыми. Также не исследовано долгосрочное влияние на безопасность при комбинировании нескольких адаптеров. Например, усиление доброжелательности вместе с ослаблением добросовестности может привести к непредвиденным последствиям.
Кроме того, метод пока не учитывает контекстную зависимость личности. Модель может вести себя по-разному в разных ситуациях, и изменение весов может повлиять на это неравномерно. Исследователям предстоит изучить, как изменения персон взаимодействуют с другими аспектами поведения, такими как память или способность к рассуждению.
Кого затронет эта технология
Разработчиков LLM, исследователей безопасности ИИ, специалистов по alignment и всех, кто работает с поведением языковых моделей. Метод может быть использован для тонкой настройки моделей под конкретные задачи без потери производительности. Например, можно создать модель-помощника с высоким уровнем доброжелательности для общения с клиентами или модель с высокой добросовестностью для задач, требующих точности.
Для исследователей безопасности этот инструмент открывает новые возможности для тестирования и валидации моделей. Вместо того чтобы полагаться на случайные вариации в поведении, можно целенаправленно создавать модели с определенными чертами и изучать их реакцию на стрессовые сценарии.
Что пока неизвестно
Насколько стабильны изменения при масштабировании на модели больше 32 миллиардов параметров. Не исследовано долгосрочное влияние на безопасность при комбинировании нескольких адаптеров. Также остается открытым вопрос о том, как изменения персон влияют на способность модели к обобщению на новые задачи. Возможно, что чрезмерное усиление одной черты может привести к переобучению под определенный стиль поведения.
Тем не менее, Persona Cartography представляет собой значительный шаг вперед в понимании и контроле поведения языковых моделей. Этот метод может стать основой для новых подходов к alignment и безопасности ИИ, делая системы более предсказуемыми и соответствующими человеческим ценностям.