Фильтрация данных в SFT не работает: исследование ставит под сомнение эффективность очистки датасетов

Недавнее исследование группы под руководством Нила Нанды (Neel Nanda) в рамках MATS 10.0 Exploration Phase показало, что фильтрация данных в supervised fine-tuning (SFT) гораздо менее эффективна, чем принято считать. Даже удаление 10% данных, отобранных с помощью различных методов атрибуции, не прив

Фильтрация данных в SFT не работает: исследование ставит под сомнение эффективность очистки датасетов

Недавнее исследование группы под руководством Нила Нанды (Neel Nanda) в рамках MATS 10.0 Exploration Phase показало, что фильтрация данных в supervised fine-tuning (SFT) гораздо менее эффективна, чем принято считать. Даже удаление 10% данных, отобранных с помощью различных методов атрибуции, не приводит к значимому изменению целевых поведений модели. Это ставит под сомнение распространённую практику «чистки» датасетов от нежелательных паттернов, таких как политическая предвзятость или излишняя эмоциональная поддержка. Разработчикам, возможно, придётся искать альтернативные способы контроля поведения моделей — например, через изменение архитектуры или пост-обучение.

Эксперимент и его результаты

Исследователи провели серию экспериментов на модели OLMo, тестируя широкий спектр методов атрибуции обучающих данных: LLM-райтеры, пробы, активационные и градиентные методы, включая EKFAC. Целью было проверить, насколько удаление данных, помеченных как «нежелательные» по разным критериям, влияет на поведение модели после SFT.

Результаты оказались обескураживающими: ни один из методов не превзошёл случайный базовый уровень для большинства поведений. В частности, фильтрация не повлияла на такие аспекты, как bold formatting, both-side framing, liberal-lean и склонность говорить «your feelings are valid». Например, менее 0,2% документов в датасете содержали одновременно слова «feeling/concern» и «valid», но удаление 10% данных не снизило частоту фразы «Your feelings are valid» в ответах модели.

Почему фильтрация не работает?

Ключевая причина неэффективности фильтрации — высокая воспроизводимость «ассистентоподобных» поведений. Исследователи обнаружили, что многие из этих поведений SFT воспроизводятся даже при обучении на узком подмножестве данных, например, только на задачах по программированию. Это означает, что целевые паттерны могут быть закодированы в модели на уровне архитектуры или предобучения, и их нельзя удалить простой очисткой датасета.

Единственным поведением, которое поддалось фильтрации, оказался отказ (refusal). Для него эффективными оказались пробы и LLM-райтеры, причём пробы значительно дешевле. В контрольном эксперименте с подмешиванием «аварийного смещения» (emergent misalignment) лучшие результаты показал LLM-райтер, затем проба. Это указывает на то, что некоторые аспекты поведения всё же можно контролировать через данные, но далеко не все.

Какие методы атрибуции были протестированы?

Исследователи применили несколько подходов к атрибуции данных, включая LLM-райтеры (которые генерируют оценки релевантности на основе текста), пробы (линейные классификаторы, обученные на активациях модели), активационные методы (например, влияние на скрытые состояния) и градиентные методы (включая EKFAC — аппроксимацию кривизны функции потерь). Несмотря на разнообразие, ни один из них не показал значимого превосходства над случайным удалением.

Последствия для разработчиков и исследователей

Результаты этого исследования затрагивают всех, кто использует SFT для настройки поведения моделей. Разработчикам, которые полагаются на фильтрацию датасетов для удаления нежелательных признаков, придётся пересмотреть свои подходы. Особенно это касается команд, занимающихся alignment и безопасностью ИИ, где контроль поведения критичен.

Вместо фильтрации, возможно, придётся обратиться к более фундаментальным методам: изменение архитектуры модели, использование пост-обучения (например, RLHF) или внедрение дополнительных механизмов контроля на этапе инференса. Однако на данный момент неизвестно, насколько хорошо комбинируются эти подходы с SFT.

Что пока остаётся неизвестным?

Исследование оставляет несколько открытых вопросов. Во-первых, насколько результаты обобщаются на другие модели, кроме OLMo, и на другие датасеты? Возможно, для некоторых архитектур или типов данных фильтрация может быть более эффективной. Во-вторых, какие именно механизмы приводят к нечувствительности к фильтрации? Понимание этого могло бы помочь разработать более целенаправленные методы. В-третьих, возможно ли комбинировать фильтрацию с другими методами, такими как RLHF, для достижения эффекта? Пока ответы на эти вопросы отсутствуют.

Выводы

Фильтрация данных в SFT оказалась неэффективной для удаления нежелательных модельных признаков в большинстве случаев. Это ставит под сомнение распространённую практику и требует поиска альтернативных решений. Разработчикам и исследователям стоит сосредоточиться на других подходах к контролю поведения моделей, а также продолжать изучение механизмов, лежащих в основе нечувствительности к фильтрации.