Пересадка нейросетевых личностей: направление весов переносит идентичность схемы между моделями

Ученые разработали метод, позволяющий переносить решающую схему одной нейросети в другую, пересаживая направление векторов весов. Этот подход, названный cross-trajectory chimera interventions, демонстрирует, что направление весов содержит «отпечаток» конкретного алгоритма, в то время как норма влияе

Пересадка нейросетевых личностей: направление весов переносит идентичность схемы между моделями

Ученые разработали метод, позволяющий переносить решающую схему одной нейросети в другую, пересаживая направление векторов весов. Этот подход, названный cross-trajectory chimera interventions, демонстрирует, что направление весов содержит «отпечаток» конкретного алгоритма, в то время как норма влияет только на скорость обучения. Открытие меняет представление о том, как нейросети закрепляют свои решения и открывает новые пути для анализа и модификации их внутренних механизмов.

Что произошло

Исследователи представили метод cross-trajectory chimera interventions — «химерные» вмешательства между траекториями обучения. Для двух независимо обученных нейросетей с разными начальными значениями случайных чисел (seed) они разделили каждый вектор весов на норму и единичное направление. Затем скомбинировали норму одной модели с направлением другой и продолжили обучение. На двух задачах модульной арифметики, демонстрирующих феномен grokking, компоненты весов вели себя по-разному. В 40 из 40 случаев имплантация направления донора при норме реципиента приводила к тому, что модель переходила на схему донора. Контрольный эксперимент со случайным, но угловым согласованием направления не давал такого эффекта. Перенос происходит пороговым образом: положение порога предсказывается нормой реципиента — по норме все 20 пар моделей разделяются на классы с совместной вероятностью перестановки 1.9e-4. Адаптивная процедура бисекции локализовала порог с точностью ±1/64. Норма дает лишь скромный, распределенный эффект задержки и не содержит сигнала идентичности. Задачи включали сложение и умножение по модулю простого числа (mod 97).

Почему это важно

Ранее было известно, что отдельные нейроны или веса могут быть необходимы для работы сети (single-trajectory interventions), но оставалось неясным, какие свойства переносимы между разными запусками. Новый метод показывает, что направление весов несет «отпечаток» конкретной решающей схемы и может быть перенесено в другую модель, тогда как норма влияет лишь на скорость обучения, но не на идентичность решения. Это открывает путь к пониманию того, как нейросети выбирают и закрепляют алгоритмы. Например, можно будет целенаправленно переносить удачные стратегии из одной модели в другую, ускоряя обучение или улучшая обобщение. Кроме того, результаты проливают свет на природу grokking — явления, когда модель внезапно начинает обобщать после длительного переобучения. Понимание роли нормы и направления может помочь контролировать этот процесс.

Как именно ученые пересаживали направление весов?

Метод основан на декомпозиции векторов весов на норму и направление. Для двух моделей, обученных на одной задаче, но с разными seed, вычисляется норма каждого вектора весов и единичный вектор направления. Затем создается химерная модель, где веса получаются как произведение нормы реципиента на направление донора. После этого обучение продолжается. Эксперименты показали, что такая модель быстро переходит на решающую схему донора, в то время как обратная комбинация (норма донора с направлением реципиента) не приводит к переносу идентичности. Это доказывает, что именно направление кодирует алгоритм решения.

Кого затронет

Исследователей ИИ метод дает новый инструмент для анализа внутренних представлений и механизмов обобщения. Разработчиков алгоритмов обучения понимание роли нормы и направления может повлиять на методы регуляризации и инициализации. Теоретиков глубокого обучения результаты проливают свет на природу grokking и фазовых переходов в обучении. Кроме того, перенос идентичности может найти применение в задачах переноса обучения, где нужно быстро адаптировать модель к новым условиям, сохраняя уже найденные эффективные стратегии.

Что пока неизвестно

Переносимость метода на другие архитектуры (трансформеры, сверточные сети) и задачи (неарифметические) пока не проверена. Механизм, стоящий за пороговым эффектом: почему именно норма определяет восприимчивость к пересадке направления, остается неясным. Возможность обратной «химеры» — нормы донора с направлением реципиента — авторы не исследовали. Также не изучено, как долго сохраняется перенесенная идентичность при дальнейшем обучении. Будущие исследования должны ответить на эти вопросы, чтобы полнее использовать потенциал открытия.