Метрики grokking в нейросетях могут обманывать: что показало новое исследование
Феномен grokking — внезапное обобщение нейросети после длительного периода переобучения — считается ключом к пониманию того, как модели переходят от запоминания к настоящему обучению. Однако новое исследование, опубликованное на arXiv (ID: 2607.06639), показало, что стандартные метрики, используемые

Феномен grokking — внезапное обобщение нейросети после длительного периода переобучения — считается ключом к пониманию того, как модели переходят от запоминания к настоящему обучению. Однако новое исследование, опубликованное на arXiv (ID: 2607.06639), показало, что стандартные метрики, используемые для измерения этого явления, могут существенно искажать картину. Ученые провели аудит популярных показателей и обнаружили, что компрессия эмбеддингов продолжается десятки тысяч шагов после того, как сеть уже начала обобщать, а эффективный ранг в момент перехода оказывается завышенным. Это ставит под сомнение многие выводы, сделанные на основе таких метрик, и предлагает новые инструменты для более точного анализа.
Что такое grokking и почему его метрики важны
Grokking — это явление, при котором нейросеть сначала запоминает обучающие данные, достигая высокой точности на них, но затем, после длительного обучения, вдруг начинает обобщать на тестовые данные. Этот переход от переобучения к обобщению происходит резко, как правило, после тысяч или десятков тысяч шагов оптимизации. Для исследователей grokking — это окно в механизмы, лежащие в основе обобщения, и его изучение помогает понять, как нейросети учатся.
Однако чтобы изучать grokking, нужны надежные метрики, которые точно указывают момент перехода. Традиционно используются такие показатели, как эффективный ранг эмбеддингов (мера сложности представлений) или компрессия (снижение размерности). Считается, что в момент grokking эти метрики резко меняются, сигнализируя о переходе. Но новое исследование показывает, что это не всегда так.
Как исследователи выявили проблему
Авторы работы провели аудит нескольких стандартных метрик на многослойных перцептронах (MLP) и трансформерах, обученных на задачах модульной арифметики. Они обнаружили, что компрессия эмбеддингов продолжается еще десятки тысяч шагов после того, как точность на тестовых данных уже вышла на плато. То есть сеть уже обобщает, а метрика все еще меняется, что может ввести в заблуждение — исследователь может подумать, что grokking еще не завершился.
Для MLP завышение эффективного ранга в момент перехода составило от 3 до 5 раз, а для трансформеров — от 1.3 до 1.5 раз. Это означает, что если полагаться на эту метрику, можно ошибочно заключить, что модель все еще запоминает, хотя на самом деле она уже обобщает. Кроме того, компрессия отстает от перехода по точности на величину, сопоставимую со временем до grokking — не менее 10 000 шагов.
Какие факторы влияют на точность метрик
Исследователи также выяснили, что добавление слоя нормализации (LayerNorm) в трансформер существенно меняет поведение метрик. Доля компрессии к моменту grokking снизилась с 0.87 до 0.25, то есть метрика стала гораздо менее информативной. Это говорит о том, что архитектурные детали сильно влияют на то, как проявляется grokking, и что универсальных метрик не существует.
Кроме того, был проверен так называемый вторичный закон глубины для MLP, который связывает норму весов и сходимость. Оказалось, что этот закон не работает для трансформеров и даже меняет знак при свободном затухании весов. Это еще один пример того, что выводы, сделанные на одной архитектуре, могут быть неверны для другой.
Как можно исправить ситуацию: предложенный аудит
Чтобы избежать ложных заключений, авторы предлагают набор тестов для аудита метрик grokking. Во-первых, необходимо разделять начало перехода и компрессию — то есть смотреть не только на момент, когда метрика меняется, но и на ее динамику после. Во-вторых, проверять плато: если метрика продолжает меняться после стабилизации точности, это повод усомниться в ее релевантности. В-третьих, исключать граничные ячейки — выбросы, которые могут искажать общую картину.
Эти рекомендации помогут исследователям более точно интерпретировать результаты и избежать ошибок. Особенно это важно для тех, кто изучает механизмы обобщения или разрабатывает новые методы анализа обучения.
Кого затронут результаты
Работа в первую очередь адресована исследователям в области интерпретируемости нейросетей и теоретического машинного обучения. Разработчики методов анализа обучения также должны обратить внимание на эти выводы, чтобы не полагаться слепо на стандартные метрики. Кроме того, результаты могут быть полезны специалистам, которые используют grokking для понимания того, как модели переходят от запоминания к обобщению.
Какие вопросы остаются открытыми
Пока неясно, насколько результаты обобщаются на другие архитектуры, например, сверточные сети, и на другие задачи, не связанные с модульной арифметикой. Также не исследовано влияние других регуляризаций, кроме LayerNorm. Возможно, в более сложных моделях метрики ведут себя иначе, и аудит придется адаптировать. Однако уже сейчас ясно, что доверять стандартным показателям без проверки не стоит.
Что это значит для будущих исследований
Исследование подчеркивает необходимость более тщательного подхода к измерению grokking. Возможно, потребуется разработка новых метрик, которые будут более устойчивы к архитектурным различиям. А пока ученым рекомендуется проводить аудит по предложенной схеме, чтобы избежать ложных выводов. Это особенно важно, поскольку grokking рассматривается как ключ к пониманию обобщения в нейросетях, и ошибки в его измерении могут затормозить прогресс в этой области.