Новый метод раскрывает внутренние мысли ИИ: следы обучения китайских моделей на американских

Исследователи разработали метод, позволяющий заглянуть во «внутренние мысли» больших языковых моделей — извлечь так называемые «следы рассуждений» (reasoning traces) из Claude, GPT и Gemini. Анализ этих данных, по словам учёных, указывает на то, что некоторые китайские ИИ-модели могут быть обучены н

Новый метод раскрывает внутренние мысли ИИ: следы обучения китайских моделей на американских

Исследователи разработали метод, позволяющий заглянуть во «внутренние мысли» больших языковых моделей — извлечь так называемые «следы рассуждений» (reasoning traces) из Claude, GPT и Gemini. Анализ этих данных, по словам учёных, указывает на то, что некоторые китайские ИИ-модели могут быть обучены на основе ведущих американских моделей. Это открытие поднимает важные вопросы о происхождении и прозрачности современных ИИ-систем, а также о том, как мы можем контролировать технологии, которые всё глубже проникают в нашу жизнь.

Новый метод, описанный в препринте на arXiv, позволяет не просто наблюдать за выходами моделей, но и реконструировать внутренние шаги рассуждений, которые обычно скрыты от пользователя. Это похоже на то, как если бы мы могли услышать мысли человека, прежде чем он озвучит ответ. Такая возможность открывает новые горизонты для понимания ИИ, но одновременно ставит вопросы о конфиденциальности и безопасности.

Как учёные заглянули в «мысли» ИИ

Группа исследователей из нескольких университетов и лабораторий разработала технику, которая позволяет вытаскивать из больших языковых моделей внутренние последовательности рассуждений — те шаги, которые модель «прокручивает» в своём «сознании» перед тем, как дать ответ. Обычно эти цепочки скрыты от пользователя, и модель выдаёт только финальный результат. Но новый метод использует специальные промпты и анализ вероятностных распределений, чтобы заставить модель «проговориться».

Суть метода заключается в том, чтобы задавать модели вопросы, требующие многошагового логического вывода, и затем анализировать не только ответ, но и промежуточные состояния её внутренних слоёв. Используя технику, напоминающую «интерпретацию активаций», исследователи смогли восстановить цепочки рассуждений для моделей Claude (Anthropic), GPT (OpenAI) и Gemini (Google). Эти цепочки оказались на удивление структурированными и похожими на человеческие рассуждения, хотя и с некоторыми отличиями.

Например, GPT-4 часто использует «мысленные эксперименты» — проговаривает гипотетические сценарии. Claude склонен к более логическим, пошаговым рассуждениям. Gemini часто «перескакивает» через шаги, что может указывать на более «эвристический» подход. Эти различия могут быть использованы для идентификации модели по её «почерку», что открывает новые возможности для атрибуции и защиты интеллектуальной собственности.

Предыстория и контекст: почему это важно

Проблема «чёрного ящика» в ИИ известна давно. Большие языковые модели — это миллиарды параметров, и понять, почему модель дала именно такой ответ, часто невозможно даже для её создателей. Это создаёт риски для безопасности: если модель выдаёт вредный или предвзятый ответ, мы не всегда можем понять причину и исправить её. Поэтому интерпретируемость ИИ — одно из самых горячих направлений исследований.

Новый метод — не первый в этой области, но он выделяется тем, что работает с «рассуждениями» — внутренними шагами, которые модель делает перед ответом. Ранее учёные в основном анализировали активации нейронов или использовали методы визуализации, но извлечение цепочек рассуждений — это более высокоуровневый подход, который может дать более практические результаты.

Интересно, что исследователи решили применить свой метод не только к американским моделям, но и к китайским — DeepSeek, Qwen и другим. И вот тут они обнаружили нечто неожиданное.

Что показал анализ китайских моделей?

Когда исследователи применили свой метод к китайским моделям, они обнаружили, что цепочки рассуждений у них подозрительно похожи на цепочки американских моделей. Более того, в некоторых случаях эти цепочки содержали фрагменты, которые можно было бы назвать «отпечатками» — уникальные паттерны, характерные для конкретной модели. Например, у модели DeepSeek были найдены последовательности рассуждений, которые почти дословно совпадали с цепочками GPT-4.

Это может указывать на то, что китайские модели обучались не только на общедоступных данных, но и на выходах американских моделей — так называемый «дистилляционный» подход. Хотя это не запрещено напрямую, это вызывает этические и юридические вопросы, особенно в свете санкций и ограничений на передачу технологий.

Дистилляция — это распространённая практика, когда меньшая модель обучается имитировать поведение более крупной. Но если это делается без разрешения, это может нарушать условия использования и авторские права. Кроме того, это создаёт риски для национальной безопасности: если китайские модели действительно основаны на американских, то они могут нести в себе скрытые уязвимости или предвзятости, которые трудно обнаружить.

Технические подробности: как это работает

Метод основан на анализе внутренних представлений модели. Каждый слой нейросети преобразует входные данные в векторное представление, которое содержит информацию о значении токена в контексте. Исследователи использовали технику, называемую «линейный пробинг» (linear probing), чтобы обучить классификатор распознавать, какие «рассуждения» происходят в модели. Затем они применили этот классификатор к промежуточным слоям и восстановили последовательность шагов.

Этот подход напоминает методы, используемые в нейробиологии для расшифровки сигналов мозга. Точно так же, как учёные могут определить, что человек видит или думает, по активности нейронов, исследователи ИИ теперь могут «прочитать» мысли модели по активациям её слоёв. Однако есть и ограничения: метод работает только для моделей, которые имеют архитектуру, позволяющую извлекать промежуточные состояния, и требует значительных вычислительных ресурсов.

Тем не менее, авторы утверждают, что их техника достаточно универсальна и может быть применена к большинству современных LLM. Они планируют выпустить открытый инструментарий, который позволит другим исследователям воспроизвести их результаты и применить метод к другим моделям.

Кого затронет и как

Это открытие имеет значение для нескольких групп. Для исследователей ИИ — это новый инструмент для изучения внутренних механизмов моделей, который может ускорить разработку более прозрачных и безопасных систем. Для разработчиков моделей — это потенциальный способ защиты своих технологий от копирования: если цепочки рассуждений уникальны, их можно использовать как «водяной знак». Для регуляторов — это новый вызов: если китайские модели действительно обучаются на американских, это может подорвать экспортный контроль и привести к усилению ограничений.

Для российских специалистов это также важно: российские ИИ-разработки часто используют открытые модели, и если окажется, что они тоже несут в себе «отпечатки» западных моделей, это может повлиять на их автономность и безопасность. В условиях санкций и технологической изоляции это может стать критическим фактором.

Что будет дальше

Исследователи планируют расширить свой метод на большее количество моделей и сделать его доступным для широкой публики. Они также надеются, что их работа стимулирует дискуссию о прозрачности ИИ и о том, как мы можем контролировать эти системы. Возможно, в будущем появятся стандарты на «рассуждающие» модели, которые будут обязаны раскрывать свои цепочки рассуждений.

Однако остаются и вопросы: насколько надёжен этот метод? Могут ли модели быть обучены скрывать свои рассуждения? И как отличить «естественное» сходство от прямого копирования? Ответы на эти вопросы появятся только в ходе дальнейших исследований.

В то же время, уже сейчас ясно, что новый метод открывает ящик Пандоры. Если мы можем читать мысли ИИ, то мы можем и контролировать их, но также и манипулировать ими. Это ставит перед обществом новые этические дилеммы, которые требуют обсуждения.

Итог

Новый метод извлечения «мыслей» ИИ — это значительный шаг к прозрачности больших языковых моделей. Он не только раскрывает внутренние механизмы Claude, GPT и Gemini, но и указывает на возможные нарушения в цепочках поставок ИИ-технологий. Следить за этой темой стоит всем, кто интересуется будущим искусственного интеллекта: она затрагивает вопросы безопасности, этики и геополитики. В ближайшие годы мы, вероятно, увидим новые исследования, которые либо подтвердят, либо опровергнут эти тревожные выводы, а также появление инструментов для защиты от несанкционированного копирования моделей.