CISA: Китайские ИИ-компании массово копируют модели США через дистилляцию
Агентства CISA, NSA и ФБР выпустили совместное предупреждение о масштабном несанкционированном извлечении данных из американских нейросетей. Китайские разработчики используют методы промышленной дистилляции для переноса возможностей передовых моделей в собственные продукты.

Американские спецслужбы и агентства кибербезопасности официально заявили о систематической кампании, направленной на хищение проприетарных технологий у ведущих разработчиков ИИ в США. В совместном отчете CISA, NSA и ФБР подчеркивается, что компании из КНР используют процесс дистилляции знаний не как вспомогательный инструмент для обучения, а как основу своей стратегии развития. Согласно документу, с конца 2024 года ряд китайских организаций в промышленных масштабах извлекают функциональные возможности из передовых моделей, включая GPT, Claude, Gemini и Grok, нарушая при этом пользовательские соглашения владельцев технологий.
Масштабируемая угроза интеллектуальной собственности
В числе компаний, вовлеченных в подобные операции, ведомства указывают DeepSeek, Alibaba, Moonshot AI, MiniMax, StepFun и Z.AI. Масштабы этой деятельности исчисляются миллиардами токенов, полученными в ходе миллионов запросов к API американских систем. В отчете отмечается, что DeepSeek целенаправленно собирала данные для обучения своих моделей R1 и V3, фокусируясь на логических способностях и узкоспециализированных функциях. Аналогичные методы, по данным властей США, применялись Alibaba для совершенствования семейства моделей Qwen, а также компаниями Moonshot AI, MiniMax, StepFun и Z.AI. В документе указывается, что данная активность, вероятно, происходит при осведомленности китайского правительства.
Предыстория и технологический контекст
Дистилляция знаний в академической среде традиционно рассматривается как легитимный метод сжатия моделей, однако в данном контексте она приобрела характер вредоносной деятельности. Перенос интеллектуальных способностей от более мощных моделей к менее совершенным позволяет китайским разработчикам сокращать технологический разрыв с минимальными затратами на собственные исследования. В условиях жесткой геополитической конкуренции в сфере искусственного интеллекта такие действия стали угрозой национального уровня, так как позволяют копировать результаты многолетних инвестиций американских компаний в R&D без необходимости повторения дорогостоящего цикла обучения.
Как именно происходит несанкционированное копирование?
Для обхода защитных механизмов китайские компании используют многоуровневую систему маршрутизации запросов. Они задействуют комбинацию нативных API, сторонних облачных провайдеров и специализированных агрегаторов. Такая архитектура позволяет эффективно скрывать метаданные пользователей и маскировать характерные паттерны запросов, которые могли бы выдать процесс автоматизированного извлечения данных. В результате владельцы оригинальных моделей зачастую не могут своевременно идентифицировать факт использования своего продукта для обучения конкурентных нейросетей.
Технический анализ и методы защиты
Основная задача злоумышленников заключается в воспроизведении архитектурных оптимизаций и цепочек рассуждений, которые лежат в основе работы frontier-моделей. Извлекая ответы систем на широкий спектр промптов, атакующие обучают собственные нейросети имитировать поведение оригиналов. Агентства рекомендуют компаниям-разработчикам усилить мониторинг трафика, внедрить более строгие протоколы аутентификации для API и использовать системы поведенческого анализа для выявления аномалий, характерных для промышленной дистилляции. Это требует от бизнеса перехода к более агрессивным методам защиты интеллектуальной собственности в облачной среде.
Кого затронет и как
Данная ситуация напрямую касается разработчиков ИИ-сервисов и компаний, предоставляющих доступ к облачным вычислениям. Для разработчиков это означает необходимость пересмотра политик использования API и введение лимитов на количество запросов, чтобы исключить возможность массового копирования данных. Бизнес-пользователи и инвесторы должны учитывать риски утечки уникальных возможностей моделей, что может потребовать пересмотра стратегий безопасности данных. В конечном счете, повышение барьеров доступа может ограничить использование передовых технологий для внешних клиентов, что отразится на глобальной экосистеме ИИ.
Что будет дальше
Ведомства продолжат мониторинг ситуации и, вероятно, будут выпускать дополнительные рекомендации по мере совершенствования методов обхода защиты. Ожидается, что американские разработчики ИИ усилят свои системы безопасности, что может привести к более жесткой верификации пользователей и ограничению доступа к наиболее производительным моделям для определенных регионов. Ситуация вокруг DeepSeek и других упомянутых компаний подчеркивает, что безопасность моделей станет таким же критическим приоритетом, как и безопасность классического программного обеспечения.
Итог
Промышленная дистилляция знаний превратилась в новый фронт технологического противостояния, где объектом кражи становится «интеллект» нейросетей. Дальнейшее развитие ситуации будет зависеть от эффективности мер по защите API и способности американских компаний противостоять автоматизированным кампаниям по копированию своих разработок.