TRACE: водяной знак для LLM-агентов, устойчивый к перезаписи и удалению — как это работает
Исследователи представили TRACE — первый водяной знак для траекторий LLM-агентов, который остаётся читаемым даже после полного удаления или перезаписи логов атакующим. Эта технология решает ключевую проблему атрибуции в экосистеме, где агенты часто распространяются через посредников, способных измен

Исследователи представили TRACE — первый водяной знак для траекторий LLM-агентов, который остаётся читаемым даже после полного удаления или перезаписи логов атакующим. Эта технология решает ключевую проблему атрибуции в экосистеме, где агенты часто распространяются через посредников, способных изменить или присвоить себе чужую работу.
Как TRACE защищает интеллектуальную собственность разработчиков
LLM-агенты — это программные системы, которые взаимодействуют с внешними инструментами и принимают решения на основе наблюдений. В процессе работы они генерируют траекторию — последовательность вызовов инструментов, полученных результатов и выполненных действий. Эта траектория служит единственным доказательством происхождения агента, если возникает спор с реселлером, который мог переименовать агента или заменить модель на более дешёвую.
Существующие методы маркировки агентов уязвимы: они встраивают водяной знак непосредственно в лог, что позволяет злоумышленнику с полным доступом к данным легко его обнаружить и удалить. TRACE принципиально меняет подход, используя два независимых канала, которые не считываются напрямую из лога, а выводятся из статистических свойств последовательности действий.
Как TRACE встраивает метку, не изменяя поведение агента?
Первый канал — канал выбора — определяет, какое действие из нескольких возможных будет выбрано. Для этого используется ключ, вычисляемый на основе локального содержимого траектории, и специальный искажающий сэмплер, который смещает вероятности выбора в нужную сторону. Второй канал — канал подсчёта — задаёт количество записей в каждой группе решений, используя ключ, основанный только на скелете лога (без учёта конкретных значений).
Канал выбора устойчив к удалению записей: даже если злоумышленник вырежет часть лога, оставшиеся действия всё равно будут нести метку. Канал подсчёта, напротив, устойчив к перезаписи: если атакующий изменит содержание записей, но сохранит их количество, метка останется. Вместе они обеспечивают защиту от обоих типов атак.
Важно, что TRACE не меняет распределение действий агента — водяной знак оплачивается энтропией решения. Каждое недетерминированное решение отдаёт не менее половины своей энтропии на встраивание метки, а детерминированные решения не отдают ничего. Это гарантирует, что агент продолжает работать так же, как и без водяного знака.
Какие угрозы решает TRACE?
Основная угроза — это недобросовестные реселлеры, которые могут перепродавать агента под своим именем или заменять дорогую модель на дешёвую, чтобы увеличить прибыль. Без водяного знака разработчик не может доказать, что агент создан именно им. TRACE позволяет сохранить атрибуцию даже в условиях, когда реселлер имеет полный доступ к логам и может их модифицировать.
Кроме того, TRACE защищает от кражи интеллектуальной собственности на этапе развёртывания: если злоумышленник скопирует траекторию агента и выдаст её за свою, водяной знак укажет на истинного автора. Это особенно актуально для коммерческих платформ, где агенты продаются как услуга.
Кому нужен TRACE в первую очередь?
Разработчики LLM-агентов получат инструмент для защиты своих продуктов при передаче реселлерам. Платформы-реселлеры, в свою очередь, смогут проверять происхождение агентов и избегать судебных исков. Исследователи в области безопасности ИИ найдут в TRACE новый метод атрибуции, а пользователи — возможность убедиться в подлинности агента.
Практическая применимость TRACE и нерешённые вопросы
На данный момент TRACE протестирован в лабораторных условиях, и его эффективность подтверждена для отдельных типов атак. Однако остаётся открытым вопрос о его работе в реальных коммерческих системах с высокой нагрузкой и сложными сценариями взаимодействия. Также неясна устойчивость к комбинированным атакам, когда злоумышленник одновременно удаляет и перезаписывает данные.
Тем не менее, TRACE представляет собой значительный шаг вперёд в области атрибуции LLM-агентов. Если технология будет адаптирована для промышленного использования, она может стать стандартом де-факто для защиты интеллектуальной собственности в экосистеме агентов. Разработчикам стоит следить за развитием метода и рассматривать его внедрение в свои продукты.
Заключение
TRACE — это первый водяной знак для траекторий LLM-агентов, устойчивый к удалению и перезаписи. Он использует два независимых канала для встраивания метки, не изменяя поведение агента. Технология решает проблему атрибуции при распространении агентов через реселлеров и может стать важным инструментом защиты интеллектуальной собственности. Дальнейшие исследования должны подтвердить её применимость в реальных условиях и устойчивость к комбинированным атакам.