Anthropic, OpenAI и Google внедряют невидимые ИИ-вотермарки в тексты

Крупнейшие разработчики ИИ — Anthropic, OpenAI и Google — обязались помечать тексты, созданные их моделями, с помощью невидимых вотермарков. Это часть добровольных соглашений по безопасному развитию ИИ, подписанных в прошлом году. Разбираемся, как это будет работать и что изменится для пользователей.

Anthropic, OpenAI и Google внедряют невидимые ИИ-вотермарки в тексты

Anthropic, OpenAI и Google будут помечать создаваемые их моделями тексты невидимыми ИИ-вотермарками. Новость всколыхнула сообщество после того, как в справочной документации Claude появилось упоминание о такой маркировке. Однако на самом деле это не разовое решение одной компании, а часть более широкой индустриальной инициативы, о которой объявили ещё в прошлом году. Разбираемся, что это за вотермарки, как они работают и кого коснутся.

Крупнейшие ИИ-компании внедряют скрытую маркировку текстов

В июле 2024 года Anthropic, OpenAI и Google подписали добровольные соглашения с Белым домом о безопасном развитии искусственного интеллекта. Одним из пунктов этих соглашений стало обязательство разработать и внедрить механизмы маркировки контента, создаваемого ИИ, включая тексты, изображения и аудио. Теперь эта работа начинает приносить видимые плоды: в справочной документации Claude появилось указание, что весь сгенерированный моделью текст будет содержать невидимый вотермарк.

Изначально сообщалось, что вотермарки будут применяться в основном к изображениям и видео, генерируемым нейросетями, поскольку текстовые маркеры сложнее реализовать технически. Однако Anthropic, OpenAI и Google взяли на себя обязательство маркировать именно тексты — для этого используются специальные алгоритмы, которые встраивают в текст статистические паттерны, незаметные для человеческого глаза, но детектируемые специальными инструментами.

Пока что речь идёт о добровольных мерах, но регуляторы в США и Евросоюзе активно проталкивают законодательство, которое сделает такую маркировку обязательной. Например, закон ЕС об искусственном интеллекте, вступающий в силу поэтапно, требует прозрачности в отношении контента, созданного ИИ. Поэтому компании предпочитают внедрять вотермарки заранее, чтобы не сталкиваться с юридическими проблемами в будущем.

Предыстория и контекст: почему вотермарки стали темой №1

Идея маркировать ИИ-контент обсуждается уже несколько лет, но до недавнего времени она казалась футуристической. В 2023 году исследователи из Университета Мэриленда предложили метод встраивания вотермарков в текст с помощью модификации распределения слов. Однако крупные компании не спешили внедрять эти разработки, опасаясь ухудшения качества генерации и возможного обхода защиты.

Ситуация изменилась после серии громких инцидентов, связанных с использованием ИИ для создания дезинформации и мошеннических схем. Например, во время выборов в разных странах нейросети использовались для генерации фейковых новостей и манипулятивных сообщений. Это подтолкнуло правительства к активным действиям, и в результате появились упомянутые соглашения с Белым домом.

Кроме того, в 2024 году OpenAI, Google и Anthropic создали отраслевую организацию C2PA (Coalition for Content Provenance and Authenticity), которая разрабатывает стандарты для проверки происхождения цифрового контента. Вотермарки — лишь часть этой экосистемы, которая также включает цифровые подписи и метаданные. Важно понимать, что вотермарки не мешают читать текст — они лишь позволяют определить, был ли он создан ИИ.

Как работают невидимые ИИ-вотермарки в тексте?

Технология вотермаркинга текста основана на статистических методах. Модель ИИ при генерации каждого следующего слова выбирает его из множества вариантов с определённой вероятностью. Вотермарк изменяет эти вероятности так, чтобы в тексте появлялся незаметный статистический паттерн — например, определённое распределение синонимов или длина предложений.

Для проверки текста на наличие вотермарка используется специальный детектор, который анализирует эти статистические характеристики. Если паттерн совпадает с эталонным, текст считается помеченным. При этом вотермарк не влияет на читаемость и смысл текста, что делает его идеальным инструментом для скрытой маркировки.

У такого подхода есть ограничения: если текст сильно перефразировать или перевести на другой язык, вотермарк может быть разрушен. Поэтому компании работают над более устойчивыми методами, например, встраиванием маркеров в семантическую структуру текста. Однако пока что статистические вотермарки считаются наиболее практичным решением.

Технические подробности и сравнение подходов

У каждой из трёх компаний свой подход к вотермаркингу. Anthropic, судя по документации, использует технологию, встроенную непосредственно в модель Claude, то есть вотермарк добавляется автоматически при каждой генерации. OpenAI, в свою очередь, экспериментирует с более гибкими методами, которые можно включать и отключать по требованию. Google, как сообщается, разрабатывает вотермарки на основе своей инфраструктуры Gemini, интегрируя их в облачные сервисы.

Точные технические детали компании не раскрывают, что вызывает критику со стороны экспертов. Многие считают, что без открытых спецификаций невозможно гарантировать надёжность вотермарков и их совместимость между разными системами. В ответ на это Anthropic, OpenAI и Google обещали опубликовать технические описания своих методов до конца 2025 года.

Пока что вотермарки не являются обязательными для всех пользователей. Например, в API OpenAI разработчики могут отключить маркировку для своих приложений, если это необходимо. Однако в потребительских продуктах, таких как ChatGPT или Claude, вотермарки будут добавляться по умолчанию. Это создаёт неравенство: корпоративные клиенты смогут обходить маркировку, а обычные пользователи — нет.

Кого затронет и что это значит для пользователей

Для обычных пользователей вотермарки вряд ли станут заметным изменением — текст будет выглядеть так же, как и раньше. Однако для журналистов, блогеров и контент-мейкеров это может иметь значение: если они публикуют сгенерированный ИИ текст, его происхождение теперь можно будет проверить. Это может повлиять на доверие к контенту и на требования к раскрытию использования ИИ.

Для бизнеса, использующего ИИ для массовой генерации контента, вотермарки создают новые вызовы. Например, SEO-специалистам придётся учитывать, что поисковые системы могут начать фильтровать помеченный контент. Впрочем, пока что Google заявляет, что не планирует наказывать за вотермарки, но не исключает этого в будущем.

В России и СНГ ситуация с вотермарками пока не урегулирована. Российские разработчики, такие как Яндекс, не подписывали аналогичных соглашений, но, скорее всего, будут вынуждены адаптироваться к международным стандартам, если захотят выходить на глобальные рынки. Кроме того, российские пользователи активно используют западные ИИ-сервисы, поэтому вотермарки будут применяться и к ним.

Что будет дальше

Ожидается, что в ближайшие месяцы Anthropic, OpenAI и Google представят более детальные технические описания своих вотермарков. Также возможно, что к инициативе присоединятся другие компании, например, Meta и Microsoft, которые также участвовали в обсуждениях с Белым домом. На законодательном уровне в ЕС и США продолжается работа над обязательными требованиями к маркировке ИИ-контента, что может ускорить внедрение вотермарков.

Эксперты прогнозируют, что в течение двух-трёх лет вотермарки станут стандартом для всех крупных ИИ-систем. Однако остаются открытые вопросы: насколько устойчивы вотермарки к атакам, кто будет контролировать их использование и не приведёт ли это к цензуре. Пока что ясно одно: эпоха невидимых ИИ-вотермарков началась, и игнорировать её не получится.

Итог

Anthropic, OpenAI и Google официально внедряют невидимые вотермарки в тексты, создаваемые их моделями, в рамках добровольных соглашений с правительством США. Это важный шаг к повышению прозрачности ИИ-контента, который затронет всех пользователей и бизнес. Следите за развитием событий — в ближайшее время появятся новые технические детали и, возможно, обязательные требования к маркировке.