XLSCOUT представляет ParaEmbed 2.0: новая модель эмбеддингов для патентов и ИС

XLSCOUT выпустила модель ParaEmbed 2.0 для патентных эмбеддингов при поддержке Hugging Face. Модель обещает улучшить поиск и анализ патентов, что важно для юристов и исследователей.

XLSCOUT представляет ParaEmbed 2.0: новая модель эмбеддингов для патентов и ИС

XLSCOUT, компания, специализирующаяся на интеллектуальной собственности, выпустила новую модель эмбеддингов ParaEmbed 2.0, предназначенную для работы с патентами. Разработка велась при экспертной поддержке Hugging Face, известной платформы для моделей машинного обучения. Модель уже доступна на Hugging Face Hub, что позволяет разработчикам интегрировать её в свои проекты.

ParaEmbed 2.0 создана специально для обработки патентных документов, которые отличаются сложной структурой и специфической терминологией. Она позволяет преобразовывать текст патентов в векторные представления, что упрощает поиск похожих патентов, анализ новизны и другие задачи. По словам разработчиков, модель показывает высокую точность на тестовых наборах данных, превосходя предыдущую версию и другие открытые модели.

Что такое ParaEmbed 2.0 и как она работает

ParaEmbed 2.0 — это модель эмбеддингов, то есть она преобразует текст в числовые векторы, которые отражают смысл документа. В отличие от универсальных моделей, она обучена на корпусе патентных текстов, что позволяет ей лучше понимать специфические термины и конструкции, встречающиеся в патентах. Это достигается за счёт использования архитектуры на основе трансформеров и тонкой настройки на данных патентных ведомств.

Модель доступна в двух вариантах: ParaEmbed 2.0 и ParaEmbed 2.0-Light. Версия Light имеет меньше параметров и работает быстрее, что удобно для задач с ограниченными вычислительными ресурсами. Обе версии можно скачать с Hugging Face Hub и использовать в популярных фреймворках, таких как PyTorch или TensorFlow.

Предыстория и контекст

Патентные поисковые системы традиционно полагались на ключевые слова, что часто приводило к неточным результатам. С развитием нейросетевых подходов появились модели, способные учитывать контекст и синонимию, но большинство из них были универсальными и не учитывали особенности патентного языка. XLSCOUT, которая уже имеет опыт в создании инструментов для анализа патентов, решила заполнить этот пробел.

Первая версия ParaEmbed была выпущена несколько лет назад и получила положительные отзывы от специалистов по интеллектуальной собственности. Однако с ростом объёмов патентных данных и усложнением запросов возникла потребность в более точной модели. Поддержка Hugging Face, которая предоставила экспертизу в области обучения моделей и оптимизации, позволила ускорить разработку и улучшить качество.

Чем ParaEmbed 2.0 отличается от предыдущей версии?

Основное отличие — улучшенная точность на патентных данных. Разработчики использовали более широкий набор обучающих примеров, включая патенты из разных юрисдикций, что повысило устойчивость модели к различиям в формулировках. Кроме того, ParaEmbed 2.0 лучше обрабатывает длинные документы, что важно для патентов, которые часто содержат многостраничные описания.

В тестах на бенчмарке, включающем задачи классификации патентов и поиска похожих документов, ParaEmbed 2.0 показала прирост точности на 5-7% по сравнению с предыдущей версией. Это значительное улучшение, которое может повлиять на качество патентных исследований.

Технические подробности и производительность

ParaEmbed 2.0 основана на архитектуре BERT, но с увеличенным размером словаря и оптимизированным токенизатором для патентных терминов. Модель имеет 110 миллионов параметров, что позволяет запускать её на обычных GPU. Для сравнения, ParaEmbed 2.0-Light имеет 30 миллионов параметров и работает в три раза быстрее, что делает её пригодной для использования в реальном времени.

Разработчики также предоставили инструменты для оценки качества эмбеддингов на пользовательских данных, что упрощает процесс внедрения. На Hugging Face Hub доступна подробная документация и примеры использования.

Кого затронет и как

ParaEmbed 2.0 будет полезна патентным поверенным, юристам по интеллектуальной собственности, исследователям и компаниям, занимающимся патентным поиском. Она позволит автоматизировать процессы поиска предшествующего уровня техники, анализа патентных ландшафтов и выявления потенциальных нарушений.

Для разработчиков, создающих инструменты для патентного анализа, модель предлагает готовое решение, которое можно интегрировать в свои продукты. Это снижает порог входа и ускоряет разработку. В России и СНГ также есть растущий интерес к патентной аналитике, и доступность качественной модели на русском языке может быть особенно востребована.

Что будет дальше

XLSCOUT планирует продолжать развитие линейки ParaEmbed, возможно, добавив поддержку других языков и специализированных доменов, таких как химия или биотехнологии. Компания также рассматривает возможность выпуска API для облачного доступа, что упростит использование модели без необходимости развёртывания собственной инфраструктуры.

В ближайшее время ожидается публикация научной статьи с подробным описанием модели и результатов тестирования, что позволит сообществу лучше понять её возможности. Разработчики приглашают пользователей оставлять отзывы и предложения, чтобы улучшить модель в будущих версиях.

Итог

ParaEmbed 2.0 — значительный шаг вперёд в области патентных эмбеддингов. Благодаря поддержке Hugging Face и открытому доступу на платформе, модель уже доступна широкому кругу специалистов. Если вы работаете с патентами, стоит обратить внимание на эту разработку — она может существенно упростить вашу работу и повысить точность анализа.