XLSCOUT представляет ParaEmbed 2.0: новая модель эмбеддингов для патентов и ИС
XLSCOUT выпустила модель ParaEmbed 2.0 для патентных эмбеддингов при поддержке Hugging Face. Модель обещает улучшить поиск и анализ патентов, что важно для юристов и исследователей.

XLSCOUT, компания, специализирующаяся на интеллектуальной собственности, выпустила новую модель эмбеддингов ParaEmbed 2.0, предназначенную для работы с патентами. Разработка велась при экспертной поддержке Hugging Face, известной платформы для моделей машинного обучения. Модель уже доступна на Hugging Face Hub, что позволяет разработчикам интегрировать её в свои проекты.
ParaEmbed 2.0 создана специально для обработки патентных документов, которые отличаются сложной структурой и специфической терминологией. Она позволяет преобразовывать текст патентов в векторные представления, что упрощает поиск похожих патентов, анализ новизны и другие задачи. По словам разработчиков, модель показывает высокую точность на тестовых наборах данных, превосходя предыдущую версию и другие открытые модели.
Что такое ParaEmbed 2.0 и как она работает
ParaEmbed 2.0 — это модель эмбеддингов, то есть она преобразует текст в числовые векторы, которые отражают смысл документа. В отличие от универсальных моделей, она обучена на корпусе патентных текстов, что позволяет ей лучше понимать специфические термины и конструкции, встречающиеся в патентах. Это достигается за счёт использования архитектуры на основе трансформеров и тонкой настройки на данных патентных ведомств.
Модель доступна в двух вариантах: ParaEmbed 2.0 и ParaEmbed 2.0-Light. Версия Light имеет меньше параметров и работает быстрее, что удобно для задач с ограниченными вычислительными ресурсами. Обе версии можно скачать с Hugging Face Hub и использовать в популярных фреймворках, таких как PyTorch или TensorFlow.
Предыстория и контекст
Патентные поисковые системы традиционно полагались на ключевые слова, что часто приводило к неточным результатам. С развитием нейросетевых подходов появились модели, способные учитывать контекст и синонимию, но большинство из них были универсальными и не учитывали особенности патентного языка. XLSCOUT, которая уже имеет опыт в создании инструментов для анализа патентов, решила заполнить этот пробел.
Первая версия ParaEmbed была выпущена несколько лет назад и получила положительные отзывы от специалистов по интеллектуальной собственности. Однако с ростом объёмов патентных данных и усложнением запросов возникла потребность в более точной модели. Поддержка Hugging Face, которая предоставила экспертизу в области обучения моделей и оптимизации, позволила ускорить разработку и улучшить качество.
Чем ParaEmbed 2.0 отличается от предыдущей версии?
Основное отличие — улучшенная точность на патентных данных. Разработчики использовали более широкий набор обучающих примеров, включая патенты из разных юрисдикций, что повысило устойчивость модели к различиям в формулировках. Кроме того, ParaEmbed 2.0 лучше обрабатывает длинные документы, что важно для патентов, которые часто содержат многостраничные описания.
В тестах на бенчмарке, включающем задачи классификации патентов и поиска похожих документов, ParaEmbed 2.0 показала прирост точности на 5-7% по сравнению с предыдущей версией. Это значительное улучшение, которое может повлиять на качество патентных исследований.
Технические подробности и производительность
ParaEmbed 2.0 основана на архитектуре BERT, но с увеличенным размером словаря и оптимизированным токенизатором для патентных терминов. Модель имеет 110 миллионов параметров, что позволяет запускать её на обычных GPU. Для сравнения, ParaEmbed 2.0-Light имеет 30 миллионов параметров и работает в три раза быстрее, что делает её пригодной для использования в реальном времени.
Разработчики также предоставили инструменты для оценки качества эмбеддингов на пользовательских данных, что упрощает процесс внедрения. На Hugging Face Hub доступна подробная документация и примеры использования.
Кого затронет и как
ParaEmbed 2.0 будет полезна патентным поверенным, юристам по интеллектуальной собственности, исследователям и компаниям, занимающимся патентным поиском. Она позволит автоматизировать процессы поиска предшествующего уровня техники, анализа патентных ландшафтов и выявления потенциальных нарушений.
Для разработчиков, создающих инструменты для патентного анализа, модель предлагает готовое решение, которое можно интегрировать в свои продукты. Это снижает порог входа и ускоряет разработку. В России и СНГ также есть растущий интерес к патентной аналитике, и доступность качественной модели на русском языке может быть особенно востребована.
Что будет дальше
XLSCOUT планирует продолжать развитие линейки ParaEmbed, возможно, добавив поддержку других языков и специализированных доменов, таких как химия или биотехнологии. Компания также рассматривает возможность выпуска API для облачного доступа, что упростит использование модели без необходимости развёртывания собственной инфраструктуры.
В ближайшее время ожидается публикация научной статьи с подробным описанием модели и результатов тестирования, что позволит сообществу лучше понять её возможности. Разработчики приглашают пользователей оставлять отзывы и предложения, чтобы улучшить модель в будущих версиях.
Итог
ParaEmbed 2.0 — значительный шаг вперёд в области патентных эмбеддингов. Благодаря поддержке Hugging Face и открытому доступу на платформе, модель уже доступна широкому кругу специалистов. Если вы работаете с патентами, стоит обратить внимание на эту разработку — она может существенно упростить вашу работу и повысить точность анализа.