XLSCOUT представляет ParaEmbed 2.0: новая модель эмбеддингов для патентов и ИС
Компания XLSCOUT, специализирующаяся на интеллектуальной собственности, выпустила обновлённую модель эмбеддингов ParaEmbed 2.0, созданную специально для работы с патентными документами. Эта разработка, выполненная при экспертной поддержке платформы Hugging Face, уже доступна на Hugging Face Hub, что

Компания XLSCOUT, специализирующаяся на интеллектуальной собственности, выпустила обновлённую модель эмбеддингов ParaEmbed 2.0, созданную специально для работы с патентными документами. Эта разработка, выполненная при экспертной поддержке платформы Hugging Face, уже доступна на Hugging Face Hub, что позволяет разработчикам интегрировать её в свои проекты. Новая модель обещает значительно упростить поиск похожих патентов, анализ новизны и другие задачи, связанные с обработкой патентной информации.
ParaEmbed 2.0 представляет собой модель эмбеддингов, которая преобразует текст в числовые векторы, отражающие смысл документа. В отличие от универсальных моделей, она обучена на корпусе патентных текстов, что позволяет ей лучше понимать специфические термины и конструкции, встречающиеся в патентах. Это достигается за счёт использования архитектуры на основе трансформеров и тонкой настройки на данных патентных ведомств.
Что такое ParaEmbed 2.0 и как она работает
ParaEmbed 2.0 — это модель эмбеддингов, то есть она преобразует текст в числовые векторы, которые отражают смысл документа. В отличие от универсальных моделей, она обучена на корпусе патентных текстов, что позволяет ей лучше понимать специфические термины и конструкции, встречающиеся в патентах. Это достигается за счёт использования архитектуры на основе трансформеров и тонкой настройки на данных патентных ведомств.
Модель доступна в двух вариантах: ParaEmbed 2.0 и ParaEmbed 2.0-Light. Версия Light имеет меньше параметров и работает быстрее, что удобно для задач с ограниченными вычислительными ресурсами. Обе версии можно скачать с Hugging Face Hub и использовать в популярных фреймворках, таких как PyTorch или TensorFlow.
Предыстория и контекст
Патентные поисковые системы традиционно полагались на ключевые слова, что часто приводило к неточным результатам. С развитием нейросетевых подходов появились модели, способные учитывать контекст и синонимию, но большинство из них были универсальными и не учитывали особенности патентного языка. XLSCOUT, которая уже имеет опыт в создании инструментов для анализа патентов, решила заполнить этот пробел.
Первая версия ParaEmbed была выпущена несколько лет назад и получила положительные отзывы от специалистов по интеллектуальной собственности. Однако с ростом объёмов патентных данных и усложнением запросов возникла потребность в более точной модели. Поддержка Hugging Face, которая предоставила экспертизу в области обучения моделей и оптимизации, позволила ускорить разработку и улучшить качество.
Чем ParaEmbed 2.0 отличается от предыдущей версии?
Основное отличие — улучшенная точность на патентных данных. Разработчики использовали более широкий набор обучающих примеров, включая патенты из разных юрисдикций, что повысило устойчивость модели к различиям в формулировках. Кроме того, ParaEmbed 2.0 лучше обрабатывает длинные документы, что важно для патентов, которые часто содержат многостраничные описания.
В тестах на бенчмарке, включающем задачи классификации патентов и поиска похожих документов, ParaEmbed 2.0 показала прирост точности на 5-7% по сравнению с предыдущей версией. Это значительное улучшение, которое может повлиять на качество патентных исследований.
Технические подробности и производительность
ParaEmbed 2.0 основана на архитектуре BERT, но с увеличенным размером словаря и оптимизированным токенизатором для патентных терминов. Модель имеет 110 миллионов параметров, что позволяет запускать её на обычных GPU. Для сравнения, ParaEmbed 2.0-Light имеет 30 миллионов параметров и работает в три раза быстрее, что делает её пригодной для использования в реальном времени.
Разработчики также предоставили инструменты для оценки качества эмбеддингов на пользовательских данных, что упрощает процесс внедрения. На Hugging Face Hub доступна подробная документация и примеры использования.
Кого затронет и как
ParaEmbed 2.0 будет полезна патентным поверенным, юристам по интеллектуальной собственности, исследователям и компаниям, занимающимся патентным поиском. Она позволит автоматизировать процессы поиска предшествующего уровня техники, анализа патентных ландшафтов и выявления потенциальных нарушений.
Для разработчиков, создающих инструменты для патентного анализа, модель предлагает готовое решение, которое можно интегрировать в свои продукты. Это снижает порог входа и ускоряет разработку. В России и СНГ также есть растущий интерес к патентной аналитике, и доступность качественной модели на русском языке может быть особенно востребована.
Что будет дальше
XLSCOUT планирует продолжать развитие линейки ParaEmbed, возможно, добавив поддержку других языков и специализированных доменов, таких как химия или биотехнологии. Компания также рассматривает возможность выпуска API для облачного доступа, что упростит использование модели без необходимости развёртывания собственной инфраструктуры.
В ближайшее время ожидается публикация научной статьи с подробным описанием модели и результатов тестирования, что позволит сообществу лучше понять её возможности. Разработчики приглашают пользователей оставлять отзывы и предложения, чтобы улучшить модель в будущих версиях.
Итог
ParaEmbed 2.0 — значительный шаг вперёд в области патентных эмбеддингов. Благодаря поддержке Hugging Face и открытому доступу на платформе, модель уже доступна широкому кругу специалистов. Если вы работаете с патентами, стоит обратить внимание на эту разработку — она может существенно упростить вашу работу и повысить точность анализа.