Как работают модели SOFROS AI/ML: от классификации до семантического поиска

Корпоративные справочники и нормативно-справочная информация (НСИ) — это фундамент, на котором держатся закупки, логистика, бухгалтерия и тысячи других бизнес-процессов. Но именно эта база чаще всего приходит в упадок: дубликаты, опечатки, неполные записи, устаревшие данные. Компания SOFROS предлага

Как работают модели SOFROS AI/ML: от классификации до семантического поиска

Корпоративные справочники и нормативно-справочная информация (НСИ) — это фундамент, на котором держатся закупки, логистика, бухгалтерия и тысячи других бизнес-процессов. Но именно эта база чаще всего приходит в упадок: дубликаты, опечатки, неполные записи, устаревшие данные. Компания SOFROS предлагает радикальное решение — гибридный AI/ML-подход, который превращает хаос в структуру. В третьей статье цикла разработчики раскрыли детали внутренней кухни: четыре модели — классификация, экстракция, семантический поиск и контекстный поиск — работают в связке, чтобы автоматически очищать, обогащать и находить данные. Разберём, как это устроено, почему это важно для бизнеса и какие технологии стоят за каждым этапом.

Модель классификации: наивный байес против опечаток

Первый этап обработки — классификация. Система должна понять, к какому типу НСИ относится запись: товар, услуга, контрагент или что-то ещё. В основе лежит наивный байесовский классификатор — алгоритм, который вычисляет вероятность принадлежности записи к каждому классу на основе частотности слов. Но простота наивного байеса компенсируется тщательной подготовкой данных.

Разработчики SOFROS учли главную проблему реальных данных — опечатки. Если классификатор не находит точное слово в словаре, в дело вступают n-граммы: последовательности из двух или трёх символов, которые позволяют находить частичные совпадения. Например, слово «молоко» с опечаткой «малако» разбивается на биграммы «мо», «ол», «ло», «ок», «ко» и «ма», «ал», «ла», «ак», «ко» — пересечение биграмм даёт высокую степень схожести. Дополнительно используется нечёткий поиск по метрике Левенштейна, который вычисляет минимальное количество правок для превращения одной строки в другую.

Такой подход позволяет классифицировать записи даже с серьёзными искажениями, что критично для реальных корпоративных данных, где опечатки встречаются в каждом десятом поле. Модель обучается на исторических данных с разметкой, и чем больше размеченных примеров, тем выше точность. В статье отмечается, что гибридный подход — сочетание классического алгоритма и предобработки — даёт лучшие результаты, чем «чистый» машинное обучение.

Экстракция характеристик с помощью NER и beam search

После классификации вторая модель — экстракция — выделяет из записи именованные сущности (Named Entity Recognition, NER): наименование, артикул, производитель, характеристики. Здесь используется библиотека spaCy, популярный инструмент для обработки естественного языка, которая обучена на русскоязычных корпусах.

Но просто распознать сущности недостаточно — нужно выбрать наиболее вероятную последовательность сущностей для всей записи. Для этого применяется алгоритм beam search, который перебирает несколько гипотез одновременно и выбирает лучшую. Например, в записи «Смартфон Samsung Galaxy A54 128 ГБ, синий» модель должна понять, что «Samsung» — производитель, «Galaxy A54» — модель, «128 ГБ» — объём памяти, а «синий» — цвет. Beam search оценивает все возможные комбинации и выбирает ту, которая максимизирует общую вероятность.

Экстракция работает в связке с классификацией: сначала запись классифицируется как «товар», затем из неё извлекаются характеристики. Это позволяет автоматически заполнять поля справочника без ручного ввода, что экономит часы работы сотрудников.

Семантический поиск: BERT, FAISS и реранкер

Третья модель — семантический поиск — решает задачу поиска по смыслу, а не по точному совпадению строк. Если в справочнике есть «молоко цельное 3,2%», а пользователь ищет «молоко 3,2% жирности», традиционный поиск не найдёт результат, а семантический — поймёт, что это одно и то же.

Технически это реализовано с помощью трансформера BERT, который преобразует текст в векторное представление — эмбеддинг, сохраняющий смысл. Затем индекс FAISS (Facebook AI Similarity Search) позволяет быстро находить ближайшие векторы в многомерном пространстве даже на миллионах записей. FAISS использует кластеризацию и сжатие, чтобы поиск занимал миллисекунды, а не секунды.

Но чтобы повысить точность, после быстрого поиска по FAISS подключается реранкер — модель, которая переупорядочивает результаты, оценивая релевантность каждой пары запрос-документ. Это двухэтапная схема: сначала грубый отбор кандидатов, затем точная ранжировка. Такой подход используется в поисковых системах и даёт высокое качество.

Контекстный поиск: дообогащение из веб-источников

Четвёртая модель — контекстный поиск — выходит за пределы внутренней базы. Когда в записи не хватает характеристик, модель обращается к веб-источникам: официальным сайтам производителей, каталогам, API. Это позволяет дообогатить данные, например, добавить вес, размеры или состав товара.

Разработчики подчёркивают, что такой подход требует аккуратности: веб-данные могут быть неактуальными или противоречивыми. Поэтому контекстная модель включает механизмы проверки достоверности и приоритизации источников. В итоге справочник становится не только чистым, но и полным, что особенно важно для закупочных процедур и логистики.

Как обеспечивается безопасность персональных данных?

Отдельно в статье рассматривается классификация персональных данных (PII — Personally Identifiable Information). В корпоративных системах часто встречаются записи, содержащие ФИО, паспортные данные, телефоны — и их нужно защищать. Модель классификации PII определяет, какие поля содержат чувствительные данные, и применяет к ним политики безопасности: маскирование, шифрование или ограничение доступа.

Это критично для соответствия законодательству, например, 152-ФЗ в России, который требует защиты персональных данных. Автоматическая классификация PII позволяет компаниям избежать штрафов и утечек, которые в 2024 году обходятся в среднем в несколько миллионов рублей за инцидент.

Кого затронет и как

Новая статья SOFROS адресована прежде всего разработчикам и архитекторам корпоративных систем, которые внедряют НСИ. Но польза от описанных моделей выходит за рамки одной компании. Любой бизнес, работающий с каталогами товаров, справочниками контрагентов или документами, может применить эти подходы: от розничной торговли до логистики и госсектора.

Для разработчиков важно, что все модели реализованы через REST API, что позволяет интегрировать их в существующие системы без переписывания кода. Это снижает порог входа и ускоряет внедрение. Для бизнеса — экономия времени и снижение ошибок в данных, что напрямую влияет на скорость принятия решений.

Что будет дальше

SOFROS продолжает развивать платформу, и в следующих статьях цикла, вероятно, будут рассмотрены практические примеры внедрения, метрики качества и кейсы. Судя по описанной архитектуре, компания движется к более тесной интеграции с LLM (большими языковыми моделями), что позволит ещё глубже понимать контекст и повысить точность извлечения.

Итог

Модели SOFROS AI/ML — это не просто набор алгоритмов, а продуманная система, которая решает реальную проблему деградации НСИ. От классификации с учётом опечаток до семантического поиска с BERT и FAISS — каждый этап продуман и оптимизирован. Если ваша компания сталкивается с хаосом в справочниках, стоит присмотреться к этому подходу: он уже работает и доказал свою эффективность.