BERT для маппинга CVE в CWE: почему таксономия важнее архитектуры модели
Маппинг уязвимостей из базы CVE в категории CWE — ключевой этап анализа безопасности, но до сих пор он часто выполняется вручную. Новое исследование, представленное в препринте arXiv:2607.07573, показывает, что при автоматизации этой задачи выбор таксономии (иерархии CWE) оказывает большее влияние н

Маппинг уязвимостей из базы CVE в категории CWE — ключевой этап анализа безопасности, но до сих пор он часто выполняется вручную. Новое исследование, представленное в препринте arXiv:2607.07573, показывает, что при автоматизации этой задачи выбор таксономии (иерархии CWE) оказывает большее влияние на качество, чем выбор конкретной BERT-модели. Ученые сравнили multi-class и multi-label подходы с тремя энкодерами на трех вложенных пространствах меток, и результаты могут изменить подход к разработке систем анализа уязвимостей.
Как проводилось исследование Исследователи из arXiv протестировали три различные BERT-модели: стандартный BERT Base, SecureBERT и CySecBERT. Каждая модель решала задачу классификации записей CVE по категориям CWE в трех вариантах пространства меток: 83, 47 и 25 классов. Эти пространства соответствуют разным уровням иерархии CWE — от детальных до обобщенных категорий. Сравнивались две формулировки задачи: multi-class (каждая запись относится ровно к одному классу) и multi-label (одна запись может принадлежать нескольким классам). Оценка проводилась по метрике macro-F1, которая усредняет качество по всем классам, что особенно важно для несбалансированных данных.
Результаты: таксономия важнее архитектуры Главный вывод исследования — выбор таксономии (количества и состава классов) влияет на ошибки сильнее, чем выбор модели. Анализ матриц ошибок показал, что доминирующие паттерны следуют иерархии CWE и практически идентичны для всех трех энкодеров: корреляция Пирсона между матрицами ошибок разных моделей превышала 0.92. Это означает, что независимо от того, используете ли вы BERT Base или специализированный CySecBERT, ошибки будут похожими и определяться структурой таксономии.
При этом multi-class обучение показало более высокий macro-F1 во всех конфигурациях. Однако разрыв между multi-class и multi-label сокращался по мере уменьшения пространства меток: с 21 процентного пункта на 83 классах до всего 2 пунктов на 25 классах. Более того, пост-хок оптимизация порогов для multi-label позволила полностью закрыть разрыв на 25-классовой настройке, то есть при правильной калибровке multi-label может работать не хуже multi-class.
Что дает иерархически-ослабленная оценка Исследователи применили иерархически-ослабленную оценку, которая прощает ошибки внутри одного семейства CWE. Например, если модель ошибочно классифицирует уязвимость как CWE-79 (XSS) вместо CWE-80 (XSS в атрибутах), такая ошибка считается менее критичной, так как обе категории относятся к одной группе. При такой оценке macro-F1 повысился с ~81% до ~90% для всех моделей. Это подтверждает, что иерархия CWE является основным источником ошибок, и ее учет может значительно улучшить практическую полезность системы.
Какая модель показала лучшие результаты Среди трех моделей CySecBERT показал наилучшие результаты, особенно в multi-label сценарии. Это ожидаемо, так как CySecBERT дообучен на текстах по кибербезопасности и лучше понимает специфическую терминологию. SecureBERT, также специализированный, показал результаты близкие к CySecBERT, но немного уступил. BERT Base, хотя и универсальный, показал худшие показатели, но разница была не столь значительной, особенно на малом числе классов. Таким образом, для практического применения можно рекомендовать CySecBERT или SecureBERT, но при ограниченных ресурсах BERT Base также может быть приемлемым выбором.
Как это повлияет на разработку систем анализа уязвимостей Результаты исследования имеют прямое практическое значение. Разработчикам систем автоматического маппинга CVE в CWE стоит в первую очередь сосредоточиться на выборе подходящей таксономии, а не на поиске самой мощной модели. Использование иерархической структуры CWE и учет семейств категорий может существенно повысить точность. Кроме того, multi-label подход с оптимизацией порогов может быть предпочтительнее multi-class, так как он более гибкий и позволяет присваивать несколько категорий одной уязвимости, что часто соответствует реальности.
Какие остаются вопросы Исследование не затрагивает поведение моделей на редких классах CWE, которые могут быть плохо представлены в обучающих данных. Также неясно, как результаты обобщаются на другие языки (например, русский) или на более новые версии BERT, такие как RoBERTa или DeBERTa. Кроме того, в работе использовались только английские тексты CVE, и для других языков может потребоваться дополнительная адаптация. Наконец, не проводилось сравнение с более современными архитектурами, такими как GPT или T5, которые могут показать иные результаты.
Кого затронут эти выводы В первую очередь исследователей и разработчиков систем анализа уязвимостей, которые создают автоматические классификаторы CWE. Специалисты по стандартизации CWE также могут учесть эти результаты при реструктуризации таксономии. Кроме того, выводы будут полезны всем, кто работает с NLP в области кибербезопасности, так как они подчеркивают важность таксономии над архитектурой модели.
Почему это меняет подход к автоматизации Традиционно считалось, что для улучшения качества классификации нужно использовать более сложные модели или больше данных. Однако данное исследование показывает, что даже с простой моделью можно достичь высоких результатов, если правильно выбрать иерархию классов. Это означает, что усилия стоит направлять на разработку сбалансированной и логичной таксономии, а не только на архитектурные инновации. Такой подход может ускорить внедрение автоматического маппинга CVE в CWE в реальных системах безопасности.