CrimeNER: новый датасет для распознавания именованных сущностей в криминальных текстах
Группа исследователей опубликовала статью на arXiv, в которой представила CrimeNER — набор данных для распознавания именованных сущностей (NER) в криминальной сфере. Этот датасет, названный CrimeNER-db, содержит более 1500 аннотированных документов, извлеченных из публичных отчетов о террористически

Группа исследователей опубликовала статью на arXiv, в которой представила CrimeNER — набор данных для распознавания именованных сущностей (NER) в криминальной сфере. Этот датасет, названный CrimeNER-db, содержит более 1500 аннотированных документов, извлеченных из публичных отчетов о террористических атаках и пресс-релизов Министерства юстиции США. Он призван восполнить дефицит качественно размеченных данных для обучения моделей, работающих с реальными криминальными сценариями.
Почему это важно для NLP и правоохранительных органов Извлечение критической информации из документов, связанных с преступлениями, — ключевая задача для правоохранительных органов. Однако до сих пор ощущался дефицит качественно размеченных данных по реальным криминальным сценариям. CrimeNER-db восполняет этот пробел, предоставляя исследователям и разработчикам основу для создания и тестирования NER-моделей в специализированной области. Без таких данных модели часто показывают низкую точность на специфических сущностях, таких как названия группировок, виды оружия или юридические термины. Новый датасет позволяет улучшить автоматический анализ криминальных текстов, что может ускорить расследования и повысить эффективность работы аналитиков.
Как устроен CrimeNER-db В датасете определены 4 грубых типа криминальных сущностей и 21 тонкий тип. Грубые типы включают, например, "лица", "организации", "места" и "события", а тонкие типы детализируют их — "террористическая группировка", "правоохранительный орган", "вид преступления" и другие. Для оценки качества авторы провели эксперименты: полный супервайзинг (тонкая настройка общих NER-моделей) и zero-shot / few-shot сценарии для проверки способности к обобщению. Результаты показали, что модели, дообученные на CrimeNER-db, значительно превосходят общие NER-модели на криминальных текстах. Датасет опубликован на GitHub, что позволяет любому исследователю загрузить его и использовать в своих проектах.
Какие типы сущностей включены в датасет? CrimeNER-db включает 21 тонкий тип сущностей, среди которых "террористическая атака", "взрывное устройство", "жертва", "подозреваемый", "дата преступления" и другие. Эти типы были выбраны на основе анализа реальных отчетов о преступлениях и террористических актах. Каждый документ в датасете аннотирован вручную экспертами, что обеспечивает высокое качество разметки. Такая детализация позволяет моделям не только распознавать общие категории, но и различать, например, тип оружия или роль участника события.
Кого затронет появление CrimeNER Разработчиков систем автоматической обработки текстов для правоохранительных органов, исследователей в области NLP, специалистов по кибербезопасности и аналитиков, работающих с криминальной информацией. Для них CrimeNER-db становится ценным ресурсом, ускоряющим разработку специализированных NER-моделей. Кроме того, датасет может быть полезен для обучения моделей в смежных областях, таких как юридический анализ или обработка новостей о происшествиях.
Что пока неизвестно о CrimeNER Подробные метрики качества моделей на датасете и точный состав типов сущностей пока не раскрыты в аннотации. Также не указано, на каких языках представлены документы (предположительно, английский). Более детальную информацию можно будет получить после публикации полной статьи. Однако уже сейчас ясно, что CrimeNER-db станет важным шагом в развитии NER для криминальной сферы и, возможно, будет расширен на другие языки в будущем.