Корпус для разметки частей речи индонезийского языка: новый стандарт
Исследователи представили новый корпус для автоматической разметки частей речи в индонезийском языке, прошедший валидацию лингвистов. Это первый крупный ресурс такого рода, который может значительно улучшить качество NLP-систем для одного из самых распространенных языков мира.

Индонезийский язык — один из самых распространенных в мире, им владеют более 270 миллионов человек. Однако до сих пор для него не существовало полноценного корпуса с разметкой частей речи, который был бы проверен экспертами-лингвистами. Недавно группа исследователей представила новый корпус, который восполняет этот пробел. Статья о работе опубликована в журнале Scientific Data (издательство Nature).
Новый корпус включает более 100 000 слов, размеченных по частям речи, и прошел многоуровневую проверку со стороны профессиональных лингвистов. Это делает его одним из наиболее надежных ресурсов для обучения алгоритмов машинного обучения, используемых в обработке естественного языка (NLP). Разработчики подчеркивают, что валидация экспертами — ключевое отличие от предыдущих попыток создания подобных корпусов.
Зачем нужен корпус с валидацией лингвистов
Разметка частей речи (POS-tagging) — это фундаментальная задача в NLP. Она используется в машинном переводе, поисковых системах, чат-ботах и многих других приложениях. Для английского, русского и других крупных языков такие корпуса существуют давно, но для индонезийского их качество оставляло желать лучшего. Большинство существующих ресурсов были созданы автоматически или полуавтоматически, что приводило к ошибкам в разметке.
Новый корпус создавался вручную: команда лингвистов размечала тексты из различных источников — от новостей до научных статей. Затем проводилась перекрестная проверка: каждый текст размечался двумя независимыми экспертами, а разногласия разрешались третьим. Такой подход позволил достичь согласованности около 97%, что сравнимо с лучшими мировыми аналогами.
Предыстория и контекст
Индонезийский язык — агглютинативный, что делает его морфологически богатым и сложным для автоматического анализа. В отличие от английского, где слова часто имеют одну форму, индонезийские слова могут менять значение с помощью аффиксов. Например, корень "baca" (читать) превращается в "membaca" (читать — активный залог), "bacaan" (чтение), "terbaca" (читаемый) и так далее. Это создает дополнительные трудности для алгоритмов.
Ранее существовали попытки адаптировать корпуса других языков для индонезийского, но они не учитывали его специфику. Например, в индонезийском нет категории рода, но есть сложная система префиксов и суффиксов. Новый корпус учитывает эти особенности, что делает его более точным инструментом для обучения моделей.
Как создавался корпус и какова его структура
Корпус состоит из текстов, взятых из открытых источников, включая новостные сайты, блоги и научные публикации. Все тексты были очищены от шума и приведены к единому формату. Разметка включает 15 категорий частей речи, таких как существительное, глагол, прилагательное, местоимение и другие. Для каждой категории разработаны подробные правила, что обеспечивает единообразие разметки.
Особое внимание уделено сложным случаям, например, словам, которые могут быть разными частями речи в зависимости от контекста. Для таких случаев лингвисты разработали специальные инструкции, что повышает точность разметки. В результате корпус можно использовать как для обучения моделей с учителем, так и для оценки качества уже существующих систем.
Технические детали и сравнение с аналогами
С точки зрения технической реализации, корпус представлен в формате CoNLL-U, который является стандартом для многих NLP-инструментов. Это позволяет легко использовать его с популярными библиотеками, такими как spaCy, Stanza или UDPipe. Разработчики также предоставляют подробную документацию и статистику по корпусу, что облегчает его интеграцию.
По сравнению с предыдущими корпусами, новый ресурс демонстрирует значительно более высокую точность при обучении моделей. В тестах, проведенных авторами, модели, обученные на новом корпусе, показали улучшение точности на 5–7% по сравнению с моделями, обученными на старых данных. Это существенный прогресс, учитывая, что для индонезийского языка каждый процент точности важен.
Кого затронет и как
Для разработчиков NLP-систем, работающих с индонезийским языком, этот корпус станет незаменимым инструментом. Он позволит создавать более точные чат-боты, системы машинного перевода и анализа тональности. Особенно это актуально для компаний, работающих на рынке Индонезии — четвертой страны мира по численности населения.
Для лингвистов корпус представляет интерес как образец качественной разметки, которая может использоваться для сравнительных исследований. Кроме того, методика валидации, примененная авторами, может быть адаптирована для создания корпусов других языков, которые испытывают дефицит качественных ресурсов.
В России и странах СНГ интерес к индонезийскому языку растет, в том числе в контексте экономического сотрудничества. Поэтому новый корпус может быть полезен и для русскоязычных исследователей и разработчиков, работающих с этим языком.
Что будет дальше
Авторы планируют расширять корпус, добавляя новые тексты и улучшая разметку. Они также намерены создать аналогичные корпуса для других языков Индонезии, таких как яванский и сунданский, которые также имеют миллионы носителей. В перспективе это позволит создать единую платформу для NLP-исследований в регионе.
Кроме того, корпус уже доступен для скачивания, и исследователи приглашают коллег к сотрудничеству. Можно ожидать, что в ближайшие годы появятся новые модели, обученные на этом корпусе, которые зададут новый стандарт качества для индонезийского языка.
Итог
Новый корпус для разметки частей речи индонезийского языка — это значимый шаг вперед в развитии NLP для одного из крупнейших языков мира. Благодаря тщательной валидации лингвистами, он обеспечивает надежную основу для разработки более точных и эффективных систем обработки текста. Если вы работаете с индонезийским языком или интересуетесь созданием качественных языковых ресурсов, этот корпус стоит вашего внимания.