MTEB-BR: первый эталонный бенчмарк для оценки эмбеддингов текста на бразильском португальском
Исследователи представили MTEB-BR — первый специализированный бенчмарк для оценки качества текстовых эмбеддингов на бразильском португальском языке. Этот инструмент включает 22 задачи, сгруппированные в семь категорий: классификация, мультилейбл-классификация, классификация пар, семантическая тексто

Исследователи представили MTEB-BR — первый специализированный бенчмарк для оценки качества текстовых эмбеддингов на бразильском португальском языке. Этот инструмент включает 22 задачи, сгруппированные в семь категорий: классификация, мультилейбл-классификация, классификация пар, семантическая текстовая близость, кластеризация, поиск и реранжирование. Все данные являются исконно португальскими — переводы исключены, что обеспечивает аутентичность оценки.
До появления MTEB-BR разработчики и исследователи, работающие с португалоязычными текстами, сталкивались с серьезной проблемой: не существовало выделенного бенчмарка для португальского языка. Оценка проводилась на переведённых корпусах, таких как английский MS MARCO, или на разреженном многоязычном покрытии. Это часто приводило к искажению результатов, поскольку переводы не отражают нюансы оригинального языка. MTEB-BR устраняет этот пробел, позволяя объективно сравнивать модели на родных данных, что критически важно для разработки качественных NLP-приложений.
Что такое MTEB-BR и как он устроен
MTEB-BR — это адаптация популярного бенчмарка MTEB (Massive Text Embedding Benchmark) для бразильского португальского. Он включает 22 задачи, охватывающие широкий спектр применений текстовых эмбеддингов: от классификации до поиска информации. Каждая задача основана на оригинальных португальских данных, собранных из таких источников, как новости, социальные сети, юридические документы и научные статьи. Это гарантирует, что оценка отражает реальные сценарии использования.
Почему этот бенчмарк важен для португальского языка
До сих пор португальский язык был обделён вниманием в области бенчмарков для эмбеддингов. Большинство существующих тестов ориентированы на английский или многоязычные системы с неравномерным покрытием. MTEB-BR заполняет эту нишу, предоставляя инструмент для объективного сравнения моделей. Это особенно актуально для Бразилии — крупнейшей португалоязычной страны с быстрорастущим рынком ИИ. Разработчики теперь могут выбирать модели, которые действительно работают с португальским, а не полагаться на приблизительные оценки.
Какие модели были протестированы и что показали результаты
В рамках бенчмарка протестировано 93 модели: 73 с открытым весом (от 23 млн до 27 млрд параметров) и 20 закрытых коммерческих API. Для каждой задачи вычисляются бутстреп-доверительные интервалы, попарная значимость, дискриминационный анализ на основе теории Item Response Theory и кросс-лидерборд корреляции. Результаты выявили несколько ключевых моментов.
Во-первых, модели чётко разделяются на около десятка уровней, хотя топ-6 статистически неразличимы. Это означает, что выбор лучшей модели не является тривиальным — несколько моделей показывают сопоставимое качество. Во-вторых, открытая модель, которую можно развернуть локально, входит в лидирующую группу. Это доказывает, что сильное качество не требует коммерческого API. В-третьих, корреляция между глобальным многоязычным рейтингом и португальским умеренная (Spearman rho = 0.75). Примечательно, что одна модель занимает 3-е место в мультиязычном рейтинге и лишь 49-е в MTEB-BR. Это подчёркивает важность специализированных бенчмарков.
Как MTEB-BR повлияет на разработку NLP-приложений
Разработчики NLP-приложений для португальского языка теперь могут опираться на объективные данные при выборе эмбеддингов. Это ускорит создание качественных систем для анализа тональности, поиска информации, кластеризации и других задач. Компании, использующие текстовые модели в Бразилии и других португалоязычных странах, смогут сократить затраты, выбирая открытые модели вместо дорогих API. Исследователи эмбеддингов получат эталон для сравнения своих разработок.
Какие данные и инструменты будут доступны
Ожидается публикация всех наборов данных, кода и публичной таблицы лидеров. Это позволит практикам выбирать модели на основе нативных данных и воспроизводить результаты. Бенчмарк будет регулярно обновляться с добавлением новых задач и моделей, что обеспечит его актуальность. Разработчики смогут легко интегрировать MTEB-BR в свои пайплайны оценки.
Какие ограничения есть у MTEB-BR
Несмотря на значимость, бенчмарк имеет ограничения. Он фокусируется только на бразильском варианте португальского, не охватывая европейский португальский. Кроме того, задачи не включают генерацию или мультимодальные сценарии. Однако это первый шаг к созданию полноценной экосистемы оценки для португальского языка.
Какие перспективы открывает MTEB-BR
MTEB-BR стимулирует развитие эмбеддингов для португальского языка, привлекая внимание исследователей и индустрии. Он может стать основой для аналогичных бенчмарков в других языках, где такие инструменты отсутствуют. В будущем возможно расширение на европейский португальский и другие варианты языка.
Кто выиграет от использования MTEB-BR
Разработчики NLP-приложений, исследователи эмбеддингов, компании, использующие текстовые модели в Бразилии и других португалоязычных странах, а также поставщики коммерческих API — все они получат выгоду от объективной оценки. MTEB-BR станет стандартом для сравнения моделей на португальском языке.
Что пока неизвестно о MTEB-BR
Ожидается публикация всех наборов данных, кода и публичной таблицы лидеров, чтобы практики могли выбирать модели на основе нативных данных. Детали лицензирования и планы по обновлению пока не раскрыты, но авторы обещают открытый доступ.