ModernBERT от Hugging Face и Answer.ai: новый стандарт для задач NLP
Hugging Face совместно с исследовательской лабораторией Answer.ai выпустили ModernBERT — новую языковую модель, предназначенную для замены классического BERT. Эта модель доступна в двух вариантах: ModernBERT-base (149 млн параметров) и ModernBERT-large (395 млн параметров), и обучена на 2 триллионах

Hugging Face совместно с исследовательской лабораторией Answer.ai выпустили ModernBERT — новую языковую модель, предназначенную для замены классического BERT. Эта модель доступна в двух вариантах: ModernBERT-base (149 млн параметров) и ModernBERT-large (395 млн параметров), и обучена на 2 триллионах токенов. ModernBERT интегрирует современные архитектурные улучшения, которые позволяют значительно повысить производительность при меньших вычислительных затратах, что делает её привлекательной альтернативой для широкого круга задач обработки естественного языка.
Почему ModernBERT превосходит классический BERT
BERT (Bidirectional Encoder Representations from Transformers) с 2018 года оставался одной из самых популярных моделей для задач понимания текста, таких как классификация, вопросно-ответные системы и распознавание именованных сущностей (NER). Однако за шесть лет появилось множество улучшений, которые не были интегрированы в исходный BERT. ModernBERT объединяет эти достижения, предлагая более высокую производительность при меньших вычислительных затратах. Например, использование Flash Attention позволяет ускорить обработку, а Rotary Position Embeddings (RoPE) улучшают понимание позиций токенов. В результате модель показывает результаты, сопоставимые или превосходящие более крупные модели, такие как DeBERTaV3, при этом работая в 2-4 раза быстрее на современных GPU (например, NVIDIA A100).
Какие архитектурные улучшения включает ModernBERT
ModernBERT использует архитектуру encoder-only, как и BERT, но с рядом ключевых улучшений. Во-первых, Flash Attention значительно ускоряет вычисления внимания, особенно на длинных последовательностях. Во-вторых, Rotary Position Embeddings (RoPE) заменяют абсолютные позиционные эмбеддинги, что позволяет модели лучше обобщать на разные длины последовательностей. В-третьих, GeGLU активация заменяет ReLU, обеспечивая более эффективное обучение. Кроме того, Alternating Attention — чередование полного внимания и внимания с глобальными токенами — позволяет эффективно работать с длинными последовательностями до 8192 токенов. Наконец, Unpadding удаляет токены-заполнители, ускоряя вычисления за счёт работы только с реальными данными.
Как ModernBERT влияет на производительность и скорость
По тестам на бенчмарках GLUE и других задачах ModernBERT показывает результаты, сопоставимые или превосходящие более крупные модели, такие как DeBERTaV3, при этом работая в 2-4 раза быстрее на современных GPU (например, NVIDIA A100). Это означает, что разработчики могут получить более высокую точность без увеличения времени инференса. Например, на задаче классификации текста ModernBERT-base достигает точности, близкой к DeBERTaV3-base, но при этом требует меньше вычислительных ресурсов. Для компаний это означает снижение затрат на инфраструктуру и возможность обрабатывать больше запросов за то же время.
Какие задачи NLP можно решать с помощью ModernBERT
ModernBERT предназначен для широкого спектра задач понимания текста, включая классификацию, вопросно-ответные системы, распознавание именованных сущностей (NER), анализ тональности и извлечение отношений. Благодаря поддержке контекста до 8192 токенов, модель также подходит для задач с длинными документами, такими как суммаризация или анализ юридических текстов. Разработчики могут легко заменить BERT на ModernBERT в существующих пайплайнах, так как модель совместима с библиотекой трансформеров Hugging Face и поддерживает дообучение на собственных данных.
Кому будет полезна новая модель
Разработчики и исследователи, использующие BERT для задач NLP, смогут легко заменить его на ModernBERT: модель совместима с трансформерами Hugging Face и поддерживает дообучение. Компании, внедряющие NLP-решения, получат более быстрые и точные модели без увеличения затрат на инфраструктуру. Например, стартапы, работающие с анализом отзывов клиентов, смогут обрабатывать больше данных в реальном времени. Крупные корпорации, использующие вопросно-ответные системы, увидят улучшение качества ответов при тех же вычислительных мощностях.
Что пока неизвестно о ModernBERT
Пока не опубликованы результаты на всех стандартных бенчмарках, например, SuperGLUE. Также неизвестно, насколько хорошо модель справляется с задачами, требующими очень больших контекстов (более 8K токенов). Кроме того, не раскрыты детали обучения, такие как точный состав данных и гиперпараметры. Это может вызвать вопросы у исследователей, которые хотят воспроизвести результаты. Однако на основе опубликованных данных можно ожидать, что ModernBERT станет стандартом для многих задач NLP в ближайшие годы.
Как начать использовать ModernBERT
Чтобы начать использовать ModernBERT, достаточно установить библиотеку трансформеров Hugging Face и загрузить модель с помощью AutoModel. Например, для задачи классификации можно использовать ModernBERTForSequenceClassification. Модель поддерживает дообучение на собственных данных, что позволяет адаптировать её под конкретные задачи. Разработчики могут найти примеры кода и документацию на странице Hugging Face. Благодаря совместимости с существующими инструментами, миграция с BERT на ModernBERT займёт минимум времени.
Какие перспективы у ModernBERT
ModernBERT знаменует собой новый этап в развитии encoder-only моделей. Он объединяет лучшие практики, накопленные за шесть лет после выхода BERT, и предлагает готовое решение для задач NLP. В будущем можно ожидать появления ещё более эффективных моделей, основанных на тех же принципах. Однако уже сейчас ModernBERT является серьёзным кандидатом на замену BERT в продакшене. Команды Hugging Face и Answer.ai планируют продолжать развитие модели, добавляя поддержку большего количества языков и улучшая производительность.