BLOOM: 176 миллиардов параметров — крупнейшая открытая мультиязычная языковая модель
11 ноября 2022 года международная коллаборация BigScience, объединившая Hugging Face, французский Национальный центр научных исследований (CNRS) и сотни независимых исследователей, представила BLOOM (BigScience Large Open-science Open-access Multilingual Language Model). Это крупнейшая открытая муль

11 ноября 2022 года международная коллаборация BigScience, объединившая Hugging Face, французский Национальный центр научных исследований (CNRS) и сотни независимых исследователей, представила BLOOM (BigScience Large Open-science Open-access Multilingual Language Model). Это крупнейшая открытая мультиязычная языковая модель, содержащая 176 миллиардов параметров. BLOOM обучена на 46 естественных языках (включая русский, китайский, арабский, испанский и многие другие) и 13 языках программирования. Модель распространяется под лицензией BigScience OpenRAIL-M, которая разрешает коммерческое использование при соблюдении определённых ограничений, таких как запрет на вредоносное применение. Открытость весов, кода и данных делает BLOOM важным шагом к демократизации доступа к большим языковым моделям и снижению зависимости от крупных технологических корпораций.
Почему BLOOM — это прорыв в мире ИИ BLOOM бросает вызов доминированию закрытых моделей, таких как GPT-3 от OpenAI и PaLM от Google. В отличие от них, BLOOM полностью открыта: исходный код, веса и обучающие данные доступны каждому. Это позволяет исследователям и разработчикам со всего мира изучать внутреннее устройство модели, дообучать её под свои задачи и развёртывать без лицензионных ограничений. Такой подход способствует демократизации искусственного интеллекта, делая передовые технологии доступными не только крупным корпорациям, но и небольшим стартапам, университетам и независимым разработчикам. Кроме того, открытость способствует прозрачности и позволяет выявлять и устранять предвзятости, которые могут быть скрыты в закрытых системах.
Как устроена архитектура BLOOM Архитектурно BLOOM основана на модели GPT-3, то есть использует только декодер. Однако разработчики внедрили несколько ключевых оптимизаций. Во-первых, это механизм ALiBi (Attention with Linear Biases), который позволяет модели эффективно обрабатывать последовательности разной длины без дополнительного обучения позиционных эмбеддингов. Во-вторых, применена технология Flash Attention, ускоряющая вычисления и снижающая потребление памяти. Эти улучшения позволяют BLOOM работать с длинными контекстами и ускоряют обучение. Модель обучалась на 1,6 терабайтах данных, которые были тщательно очищены и отфильтрованы для обеспечения качества и разнообразия. Особое внимание уделялось мультиязычности: в датасет вошли тексты на 46 языках, представляющих разные языковые семьи и регионы.
Насколько BLOOM хороша в сравнении с конкурентами По производительности BLOOM сопоставима с GPT-3 и другими закрытыми моделями на стандартных бенчмарках, таких как SuperGLUE, XNLI и WMT. Например, на тесте SuperGLUE BLOOM показывает результаты, близкие к GPT-3, а в задачах перевода (WMT) часто превосходит многие специализированные модели. Благодаря мультиязычному обучению BLOOM особенно сильна в кросс-лингвистических задачах: она может переводить между парами языков, которые редко встречаются в коммерческих системах. На бенчмарке XNLI, оценивающем понимание естественного языка на разных языках, BLOOM демонстрирует стабильно высокие результаты, что подтверждает её универсальность. Однако стоит отметить, что для некоторых узкоспециализированных задач BLOOM может уступать моделям, дообученным на конкретных доменах.
Кто может использовать BLOOM и как Исследователи ИИ получают возможность изучать поведение больших моделей без необходимости доступа к проприетарным системам. Это открывает двери для академических исследований в области интерпретируемости, справедливости и безопасности. Разработчики могут создавать мультиязычные приложения: чат-ботов, системы перевода, инструменты генерации кода и многое другое. Для бизнеса лицензия OpenRAIL-M разрешает коммерческое использование при условии соблюдения ограничений (например, запрет на создание вредоносного контента). Сообщество NLP получает эталонную открытую модель, с которой можно сравнивать новые разработки. Модель доступна через Hugging Face Hub: можно скачать веса, код и документацию, а также воспользоваться демо-пространством и API для тестирования.
Какие ограничения и неизвестные остаются Несмотря на все преимущества, у BLOOM есть и ограничения. Для локального запуска модели требуется огромное количество видеопамяти — десятки гигабайт, поэтому большинству пользователей придётся использовать облачные решения. Детальная политика модерации контента пока не раскрыта: как и другие большие языковые модели, BLOOM может генерировать предвзятый, оскорбительный или фактически неверный контент. Разработчики призывают сообщество к ответственному использованию и планируют внедрять механизмы фильтрации. Пока неясны планы по дальнейшему развитию и поддержке модели: будет ли она обновляться, появятся ли новые версии с улучшенной архитектурой. Тем не менее, BLOOM уже стала важной вехой на пути к открытому и доступному ИИ.
Какие языки поддерживает BLOOM BLOOM обучена на 46 естественных языках, включая русский, английский, китайский, арабский, испанский, французский, немецкий, хинди, бенгальский, суахили и многие другие. Также модель поддерживает 13 языков программирования, таких как Python, JavaScript, C++, Java, Go, Rust и другие. Это делает BLOOM одной из самых мультиязычных открытых моделей на сегодняшний день. Благодаря такому разнообразию, BLOOM может применяться для задач перевода, анализа тональности, генерации текста и кода на десятках языков, включая редкие и малообеспеченные ресурсами.