QIMMA: первый рейтинг арабских LLM с ручной оценкой качества от Hugging Face и TII

Hugging Face совместно с Технологическим институтом инноваций (TII) из ОАЭ запустили QIMMA (قِمّة) — первый рейтинг арабских больших языковых моделей (LLM), где качество оценивается вручную, а не автоматическими тестами. Это означает, что вместо традиционных бенчмарков, которые часто не учитывают ню

QIMMA: первый рейтинг арабских LLM с ручной оценкой качества от Hugging Face и TII

Hugging Face совместно с Технологическим институтом инноваций (TII) из ОАЭ запустили QIMMA (قِمّة) — первый рейтинг арабских больших языковых моделей (LLM), где качество оценивается вручную, а не автоматическими тестами. Это означает, что вместо традиционных бенчмарков, которые часто не учитывают нюансы арабского языка, эксперты вручную проверяют ответы моделей на корректность, полноту, безопасность и культурную уместность. Такой подход позволяет точнее определить, насколько модель действительно полезна для арабоязычных пользователей.

Арабский язык — один из самых сложных для NLP: он включает множество диалектов, специфическую письменность и культурные контексты, которые автоматические метрики часто упускают. QIMMA заполняет этот пробел, предоставляя разработчикам и бизнесу релевантный инструмент для выбора лучшей модели. На старте в рейтинг вошли около десяти моделей, включая Jais от G42 и AceGPT от TII, а лидером стала AceGPT 7B. Рейтинг будет обновляться ежемесячно, и сообщество может предлагать новые модели для включения.

Почему QIMMA важен для арабского NLP

До появления QIMMA разработчики и пользователи арабских LLM полагались на общие рейтинги, которые часто ориентированы на английский язык. Например, популярные бенчмарки вроде MMLU или HELM содержат мало арабских данных, а их автоматические метрики не способны оценить такие аспекты, как диалектная вариативность или культурная чувствительность. QIMMA решает эту проблему, используя ручную оценку, которая учитывает лингвистические и культурные особенности арабского мира.

Ручная оценка позволяет выявить тонкие ошибки, которые автоматические тесты пропускают: например, модель может дать грамматически правильный, но культурно неприемлемый ответ. Кроме того, QIMMA оценивает безопасность ответов, что критически важно для государственных и бизнес-приложений. Благодаря этому рейтингу организации в арабоязычных странах могут с большей уверенностью выбирать LLM для внедрения в чат-боты, системы перевода или аналитические инструменты.

Как устроен рейтинг QIMMA

QIMMA включает модели, которые были обучены или дообучены на арабском языке. Оценка проводится вручную по нескольким критериям: корректность (насколько ответ соответствует фактам), полнота (охватывает ли вопрос), безопасность (отсутствие вредоносного или оскорбительного контента) и культурная уместность (соответствие нормам и ценностям арабского общества). На момент запуска в рейтинге представлено около десяти моделей, и лидером стала AceGPT 7B от TII. Другие известные модели, такие как Jais от G42, также вошли в список.

Рейтинг будет обновляться ежемесячно, что позволит отслеживать прогресс моделей. Разработчики могут предложить свою модель для включения, отправив заявку через платформу Hugging Face. Пока не раскрыты точные критерии оценки и состав жюри, но ожидается, что в будущем могут быть добавлены автоматические метрики для масштабирования, хотя основа останется ручной.

Кого затронет запуск QIMMA

Разработчики арабских LLM получают прозрачный бенчмарк, который поможет выявить слабые места моделей и улучшить их. Бизнес и государственные организации в арабоязычных странах теперь могут выбирать наиболее качественные решения для внедрения, опираясь на объективные данные. Исследователи в области NLP получат ценный набор данных для анализа эффективности различных подходов к обучению моделей на арабском языке.

Кроме того, QIMMA может стимулировать развитие арабских LLM в целом: зная, что их модели будут оцениваться по реальным критериям, разработчики будут больше внимания уделять качеству, а не просто размерам или скорости. Это особенно важно для регионов, где арабский язык является официальным, таких как ОАЭ, Саудовская Аравия, Египет и другие страны Ближнего Востока и Северной Африки.

Что пока неизвестно о QIMMA

На данный момент не раскрыты точные критерии оценки и состав жюри, что вызывает вопросы о прозрачности рейтинга. Также неизвестно, будут ли в будущем добавлены автоматические метрики для масштабирования рейтинга на большее количество моделей. Пока QIMMA охватывает лишь около десяти моделей, но с ростом числа арабских LLM может потребоваться автоматизация части оценки.

Ещё один открытый вопрос — как рейтинг будет учитывать диалекты арабского языка. Например, модель, хорошо работающая на литературном арабском, может плохо справляться с египетским или магрибским диалектами. Пока неясно, будут ли в QIMMA отдельные категории для диалектов или оценка будет проводиться на смешанных данных.

Как QIMMA повлияет на рынок арабских LLM

Запуск QIMMA может стать поворотным моментом для индустрии арабских LLM. Раньше разработчики ориентировались на общие бенчмарки, которые не отражали специфику арабского языка, что приводило к созданию моделей, хорошо показывающих себя в тестах, но плохо работающих в реальных сценариях. Теперь у них есть стимул улучшать именно те аспекты, которые важны для арабоязычных пользователей.

Для бизнеса QIMMA упрощает выбор модели: вместо того чтобы тестировать десятки вариантов самостоятельно, компании могут опираться на рейтинг. Это особенно актуально для стартапов и государственных проектов, где качество и безопасность имеют первостепенное значение. В долгосрочной перспективе QIMMA может способствовать появлению более специализированных арабских LLM, например, для медицины или юриспруденции.

Какие модели уже в рейтинге QIMMA

На момент запуска в рейтинг вошли около десяти моделей, среди которых выделяются Jais от G42 и AceGPT от TII. Лидером стала AceGPT 7B — модель, разработанная TII, которая показала наилучшие результаты по всем критериям. Другие модели, вероятно, включают варианты на основе LLaMA и других открытых архитектур, дообученные на арабских данных. Полный список доступен на странице QIMMA на Hugging Face.

Интересно, что в рейтинг не вошли некоторые популярные модели, такие как GPT-4 или Gemini, поскольку они не являются специализированными арабскими LLM. QIMMA фокусируется именно на моделях, обученных или дообученных на арабском, что делает его релевантным для нишевых задач.

Будущее QIMMA и арабских LLM

Создатели QIMMA планируют обновлять рейтинг ежемесячно и расширять список моделей. Сообщество может предлагать новые модели через Hugging Face, что обеспечит актуальность рейтинга. В будущем возможно добавление автоматических метрик для первичной фильтрации, но ручная оценка останется ключевой, чтобы сохранить фокус на качестве.

QIMMA также может стать моделью для создания аналогичных рейтингов для других языков, например, для хинди или суахили. Успех этого проекта покажет, насколько востребован ручной подход в оценке LLM, и может повлиять на развитие NLP в целом. Пока же QIMMA — это важный шаг к тому, чтобы арабские LLM стали действительно полезными и безопасными для миллионов пользователей.