Почему португальская языковая модель AMALIA провалила тест на моральные ценности
Исследование показало, что национальная языковая модель AMALIA-9B, разработанная для португальского языка, не способна валидно оценивать моральные конструкты, такие как «авторитет». Хотя модель демонстрирует высокое согласие с людьми-кодировщиками, при детальном анализе выясняется, что она используе

Исследование показало, что национальная языковая модель AMALIA-9B, разработанная для португальского языка, не способна валидно оценивать моральные конструкты, такие как «авторитет». Хотя модель демонстрирует высокое согласие с людьми-кодировщиками, при детальном анализе выясняется, что она использует поверхностные признаки, а не следует теоретической модели. Это ставит под сомнение надёжность суверенных LLM для задач, требующих глубокого понимания ценностей.
Что обнаружили исследователи
Группа учёных решила проверить, насколько валидна португальская языковая модель AMALIA-9B при кодировании морального основания «авторитет» в текстах на европейском португальском. Модель, обученная на национальном корпусе и финансируемая государством, показала высокое согласие с обученными людьми-кодировщиками. Её результаты были в пределах 6 F1-баллов от открытых моделей, которые в 8–13 раз больше по размеру. На первый взгляд, это обнадёживающий результат для суверенной модели.
Однако когда исследователи применили метод «восстановительного разрыва», картина изменилась. Они разбили задачу на атомарные пункты кодбука, а затем рекомбинировали их по явным правилам теории моральных оснований. В этом сценарии производительность модели упала примерно вдвое. Анализ ошибок показал, что AMALIA опирается на поверхностные признаки, такие как моральное возмущение рядом с фигурами авторитета, а не на логику теории.
Почему согласие не равно валидности
Ключевой вывод исследования — согласие с людьми не гарантирует валидности. Для теоретических конструктов, которые требуют вывода, а не чтения поверхностных признаков, критично, следует ли модель теории или достигает правильного кода через коррелированные короткие пути. В случае AMALIA модель давала верные ответы, но по неправильным причинам. Это напоминает ситуацию, когда студент угадывает ответ на экзамене, не понимая материала.
Исследование подчёркивает, что бенчмарки для суверенных языковых моделей должны тестировать не только согласие с людьми, но и «доказательный маршрут», которым это согласие достигается. Без этого высокая производительность может вводить в заблуждение.
Какие методы использовались для проверки
Для выявления проблемы исследователи применили технику «восстановительного разрыва». Сначала модель получала целостный запрос на кодирование морального основания «авторитет». Затем тот же запрос декомпозировался на атомарные пункты, соответствующие каждому аспекту теории. После этого модель должна была рекомбинировать эти пункты по явным правилам. Разница в производительности между целостным и декомпозированным подходами и есть «восстановительный разрыв».
Результат оказался значительным: декомпозиция восстановила только около половины целостной производительности AMALIA. Для контроля использовалась открытая многоязычная LLM, которая закрыла разрыв на том же корпусе с теми же инструкциями. Это указывает на то, что проблема кроется именно в модели, а не в корпусе данных.
Кого затронут результаты
Выводы исследования имеют прямое значение для разработчиков национальных языковых моделей, особенно для языков с ограниченными ресурсами, таких как португальский. Они показывают, что простое обучение на большом корпусе не гарантирует глубокого понимания ценностей. Исследователи в области вычислительной социологии и анализа моральных оснований также должны учитывать эти результаты при интерпретации данных, полученных с помощью LLM.
Государственные органы, инвестирующие в суверенные LLM, должны быть осторожны. Модель может казаться эффективной на стандартных тестах, но проваливать проверку на валидность. Это может привести к ошибочным выводам при анализе общественного мнения или моральных установок.
Что пока остаётся неизвестным
Исследование не даёт окончательного вердикта национальным моделям. Пока неясно, является ли этот результат единичным контрпримером или систематической проблемой для других конструктов, моделей и языков. Возможно, для других моральных оснований, таких как «забота» или «справедливость», AMALIA покажет лучшие результаты. Также требуется проверить другие суверенные модели, например, для финского или чешского языков.
Тем не менее, работа призывает к более тщательному тестированию валидности. Простые бенчмарки на согласие с людьми недостаточны. Необходимо внедрять методы, проверяющие, следует ли модель теории или использует поверхностные признаки. Только так можно гарантировать, что LLM действительно понимают моральные конструкты, а не имитируют их.