LLM бесшумно «исправляют» афроамериканский английский: исследование и новый метод коррекции
Современные большие языковые модели систематически заменяют афроамериканский английский на стандартный американский, даже когда контекст явно указывает на использование AAE. Это явление не только искажает речь миллионов пользователей, но и может усиливать языковую дискриминацию в цифровых сервисах.

Современные большие языковые модели систематически заменяют афроамериканский английский на стандартный американский, даже когда контекст явно указывает на использование AAE. Это явление не только искажает речь миллионов пользователей, но и может усиливать языковую дискриминацию в цифровых сервисах. Ученые из Университета Иллинойса в Урбане-Шампейне совместно с коллегами из других институтов провели масштабное исследование, результаты которого опубликованы на arXiv (2607.06845), и предложили метод, позволяющий снизить такое смещение в 5–20 раз без ущерба для качества текста.
Как LLM «исправляют» афроамериканский английский
Исследователи проанализировали работу моделей с количеством параметров от 14 до 70 миллиардов, включая такие популярные архитектуры, как GPT-2, LLaMA и OPT. Во всех случаях наблюдалась одна и та же закономерность: если пользователь вводил текст на AAE, модель на выходе преобразовывала его в стандартный американский английский, игнорируя стилистические и грамматические особенности оригинала. Причем это происходило даже тогда, когда предыдущие сообщения в диалоге были написаны на AAE. Автоматическое «исправление» затрагивает не только лексику, но и синтаксис: например, конструкция «ain't nobody» заменяется на «isn't anybody» или «no one». Такое поведение моделей может восприниматься носителями AAE как неуважение к их языку и культуре.
Почему это проблема для миллионов людей
Афроамериканский английский — это полноценный диалект с собственной грамматикой и фонетикой, на котором говорят более 30 миллионов человек в США. Он признан лингвистами как равноправная форма английского языка, однако в обществе часто стигматизируется. Когда LLM бесшумно заменяют AAE на SAE, они не только искажают смысл высказываний, но и подкрепляют предубеждение, что AAE «неправильный» или «недостаточно хороший». Особенно остро это проявляется в системах автоматического ответа, чат-ботах и голосовых помощниках, где пользователи ожидают персонализированного и уважительного общения. Снижение качества обслуживания для носителей AAE может привести к цифровому неравенству и ограничению доступа к технологиям.
Какие именно конструкции чаще всего искажаются
Ученые выяснили, что наиболее чувствительными к «исправлению» оказались синтаксические конструкции, связанные с отрицательным согласованием. Например, фразы вроде «I ain't got no money» или «She don't know nothing» практически всегда преобразуются в стандартные формы «I don't have any money» и «She doesn't know anything». Другие типичные черты AAE, такие как опущение глагола-связки («He tall» вместо «He is tall») или использование «be» для обозначения привычных действий («She be working»), также подвергаются замене. Интересно, что модели не просто переводят отдельные слова, а перестраивают всю структуру предложения, что свидетельствует о глубинном смещении в обучающих данных.
Как ученые обнаружили и измерили смещение
Для точной оценки смещения исследователи разработали специальный фреймворк аудита. Ключевой инновацией стала метрика условной групповой инвариантности (cDGI), которая позволяет отделить истинное смещение модели от артефактов, возникающих при переводе текста. Дело в том, что если модель просто плохо понимает AAE, то ошибки будут случайными. Но cDGI показывает, что модели систематически предпочитают SAE, даже когда AAE полностью понятен. С помощью анализа на уровне признаков авторы определили, что именно синтаксис, а не лексика, является универсальным триггером смещения во всех протестированных моделях.
Новый метод коррекции без переобучения
Для смягчения обнаруженного смещения ученые впервые применили технику активационного управления к диалектному контексту. Суть метода в том, что из модели извлекаются «диалектные направления» — векторы во внутренних представлениях, отвечающие за переход от AAE к SAE. Затем эти направления вводятся обратно в определенные слои нейросети на этапе тестирования, что позволяет «заблокировать» нежелательное преобразование. Важно, что метод не требует дообучения модели или изменения ее весов — он работает как фильтр во время генерации текста. Эксперименты показали, что такой подход снижает смещение в 5–20 раз эффективнее, чем простые подсказки вроде «сохраняй диалект пользователя», при этом беглость и грамматическая правильность SAE не страдают.
Создание крупнейшего корпуса AAE
Для проведения исследования команда создала самый большой на сегодняшний день параллельный корпус афроамериканского английского — REAL-AAE. Он содержит 17 479 троек: оригинальный текст на AAE, его перевод на SAE и обратный перевод на AAE. Данные были собраны из реальных твитов, что обеспечивает высокую экологическую валидность. Качество корпуса автоматически проверено с помощью BERTScore (F1 = 0.95), а также вручную тремя носителями AAE, которые подтвердили семантическое соответствие в 83% случаев. По размеру REAL-AAE превосходит предыдущие ресурсы в 2–6 раз, что открывает новые возможности для исследований диалектного смещения.
Кого затронут результаты исследования
В первую очередь, разработчиков больших языковых моделей, которые теперь могут использовать предложенный метод для аудита и коррекции смещения. Пользователи, говорящие на AAE, получат более уважительное и точное взаимодействие с AI-системами. Исследователи в области справедливости NLP получают инструменты для оценки и смягчения диалектных предубеждений. Кроме того, метод активационного управления потенциально применим к другим диалектам и языкам, а также к смещениям по признакам пола, возраста или социального статуса.
Какие вопросы остаются открытыми
Несмотря на обнадеживающие результаты, ученые признают, что метод активационного управления пока протестирован только на моделях до 70 миллиардов параметров. Насколько хорошо он обобщается на более крупные архитектуры, например GPT-4 или Claude, пока неизвестно. Также неясна стабильность «диалектных направлений» при изменении контекста: возможно, в длинных диалогах или при смене темы эффективность метода снижается. Дальнейшие исследования должны ответить на эти вопросы и адаптировать технику для промышленного использования.