Медицинские LLM дают неравные ответы на разных языках: исследование
Исследователи выяснили, что большие языковые модели (LLM) предоставляют медицинскую информацию разного качества в зависимости от языка запроса. Это ставит под угрозу равный доступ к надежным знаниям для носителей неанглийских языков и может привести к ошибочным диагнозам или неверным рекомендациям.

Исследователи выяснили, что большие языковые модели (LLM) предоставляют медицинскую информацию разного качества в зависимости от языка запроса. Это ставит под угрозу равный доступ к надежным знаниям для носителей неанглийских языков и может привести к ошибочным диагнозам или неверным рекомендациям. В работе, проведенной международной группой ученых, были проанализированы ответы LLM на медицинские вопросы на пяти языках: английском, немецком, турецком, китайском (мандарин) и итальянском. Результаты показали, что модели сильнее ориентируются на английскую Википедию, даже если запрос задан на другом языке. Это открытие имеет важные последствия для внедрения ИИ в здравоохранение по всему миру.
Как проводилось исследование
Ученые создали многоязычный датасет MultiWikiHealthCare на основе статей Википедии по медицине. Затем они оценивали, насколько ответы популярных LLM соответствуют фактам из Википедии на языке запроса. Исследование включало четыре этапа: формирование датасета, анализ охвата медицинских тем в разных языковых разделах Википедии, оценку соответствия ответов LLM этим источникам и изучение методов улучшения фактической согласованности, включая Retrieval-Augmented Generation (RAG).
Почему ответы LLM различаются в зависимости от языка?
Основная причина — дисбаланс в обучающих данных. Английский язык доминирует в интернете, поэтому LLM получают больше медицинской информации на английском. Кроме того, неанглийские разделы Википедии часто менее полны и содержат меньше статей по медицине. Это приводит к тому, что даже при запросе на родном языке модель опирается на английские источники, что может искажать информацию или делать её менее релевантной для локального контекста.
Результаты и их значение
Исследование показало, что ответы LLM сильнее коррелируют с английской Википедией, независимо от языка запроса. Например, на турецком или китайском языке модель может давать ответ, основанный на английских данных, игнорируя местные медицинские практики или эпидемиологические особенности. Это особенно опасно в ситуациях, где важна культурная адаптация, например, при рекомендациях по лечению распространенных в регионе заболеваний.
Кого затронет это неравенство?
Проблема касается разработчиков медицинских AI-систем, врачей, использующих LLM для консультаций, и пациентов, которые ищут информацию на родном языке. Также она важна для исследователей в области многоязычного NLP и политиков, регулирующих ИИ в здравоохранении. Если не принять меры, внедрение медицинских чат-ботов может усилить существующее неравенство в доступе к качественной медицине.
Как можно улучшить ситуацию
Один из подходов — использование Retrieval-Augmented Generation (RAG). Этот метод позволяет модели обращаться к внешним источникам знаний во время генерации ответа. Исследователи обнаружили, что если предоставить LLM контекстные выдержки из неанглийской Википедии, фактическая согласованность ответов смещается в сторону культурно-релевантных знаний. Однако внедрение RAG в реальных медицинских приложениях требует дополнительных исследований, особенно в области безопасности и точности.
Какие языки пострадали больше всего?
Хотя исследование охватило только пять языков, авторы предполагают, что проблема может быть еще острее для языков с меньшим цифровым присутствием, таких как африканские или индийские языки. Неясно, насколько сильно различается качество ответов для других языков и как эффективно внедрять RAG в реальных медицинских приложениях. Также не исследованы другие источники медицинских знаний, кроме Википедии, которые могли бы быть более надежными.
Выводы
Неравенство в ответах медицинских LLM на разных языках — серьезная проблема, требующая внимания разработчиков и регуляторов. Без целенаправленных усилий по улучшению многоязычной поддержки и фактической согласованности, ИИ в здравоохранении рискует усилить существующие диспропорции. Использование RAG и расширение обучающих данных на неанглийских языках могут стать первыми шагами к решению. Однако необходимы дальнейшие исследования, чтобы гарантировать, что медицинские LLM предоставляют равные возможности для всех пациентов, независимо от их языка.