Почему ИИ для рентгена грудной клетки пропускает редкие болезни у некоторых пациентов

Модели искусственного интеллекта, предназначенные для анализа рентгенограмм грудной клетки, могут демонстрировать высокую среднюю точность, но при этом систематически пропускать редкие патологии у определённых групп пациентов. К такому выводу пришли исследователи, опубликовавшие препринт на arXiv. О

Почему ИИ для рентгена грудной клетки пропускает редкие болезни у некоторых пациентов

Модели искусственного интеллекта, предназначенные для анализа рентгенограмм грудной клетки, могут демонстрировать высокую среднюю точность, но при этом систематически пропускать редкие патологии у определённых групп пациентов. К такому выводу пришли исследователи, опубликовавшие препринт на arXiv. Они обнаружили, что традиционные метрики оценки, такие как средняя точность, маскируют неравенство в качестве диагностики для подгрупп, различающихся по полу, возрасту, расе и типу страховки. Это ставит под сомнение справедливость внедрения ИИ в клиническую практику без дополнительного аудита.

Как проводилось исследование

Учёные разработали методологию под названием «диагностическая лестница», которая позволяет поэтапно анализировать потери модели на разных уровнях: от общего класса до конкретных подгрупп. Они оценивали влияние взвешивания классов, робастности групп и выбора порога принятия решений. Эксперименты проводились на двух крупных наборах данных: VinDr-CXR (вьетнамские пациенты) и MIMIC-CXR/CXR-LT (американские пациенты). Основное внимание уделялось редким положительным находкам — патологиям, которые встречаются в обучающей выборке крайне редко.

Какие результаты были получены

На наборе VinDr-CXR комбинация группового взвешивания и порога, учитывающего длинный хвост распределения, позволила значительно снизить частоту ложноотрицательных результатов (FNR) в хвосте распределения — с 0,665 до 0,269. В худшей подгруппе по полу FNR упал с 0,705 до 0,157, по возрасту — с 0,822 до 0,133. При этом макро-mAP (средняя точность по классам) выросла с 0,611 до 0,635. Однако на наборе MIMIC-CXR/CXR-LT улучшения были скромнее: FNR снизился с 0,866 до 0,741, а остаточная частота пропусков осталась высокой. Это говорит о том, что проблема неравенства особенно остра в мультицентровых данных с большим разнообразием демографических групп.

Почему модели ИИ могут быть несправедливы к определённым группам пациентов?

Основная причина — дисбаланс в обучающих данных. Если редкие патологии чаще встречаются у пожилых пациентов или женщин, но в выборке таких примеров мало, модель учится игнорировать их. Кроме того, стандартные метрики, такие как AUC или средняя точность, усредняют ошибки по всем группам, скрывая провалы в подгруппах. Например, модель может отлично работать на молодых мужчинах, но пропускать туберкулёз у пожилых женщин. Исследование подчёркивает, что без целенаправленного аудита справедливости такие системы могут усугубить существующее неравенство в здравоохранении.

Кого затронут эти результаты

В первую очередь разработчиков систем ИИ для радиологии, которые теперь обязаны включать в пайплайн проверку на справедливость. Медицинские учреждения, планирующие внедрение таких моделей, должны требовать от поставщиков отчёты по подгруппам. Регуляторы, такие как FDA, могут ужесточить требования к валидации алгоритмов. И, конечно, пациенты из недопредставленных демографических групп — они рискуют получить менее качественную диагностику, если модели не будут адаптированы.

Что пока остаётся неизвестным

Исследователи отмечают, что их результаты пока ограничены рентгенографией грудной клетки. Неясно, насколько выводы обобщаются на другие модальности, такие как МРТ или КТ. Кроме того, работа не оценивала влияние на реальные клинические исходы — например, приводит ли пропуск патологии к ухудшению здоровья пациентов. Также остаётся открытым вопрос о том, как динамически адаптировать модели к новым данным без потери справедливости.

Выводы и рекомендации

Исследование демонстрирует, что даже высокоточные модели ИИ могут быть несправедливы к подгруппам пациентов с редкими патологиями. Для решения проблемы авторы предлагают использовать «диагностическую лестницу» и комбинировать групповое взвешивание с адаптивным порогом. Однако на практике требуется более тщательная валидация на разнообразных наборах данных. Разработчикам следует внедрять аудит справедливости на этапе тестирования, а регуляторам — требовать отчётов по подгруппам перед одобрением систем. Только так можно гарантировать, что ИИ в радиологии будет работать одинаково хорошо для всех пациентов.