Радиологические foundation-модели: обзор 67 исследований выявил разрыв между разработкой и клиникой
Радиологические foundation-модели, или фундаментальные модели визуализации (VFMs), обещают революцию в анализе медицинских изображений, но их путь в реальную клиническую практику оказался сложнее, чем предполагалось. Систематический обзор 67 рецензируемых статей, опубликованных с января 2017 по март

Радиологические foundation-модели, или фундаментальные модели визуализации (VFMs), обещают революцию в анализе медицинских изображений, но их путь в реальную клиническую практику оказался сложнее, чем предполагалось. Систематический обзор 67 рецензируемых статей, опубликованных с января 2017 по март 2026 года, показал, что, несмотря на впечатляющие успехи в лабораторных условиях, большинство моделей сталкиваются с серьезными препятствиями при внедрении в клинику. Исследование, проведенное по методологии PRISMA-ScR, выявило ключевые проблемы: несбалансированность данных, недостаток валидации на разных устройствах и анатомических областях, а также отсутствие стандартизации в оценке. Эти выводы подчеркивают необходимость пересмотра подходов к разработке и тестированию AI-систем для радиологии.
Масштаб и разнообразие данных: перекос в сторону распространенных модальностей
Анализ показал, что foundation-модели обучаются преимущественно на ограниченном наборе данных. Доминируют три типа изображений: МРТ головного мозга, КТ грудной клетки и брюшной полости, а также рентгенография грудной клетки. Размер выборок варьируется от менее 100 тысяч до нескольких миллионов изображений, но такое разнообразие не отражает реальную клиническую картину. Редкие патологии, такие как опухоли головного мозга низкой степени злокачественности или интерстициальные заболевания легких, представлены крайне слабо. Это создает риск того, что модели будут хорошо работать на распространенных случаях, но давать сбои при столкновении с нетипичными или редкими состояниями.
Кроме того, большинство датасетов собраны из ограниченного числа центров или даже из одного учреждения. Такая однородность источников данных приводит к тому, что модели плохо обобщают на новые клинические условия. Например, модель, обученная на изображениях с одного типа МРТ-сканера, может показать снижение точности при работе с данными с другого оборудования. Исследователи отмечают, что для преодоления этого разрыва необходимо включать в обучение более репрезентативные выборки, охватывающие разные демографические группы, типы оборудования и протоколы сканирования.
Архитектуры и методы обучения: трансформеры и self-supervised подходы в центре внимания
В области архитектур foundation-моделей доминируют трансформеры, которые вытеснили традиционные сверточные нейронные сети. Самыми популярными методами предобучения стали self-supervised подходы: маскированное моделирование изображений, контрастивное обучение и многостадийные методы. Эти техники позволяют моделям учиться на немаркированных данных, что особенно ценно в медицине, где разметка изображений требует участия экспертов и стоит дорого.
Однако, несмотря на технологический прогресс, исследователи выявили проблему масштабируемости. Многие модели демонстрируют улучшение производительности при увеличении объема данных и размера модели, но этот эффект не всегда сохраняется при переходе к новым задачам. Например, модель, отлично справляющаяся с сегментацией опухолей, может показывать посредственные результаты при классификации стадий заболевания. Это указывает на то, что текущие архитектуры недостаточно универсальны для всех клинических сценариев.
Какие методы оценки используются для радиологических foundation-моделей?
Оценка моделей в обзоре проводилась в основном через задачи сегментации и классификации. Однако кросс-центровая, кросс-сканерная и анатомическая валидация выполнялась непоследовательно. Только около трети исследований проверяли свои модели на данных из других центров или с другого оборудования. Еще меньше работ проводили валидацию на разных анатомических областях, что критически важно для оценки обобщающей способности. Без такой валидации невозможно гарантировать, что модель будет работать в реальной клинической практике, где условия варьируются от больницы к больнице.
Принципы FUTURE-AI: соблюдение оставляет желать лучшего
FUTURE-AI — это набор принципов для разработки надежного и этичного AI в медицине: справедливость, универсальность, прослеживаемость, удобство использования, надежность и объяснимость. Обзор показал, что эти принципы соблюдаются неравномерно. Например, только в половине исследований оценивалась справедливость модели по отношению к разным демографическим группам. Объяснимость, то есть способность модели обосновывать свои решения, часто игнорировалась. Без этого врачи не могут доверять AI-системам, особенно в сложных диагностических случаях.
Кроме того, большинство работ не предоставляли полную информацию о данных и архитектуре, что затрудняет воспроизводимость результатов. Исследователи призывают к стандартизации отчетности, чтобы облегчить сравнение моделей и ускорить их внедрение.
Влияние на разработчиков, клиницистов и регуляторов
Результаты обзора имеют прямое значение для трех ключевых групп. Разработчики AI для медицины должны сосредоточиться на создании более репрезентативных датасетов и внедрении стандартизированных бенчмарков. Без этого модели будут оставаться игрушками для исследований, а не инструментами для клиники. Клиницисты и радиологи, в свою очередь, должны быть осторожны при использовании таких моделей: они пока не готовы к широкому внедрению. Регуляторам и исследователям необходимо разработать унифицированные протоколы оценки и отчетности, чтобы обеспечить прозрачность и надежность AI-систем.
Что еще остается неизвестным?
Обзор выявил несколько пробелов в знаниях. Во-первых, неясно, как foundation-модели поведут себя на редких патологиях, которые часто встречаются в клинической практике. Во-вторых, отсутствуют крупные проспективные исследования, оценивающие модели в реальных рабочих процессах. Большинство работ ограничиваются ретроспективным анализом, что не учитывает динамику клинической среды. Наконец, вопросы безопасности и этики, такие как защита данных пациентов и предотвращение предвзятости, остаются недостаточно изученными.
В заключение, радиологические foundation-модели обладают огромным потенциалом, но текущий разрыв между разработкой и клиническим внедрением требует скоординированных усилий. Только через улучшение качества данных, стандартизацию оценки и соблюдение принципов FUTURE-AI можно будет превратить эти модели в надежных помощников для врачей.