99,2% точности без единой опухоли: почему ИИ-диагностика сложнее, чем кажется
Когда заказчик просит модель компьютерного зрения для поиска рака с точностью 98–99%, кажется, что задача проста: дать нейросеть, обученную на снимках, и получить результат. Однако на практике высокая точность может оказаться ловушкой. В шведском исследовании MASAI, крупнейшем рандомизированном испы

Когда заказчик просит модель компьютерного зрения для поиска рака с точностью 98–99%, кажется, что задача проста: дать нейросеть, обученную на снимках, и получить результат. Однако на практике высокая точность может оказаться ловушкой. В шведском исследовании MASAI, крупнейшем рандомизированном испытании ИИ в скрининге рака молочной железы, участвовали 105 934 женщины. В группе с ИИ-поддержкой из 53 043 участниц рак выявили у 420 — распространенность составила всего 0,79%. Если бы модель просто предсказывала «норму» для всех снимков, её точность достигла бы 99,21% — но она не нашла бы ни одной опухоли. Проблема в дисбалансе классов: здоровых снимков подавляющее большинство, и метрика accuracy становится бесполезной. В медицине критичны чувствительность (sensitivity) — доля верно выявленных больных, и специфичность (specificity) — доля верно выявленных здоровых. Для скрининга рака чувствительность должна быть не ниже 90–95%, иначе смысл теряется.
Точность как ловушка
В упомянутом исследовании MASAI, опубликованном в The Lancet Oncology в 2023 году, ИИ-поддержка позволила увеличить выявляемость рака на 20% без роста ложных вызовов, но только при условии, что алгоритм работал в паре с радиологом. Полная автоматизация пока невозможна из-за редкости патологий, вариабельности оборудования и пациентов. Модель, обученная на сбалансированном датасете, может показывать отличные результаты в лаборатории, но в реальной клинике столкнётся с тем, что здоровых снимков в сотни раз больше, чем патологических. Если разработчик ориентируется только на точность, он рискует создать систему, которая «лечит» статистику, а не пациентов.
Почему эталон разметки расходится в четверти случаев?
Разметка медицинских изображений — субъективный процесс. Даже опытные радиологи согласуются друг с другом лишь в 70–80% случаев при оценке маммограмм. Это означает, что «золотой стандарт», на котором обучается модель, содержит ошибки. Если один врач пометил подозрительную тень, а другой нет — какой ответ считать правильным? Исследование, проведенное в 2022 году в Radiology, показало, что при повторной разметке того же набора данных тремя экспертами уровень согласия (Cohen's kappa) составил 0,6–0,7, что соответствует «умеренному» согласию. Для обучения модели это создаёт проблему: она учится на шумных данных и может запомнить не паттерны болезни, а особенности разметки конкретного врача. Или, что ещё хуже, — особенности больницы, где сделаны снимки. Например, модель может научиться распознавать марку маммографа или артефакты конкретного кабинета, а не опухоли. Это явление называется «смещение по учреждению» (site bias) и является одной из главных причин, почему модели отлично работают на тестовых данных, но проваливаются в новой клинике.
Технические и финансовые детали
Разметка медицинских изображений — дорогостоящий процесс. Один радиолог в среднем тратит 10–15 минут на описание маммограммы. Для создания датасета из 10 000 снимков потребуется около 2000 часов работы врача. При ставке 3000–5000 рублей в час (в зависимости от региона) только разметка обойдётся в 6–10 миллионов рублей. При этом требуется двойная независимая разметка и разрешение конфликтов третьим экспертом, что удваивает или утраивает стоимость. Кроме того, данные должны быть деперсонализированы, что требует юридического сопровождения и систем защиты персональных данных. В России это регулируется 152-ФЗ, в Европе — GDPR, в США — HIPAA. Каждый регулятор предъявляет свои требования к хранению, передаче и обработке медицинских данных.
Сам процесс обучения модели включает несколько этапов: сбор данных, анонимизация, разметка, обучение, валидация на независимой выборке, клинические испытания, регистрация в качестве медицинского изделия. В США для получения одобрения FDA требуется предоставить результаты проспективного исследования, что может стоить миллионы долларов и занять 2–3 года. В России и СНГ ситуация осложняется отсутствием единых стандартов цифровой медицины, нехваткой качественно размеченных данных и низкой готовностью врачей к работе с ИИ. Тем не менее, несколько проектов (например, «Цельс» и «СберМедИИ») уже проходят пилотные внедрения в поликлиниках Москвы.
Кого затронет и как
Разработчиков: они должны перестать гнаться за точностью и научиться работать с медицинскими метриками (чувствительность, специфичность, AUC, F1). Им придётся учитывать регуляторные требования и стоимость данных. Врачей: ИИ-помощники могут снизить нагрузку, но требуют доверия и понимания ограничений. Врач должен уметь интерпретировать выводы модели и принимать окончательное решение. Пациентов: потенциально — более раннее выявление рака, меньше ложных вызовов. Но есть риск, что модель пропустит опухоль или даст ложное срабатывание, вызывающее ненужные биопсии.
Что будет дальше
Ожидается, что в ближайшие 2–3 года регуляторы (FDA, Минздрав РФ) ужесточат требования к клиническим испытаниям ИИ-систем. Врачи все чаще будут использовать ИИ как второе мнение, но полная автоматизация диагностики в обозримом будущем маловероятна. Ключевым трендом станет федеративное обучение (federated learning), позволяющее обучать модели на данных из разных клиник без передачи самих данных, что снижает юридические риски.
Итог
Точность 99,2% — не повод для радости, если модель не находит ни одной опухоли. Медицинское компьютерное зрение требует принципиально иного подхода: акцента на чувствительность, учета несовершенства разметки, дорогостоящей валидации и строгого регулирования. Пока эти условия не выполнены, ИИ в медицине останется помощником, а не заменой врачу. Следить за темой стоит каждому, кто интересуется будущим здравоохранения: цена ошибки здесь — человеческая жизнь.