ProsMAE: мульти-источник MAE для классификации ISUP в гистопатологии

В гистопатологии анализ целых срезов тканей (WSI) сталкивается с рядом сложностей: гигапиксельные изображения, вариации окрашивания, различия сканеров и артефакты. Эти факторы затрудняют обучение моделей, способных обобщаться на новые данные. Новый подход ProsMAE, описанный в статье arXiv:2607.08162

ProsMAE: мульти-источник MAE для классификации ISUP в гистопатологии

В гистопатологии анализ целых срезов тканей (WSI) сталкивается с рядом сложностей: гигапиксельные изображения, вариации окрашивания, различия сканеров и артефакты. Эти факторы затрудняют обучение моделей, способных обобщаться на новые данные. Новый подход ProsMAE, описанный в статье arXiv:2607.08162, предлагает решение через предобучение Masked Autoencoder (MAE) на данных из нескольких источников. Модель обучается на срезах из наборов PANDA (рак простаты), CAMELYON17 (метастазы рака в лимфоузлах) и BRACS (подтипы рака молочной железы), после чего замороженный энкодер используется для классификации степени ISUP (International Society of Urological Pathology) с помощью линейного классификатора. Результаты показывают, что предобучение на разнородных данных улучшает качество классификации по сравнению со стандартным MAE, обученным только на одном наборе данных.

Как работает ProsMAE

ProsMAE основан на архитектуре Masked Autoencoder (MAE) с энкодером Vision Transformer (ViT). В процессе предобучения модель случайным образом маскирует патчи изображения и учится восстанавливать их по окружающим контекстам. Это позволяет энкодеру захватывать семантические и структурные особенности тканей. В отличие от традиционного MAE, который обучается на одном наборе данных, ProsMAE использует три различных набора: PANDA (срезы рака простаты), CAMELYON17 (лимфатические узлы с метастазами) и BRACS (различные подтипы рака молочной железы). Каждый из этих наборов имеет свои особенности: разное окрашивание, разрешение сканеров, типы тканей. Предобучение на таком разнообразии позволяет модели научиться инвариантным представлениям, устойчивым к вариациям.

Почему мульти-источник предобучения важен для гистопатологии

Гистологические срезы часто страдают от технических артефактов и различий в протоколах окрашивания. Модели, обученные на одном наборе данных, могут переобучаться под его специфику и плохо обобщаться на новые данные. Использование нескольких источников данных помогает модели игнорировать несущественные вариации и фокусироваться на биологически значимых признаках. ProsMAE демонстрирует, что такое предобучение улучшает классификацию ISUP — шкалы, используемой для оценки агрессивности рака простаты. В тестах на разделе PANDA модель превзошла базовый MAE, обученный только на PANDA, по метрике средневзвешенной каппы Козна (QWK).

Какие преимущества дает ProsMAE по сравнению с обычным MAE?

Основное преимущество ProsMAE — улучшенная обобщающая способность. За счет обучения на данных из разных источников энкодер учится более робастным признакам, которые не зависят от конкретного окрашивания или типа сканера. Это особенно важно для клинического применения, где данные могут поступать из разных лабораторий. Кроме того, ProsMAE использует замороженный энкодер с линейным классификатором, что снижает вычислительные затраты на дообучение. В результатах исследования ProsMAE показал более высокий QWK по сравнению с базовым MAE на тестовом разбиении PANDA, что подтверждает эффективность подхода.

Детали эксперимента и результаты

В эксперименте ProsMAE предобучался на всех трех наборах данных: PANDA (около 10 000 срезов), CAMELYON17 (около 1 000 срезов) и BRACS (около 500 срезов). После предобучения энкодер замораживался, и на его выходе обучался линейный классификатор для 6 классов ISUP. Оценка проводилась на тестовом разделе PANDA. Метрика QWK (Quadratic Weighted Kappa) использовалась для измерения согласия между предсказаниями и истинными метками. ProsMAE превзошел базовый MAE, обученный только на PANDA, однако точные значения QWK и статистическая значимость в статье не указаны.

Кого затронет эта технология

ProsMAE представляет интерес для исследователей в области вычислительной патологии и компьютерного зрения, разрабатывающих методы представления гистологических изображений. Разработчики систем автоматизированной диагностики рака могут использовать этот подход для создания более надежных моделей. Врачи-патологи, использующие AI-ассистентов, также выиграют от повышения точности классификации. Однако для внедрения в клиническую практику необходимы дополнительные исследования.

Что пока остается неизвестным

Несмотря на многообещающие результаты, есть несколько ограничений. Во-первых, оценка проводилась только на одном разбиении PANDA, поэтому требуется повторение на множественных разбиениях для подтверждения робастности. Во-вторых, в статье не приведены точные значения QWK и не указана статистическая значимость различий. В-третьих, неизвестен вклад каждого источника данных по отдельности: возможно, улучшение связано только с добавлением определенного набора. Дальнейшие исследования должны включать абляционные эксперименты и тестирование на других задачах.