MedPMC: автоматизированный фреймворк для создания медицинских мультимодальных данных из PMC

Исследователи представили MedPMC — автоматизированный фреймворк, который преобразует лицензионно-чистые медицинские статьи из PubMed Central (PMC) в высококачественные мультимодальные данные. Эта система уже обработала 6,1 миллиона статей и создала 11 миллионов пар «изображение-текст», открывая новы

MedPMC: автоматизированный фреймворк для создания медицинских мультимодальных данных из PMC

Исследователи представили MedPMC — автоматизированный фреймворк, который преобразует лицензионно-чистые медицинские статьи из PubMed Central (PMC) в высококачественные мультимодальные данные. Эта система уже обработала 6,1 миллиона статей и создала 11 миллионов пар «изображение-текст», открывая новые возможности для обучения мультимодальных ИИ-моделей в медицине.

Почему нехватка качественных данных тормозит медицинский ИИ

Медицина по своей природе мультимодальна: врачи одновременно анализируют снимки, результаты анализов и текстовые описания. Однако развитие мультимодальных ИИ-моделей долгое время сдерживалось отсутствием больших, качественных и клинически релевантных наборов данных. Существующие источники, такие как PMC, содержат огромное количество статей, но извлечение из них структурированных пар «изображение-текст» требует ручного труда или сложных пайплайнов. MedPMC решает эту проблему, предоставляя автоматически обновляемый источник данных высокого качества, который можно использовать для обучения и оценки моделей.

Как работает MedPMC: этапы обработки и ключевые метрики

Фреймворк состоит из нескольких последовательных этапов, каждый из которых оптимизирован для высокой точности. На этапе начального скрининга система отбирает релевантные медицинские статьи с показателем F1=93,2. Затем обнаруживает многопанельные рисунки (F1=96,5) и разделяет их на отдельные фигуры (mAP=89,8). Выравнивание подписей к изображениям достигает F1=81,4 и ROUGE-L=85,3, а классификация медицинских изображений — F1=96,5. Ручная проверка пятью аннотаторами, трое из которых имеют медицинское образование, показала, что 95,3% изображений MedPMC релевантны медицине. Для сравнения, в предыдущих наборах данных на основе PMC этот показатель составлял всего 19,7%.

Какие улучшения показала модель CLIP после обучения на MedPMC?

Модель CLIP, обученная на MedPMC, продемонстрировала значительный прирост производительности. При zero-shot классификации средний AUC улучшился на 7,1 процентного пункта по сравнению с лучшим аналогом на биомедицинских данных, при этом использовалось менее половины пар «изображение-текст». В составе мультимодальной большой языковой модели MedPMC повысил точность ответов на медицинские вопросы на 1,9 и 16,9 процентных пункта на двух бенчмарках. На практическом примере с 10 524 дерматологическими снимками из Yale New Haven Health System улучшил Recall@5 при поиске по морфологии на 11,7 процентных пункта.

Кто выиграет от внедрения MedPMC

Разработчики медицинских ИИ-систем получат доступ к постоянно обновляемому источнику качественных данных, что ускорит создание новых моделей. Исследователи в области мультимодального обучения смогут экспериментировать с более репрезентативными наборами данных. Клиницисты, использующие ИИ-диагностику, увидят повышение точности алгоритмов, особенно в дерматологии и радиологии. Организации здравоохранения, внедряющие ИИ, смогут быстрее адаптировать технологии под свои нужды.

Какие вопросы остаются открытыми

Несмотря на впечатляющие результаты, остаются нерешенные проблемы. Долгосрочная стабильность обновлений фреймворка пока не подтверждена: сможет ли MedPMC автоматически обрабатывать новые статьи по мере их поступления? Возможны ограничения применимости к узким медицинским специальностям, где формат данных может отличаться. Кроме того, влияние на реальные клинические исходы требует дополнительных исследований — пока улучшения показаны только на бенчмарках, а не в клинической практике.

Заключение

MedPMC представляет собой значительный шаг вперед в создании медицинских мультимодальных данных. Автоматизация процесса позволяет получать большие объемы высококачественных пар «изображение-текст», что напрямую улучшает производительность ИИ-моделей. Однако для полного раскрытия потенциала необходимо решить вопросы масштабирования и клинической валидации. В ближайшие годы такие фреймворки могут стать стандартом для обучения медицинского ИИ.