Почему конформное прогнозирование опасно для скрининга лекарств на несбалансированных данных
Конформное прогнозирование, популярный метод оценки неопределенности в машинном обучении, может давать ложную уверенность при работе с несбалансированными наборами данных, особенно в скрининге лекарств. Исследователи из arXiv обнаружили, что стандартное маргинальное конформное прогнозирование систем

Конформное прогнозирование, популярный метод оценки неопределенности в машинном обучении, может давать ложную уверенность при работе с несбалансированными наборами данных, особенно в скрининге лекарств. Исследователи из arXiv обнаружили, что стандартное маргинальное конформное прогнозирование систематически занижает покрытие для редких, но критически важных классов, таких как токсичные соединения. Это ставит под угрозу надежность виртуального скрининга и требует пересмотра подходов к калибровке моделей.
Проблема стандартного конформного прогнозирования
Конформное прогнозирование гарантирует, что предсказательные наборы содержат истинную метку с вероятностью не менее 1 - alpha, где alpha — уровень значимости. Однако эта гарантия выполняется в среднем по всем классам, что на несбалансированных данных приводит к перекосу. Редкий класс, который может представлять собой токсичные или активные соединения, оказывается плохо покрыт, тогда как мажоритарный класс получает избыточное покрытие.
В экспериментах на четырех датасетах, связанных со скринингом лекарств, глобальное покрытие достигало 90%, но покрытие редкого класса падало до 64.8% для проницаемости гематоэнцефалического барьера и до 4.2% для клинической токсичности. Это означает, что для редкого класса модель может пропустить до 95.8% истинных меток, что недопустимо при поиске опасных веществ.
Почему это происходит: математическая причина
Исследователи выявили тождество, объясняющее этот эффект: дефицит покрытия редкого класса равен избытку покрытия мажоритарного класса, умноженному на коэффициент дисбаланса. Если мажоритарный класс составляет 90% данных, а редкий — 10%, то избыток покрытия в 5% для мажоритарного класса приводит к дефициту в 45% для редкого. Таким образом, даже небольшое смещение в сторону частого класса катастрофически сказывается на редком.
Этот эффект воспроизводится на разных моделях: случайном лесе, графовой нейронной сети и языковой модели химии (p < 0.001). Стандартное конформное прогнозирование не учитывает дисбаланс, что делает его опасным для задач, где редкие классы критичны.
Решение: класс-условное конформное прогнозирование
Класс-условное, или Mondrian, конформное прогнозирование восстанавливает покрытие редкого класса до целевого уровня. В этом подходе калибровочные множества и предсказательные наборы строятся отдельно для каждого класса, что гарантирует равномерное покрытие. Эксперименты показали, что класс-условный подход достигает целевого покрытия для редкого класса с небольшим увеличением размера предсказательных наборов.
Например, для датасета клинической токсичности покрытие редкого класса выросло с 4.2% до 90% при alpha = 0.1, при этом средний размер предсказательного набора увеличился незначительно. Это делает метод практичным для применения в скрининге лекарств, где баланс между покрытием и эффективностью важен.
Кого это затронет?
Разработчиков моделей для виртуального скрининга, исследователей в хемоинформатике и машинном обучении, а также фармацевтические компании, использующие конформное прогнозирование для оценки рисков. Если вы применяете стандартное маргинальное конформное прогнозирование к несбалансированным данным, ваши результаты могут вводить в заблуждение. Переход на класс-условный подход может повысить надежность.
Что пока неизвестно?
Неизвестно, как класс-условный подход влияет на вычислительную сложность и масштабируемость для очень больших библиотек соединений (миллионы молекул). Также не изучена устойчивость к другим типам дисбаланса, например, к множественным редким классам или неравномерному распределению внутри классов. Будущие исследования должны прояснить эти вопросы.
Какие альтернативы конформному прогнозированию существуют для несбалансированных данных?
Помимо класс-условного конформного прогнозирования, существуют и другие методы: взвешенное конформное прогнозирование, где калибровочные точки взвешиваются обратно пропорционально частоте класса, и методы на основе байесовской неопределенности. Однако класс-условный подход проще в реализации и не требует настройки весов. Также можно использовать методы ресемплинга (SMOTE) перед калибровкой, но они могут исказить распределение. Выбор метода зависит от конкретной задачи и доступных данных.
Заключение
Стандартное конформное прогнозирование опасно для скрининга лекарств на несбалансированных данных, так как оно систематически игнорирует редкие классы. Класс-условное конформное прогнозирование решает эту проблему, обеспечивая равномерное покрытие без значительного увеличения размера предсказательных наборов. Исследователям и практикам рекомендуется перейти на этот метод для повышения надежности моделей в фармацевтике.