DeepPySR: новый фреймворк символьной регрессии для научных открытий

Символьная регрессия (SR) — это метод машинного обучения, который автоматически находит аналитические уравнения по данным, создавая полностью интерпретируемые модели, так называемые «стеклянные ящики». В отличие от «чёрных ящиков» (например, глубоких нейронных сетей), которые требуют нестабильных ме

DeepPySR: новый фреймворк символьной регрессии для научных открытий

Символьная регрессия (SR) — это метод машинного обучения, который автоматически находит аналитические уравнения по данным, создавая полностью интерпретируемые модели, так называемые «стеклянные ящики». В отличие от «чёрных ящиков» (например, глубоких нейронных сетей), которые требуют нестабильных методов объяснения вроде SHAP или LIME, SR выдаёт прямые формулы, понятные человеку. Это делает SR критически важной для областей, где прозрачность обязательна: клиническая медицина и социальные науки. Однако существующие SR-методы сталкиваются с рядом проблем: многомерные входные данные, выбор формул на фронте Парето и нерегулярности данных (мультиколлинеарность, дисбаланс классов). Новый фреймворк DeepPySR, описанный в недавно опубликованной статье, предлагает решения этих проблем и демонстрирует значительное превосходство над аналогами.

Как работает DeepPySR

DeepPySR использует три ключевых нововведения, которые позволяют ему эффективно справляться с вызовами символьной регрессии. Первое — динамическое сокращение переменных (dynamic variable-pruning). Этот механизм автоматически удаляет нерелевантные признаки в процессе поиска, что особенно важно при работе с многомерными данными, где многие переменные могут быть шумом. Второе — экспоненциальный критерий выбора Парето (exponential Pareto selection). Он устраняет классический компромисс между точностью и сложностью модели, позволяя находить более простые и одновременно точные формулы. Третье — многослойная архитектура для иерархической символьной композиции. Это позволяет строить сложные выражения из более простых компонентов, что повышает выразительность моделей.

Какие проблемы решает DeepPySR?

Одна из главных проблем символьной регрессии — нестабильность результатов при наличии мультиколлинеарности или дисбаланса классов. DeepPySR благодаря динамическому сокращению переменных и экспоненциальному критерию Парето демонстрирует устойчивость к таким нерегулярностям. Кроме того, фреймворк автоматически выбирает оптимальную сложность формулы, избавляя пользователя от ручного подбора гиперпараметров. Это делает его удобным для исследователей, не являющихся экспертами в машинном обучении.

Результаты бенчмарков

Эффективность DeepPySR была проверена на четырёх физических бенчмарках Фейнмана и семи биомедицинских и социальных наборах данных. Во всех тестах фреймворк превзошёл PySR и другие базовые методы. Например, на наборе данных Body fat коэффициент детерминации R² составил 0,794 против 0,702 у PySR. На Heart disease F1-мера достигла 0,898 против 0,787. На Student performance R² равен 0,964 против 0,948, а на Raine BMI — 0,525 против 0,370. Полученные интерпретируемые формулы соответствуют известным факторам риска в предметных областях, что подтверждает их практическую ценность.

Кому будет полезен DeepPySR?

Фреймворк ориентирован на медицинских исследователей, аналитиков социальных наук, специалистов по data science и разработчиков интерпретируемых моделей машинного обучения. В медицине, например, DeepPySR может помочь выявить факторы риска заболеваний, построив простые и понятные формулы на основе клинических данных. В социальных науках — найти ключевые предикторы успеваемости студентов или других социальных явлений. Для data science это инструмент для создания прозрачных моделей, которые легко объяснить заказчику или регулятору.

Что пока остаётся неизвестным?

Несмотря на впечатляющие результаты, детали реализации и код фреймворка пока не опубликованы. Это означает, что воспроизвести результаты на других датасетах пока невозможно. Кроме того, требуется оценка вычислительной сложности DeepPySR по сравнению с аналогами, особенно на больших объёмах данных. Также интересно, как фреймворк поведёт себя на данных с большим количеством категориальных признаков или временных рядов. Публикация кода и дополнительных бенчмарков позволит сообществу более полно оценить потенциал DeepPySR.

Заключение

DeepPySR представляет собой значительный шаг вперёд в области символьной регрессии. Его инновационные механизмы — динамическое сокращение переменных, экспоненциальный критерий Парето и многослойная архитектура — позволяют получать более точные и интерпретируемые модели по сравнению с существующими методами. Особенно ценно, что фреймворк справляется с нерегулярностями данных, которые часто встречаются в реальных задачах. Если код будет открыт, DeepPySR может стать стандартным инструментом для исследователей, ценящих прозрачность и объяснимость моделей машинного обучения.