Почему нейросети проигрывают деревьям в кредитном скоринге: эксперимент
Нейросети не превосходят классические деревья решений в задачах кредитного скоринга: эксперимент на реальных данных показал, что все модели — от простого дерева до многослойного перцептрона — дают практически одинаковую точность. Это объясняется ограниченным объёмом информации в табличных данных, гд

Нейросети не превосходят классические деревья решений в задачах кредитного скоринга: эксперимент на реальных данных показал, что все модели — от простого дерева до многослойного перцептрона — дают практически одинаковую точность. Это объясняется ограниченным объёмом информации в табличных данных, где сложные зависимости отсутствуют. В статье разберём, почему так происходит, какие выводы стоит сделать разработчикам и бизнесу, и что ждёт скоринг в будущем.
Эксперимент: одинокое дерево, целый лес и разочарование в нейросетях
В качестве датасета были взяты данные кредитного скоринга с платформы Kaggle — соревнование GiveMeSomeCredit. Это классическая задача бинарной классификации: предсказать, вернёт ли заёмщик кредит. Датасет содержит 150 тысяч записей с такими признаками, как сумма долга, количество просрочек, возраст, доход и другие. Автор эксперимента обучил четыре модели: решающее дерево, случайный лес, градиентный бустинг и многослойный перцептрон (нейросеть). Для каждой модели проводилась кросс-валидация, оценивалась метрика ROC-AUC — стандарт для задач скоринга.
Результат оказался неожиданным для тех, кто привык считать нейросети универсальным решением. Все четыре модели показали практически одинаковую производительность: ROC-AUC в районе 0,85–0,86. Разница между лучшей и худшей моделью составила менее 0,01. Графики зависимости ROC-AUC от объёма выборки показали, что кривые обучения всех моделей сходятся к одному и тому же пределу. Это означает, что данные содержат ограниченное количество сигнала, и никакая архитектура не способна «вытянуть» больше.
Предыстория и контекст
Кредитный скоринг — одна из старейших задач прикладного машинного обучения. Банки и микрофинансовые организации используют скоринговые модели десятилетиями. Традиционно лидировали логистическая регрессия и деревья решений из-за их интерпретируемости. С появлением более мощных методов — случайного леса и бустинга — точность немного выросла, но принципиального прорыва не произошло. Нейросети, которые совершили революцию в компьютерном зрении и NLP, в табличных данных часто оказываются не лучше градиентного бустинга. Это известный факт в сообществе Kaggle, но для широкой аудитории он может быть неочевиден.
Почему так происходит? Табличные данные, как правило, разрежены, содержат пропуски и категориальные признаки. Нейросети требуют больших объёмов данных и тщательной настройки гиперпараметров. Деревья решений и ансамбли на их основе, напротив, хорошо работают «из коробки», устойчивы к выбросам и не требуют нормализации признаков. В задаче скоринга также важен интерпретируемость: банковские регуляторы требуют объяснения каждого отказа. Нейросети — «чёрный ящик», тогда как дерево решений можно визуализировать и понять.
Почему нейросети не показали преимущества?
Главная причина — ограниченность информации в данных. Признаки в кредитном скоринге, такие как доход, возраст и кредитная история, имеют слабую нелинейность. Нейросети способны моделировать сложные зависимости, но если их нет, то избыточная сложность модели только вредит: растёт риск переобучения и падает обобщающая способность. В эксперименте использовался простой многослойный перцептрон с двумя скрытыми слоями. Возможно, более глубокая архитектура или регуляризация могли бы дать небольшой прирост, но вряд ли существенный. Автор отмечает, что при увеличении объёма выборки все модели выходят на плато, что говорит о достижении информационного предела датасета.
Технические детали эксперимента
Датасет GiveMeSomeCredit содержит 11 признаков, включая: RevolvingUtilizationOfUnsecuredLines (отношение использованного кредита к лимиту), age (возраст), NumberOfTime30-59DaysPastDueNotWorse (количество просрочек 30–59 дней), DebtRatio (отношение долга к доходу), MonthlyIncome (ежемесячный доход), NumberOfOpenCreditLinesAndLoans (количество открытых кредитных линий), NumberOfTimes90DaysLate (количество просрочек более 90 дней), NumberRealEstateLoansOrLines (количество кредитов под недвижимость), NumberOfTime60-89DaysPastDueNotWorse (количество просрочек 60–89 дней), NumberOfDependents (количество иждивенцев). Целевая переменная — SeriousDlqin2yrs (факт серьёзной просрочки в течение двух лет).
Модели обучались с использованием кросс-валидации на 5 фолдах. Для решающего дерева глубина ограничивалась 10 уровнями. Случайный лес состоял из 100 деревьев. Бустинг использовал 100 итераций с шагом 0,1. Нейросеть имела два скрытых слоя по 64 и 32 нейрона с ReLU-активацией, выходной слой — сигмоида. Обучение проводилось с оптимизатором Adam и ранней остановкой. ROC-AUC для всех моделей на тестовой выборке составил: дерево — 0,851, случайный лес — 0,858, бустинг — 0,861, нейросеть — 0,854. Разница статистически незначима.
Кого затронет и как
Результаты эксперимента полезны для специалистов по Data Science, работающих в банковской сфере и финтехе. Они подтверждают, что не стоит бездумно внедрять нейросети в скоринговые модели: выигрыша в точности нет, а затраты на вычислительные ресурсы и интерпретируемость растут. Для бизнеса это означает, что инвестиции в сложные модели могут не окупиться. В России и СНГ многие банки по-прежнему используют логистическую регрессию или деревья решений из-за требований регуляторов. Эксперимент показывает, что эти модели не так уж уступают современным. Разработчикам стоит сосредоточиться на улучшении качества данных, а не на усложнении алгоритмов.
Что будет дальше
Вероятно, в ближайшее время в кредитном скоринге продолжат доминировать градиентный бустинг и случайный лес. Однако появляются гибридные подходы, например, использование нейросетей для извлечения признаков из текстовых данных (история обращений) или изображений (сканы документов). Но для классических табличных признаков бустинг останется золотым стандартом. Автор эксперимента планирует проверить, изменится ли ситуация на более крупных датасетах (миллионы записей) или при использовании трансформеров для табличных данных (TabNet, FT-Transformer). Пока же вывод однозначен: нейросети не панацея.
Итог
Эксперимент на данных кредитного скоринга показал, что нейросети не превосходят классические ансамблевые методы. Если вы решаете задачу скоринга, не спешите внедрять глубокое обучение: начните с дерева решений или бустинга. Главный ресурс в таких задачах — качественные данные, а не сложность модели. Следите за новыми исследованиями в области табличных данных, но пока что деревья остаются королями кредитного скоринга.