SOMtime: несправедливость в unsupervised-представлениях без чувствительных данных

Исследователи показали, что даже если исключить чувствительные признаки из обучения, unsupervised-модели могут восстанавливать их как скрытые оси. Метод SOMtime на основе Self-Organizing Maps достигает корреляции до 0.85 с возрастом и доходом, что создаёт риски для fairness в ML-пайплайнах.

SOMtime: несправедливость в unsupervised-представлениях без чувствительных данных

Когда данные обучаются без учителя, принято считать, что они нейтральны к чувствительным признакам, если эти признаки не подавались на вход. Однако новое исследование, опубликованное на arXiv, опровергает это предположение. Метод SOMtime, основанный на Self-Organizing Maps высокой ёмкости, показывает, что возраст и доход могут проявляться как доминирующие скрытые оси даже в полностью unsupervised-эмбеддингах, что ставит под сомнение принцип «справедливость через неосведомлённость».

SOMtime: как метод выявляет скрытые чувствительные признаки

Авторы работы представили SOMtime — метод представления, сохраняющий топологию данных с помощью Self-Organizing Maps. В отличие от линейных методов вроде PCA или нелинейных типа UMAP, SOMtime способен улавливать сложные монотонные зависимости. На двух крупных реальных наборах данных — World Values Survey (пять стран) и Census-Income — метод достиг Spearman-корреляции до 0.85 с такими чувствительными признаками, как возраст и доход, даже когда эти признаки были явно исключены из входных данных.

Для сравнения, PCA и UMAP показали корреляцию ниже 0.23 (единственное исключение — 0.31), а t-SNE и автоэнкодеры — не более 0.34. Это означает, что SOMtime значительно лучше восстанавливает скрытые закономерности, что одновременно является преимуществом для анализа данных, но серьёзным риском для справедливости.

Предыстория и контекст: почему это важно для fairness в машинном обучении

Проблема «справедливости через неосведомлённость» (fairness through unawareness) долгое время считалась разумным подходом: если не использовать чувствительные признаки (раса, пол, возраст) в модели, то она не будет дискриминировать. Однако исследования последних лет показывают, что такие признаки могут просачиваться через косвенные корреляции с другими переменными. Например, почтовый индекс может коррелировать с расой, а история покупок — с доходом.

Новое исследование делает следующий шаг: оно демонстрирует, что даже unsupervised-представления, которые часто используются как вход для последующих задач (кластеризация, визуализация, обучение с подкреплением), могут содержать скрытую информацию о чувствительных признаках. Это особенно опасно, потому что unsupervised-компоненты редко подвергаются аудиту на справедливость, в отличие от supervised-моделей.

Чем SOMtime отличается от других методов?

Self-Organizing Maps — это тип нейронной сети, которая обучается без учителя и создаёт низкоразмерное дискретное представление данных, сохраняя топологию. SOMtime использует модифицированную архитектуру с высокой ёмкостью, что позволяет ей улавливать более сложные нелинейные зависимости, чем стандартные SOM или другие методы вроде UMAP.

В отличие от PCA, который ищет линейные оси максимальной дисперсии, SOMtime может моделировать немонотонные и пороговые эффекты. Это позволяет ей выявлять монотонные упорядочивания, связанные с возрастными группами или уровнями дохода, которые остаются невидимыми для линейных методов.

Технические подробности: как проводился эксперимент

Исследователи обучили SOMtime на данных World Values Survey, охватывающих пять стран, и на Census-Income. Чувствительные признаки (возраст и доход) были исключены из входных данных, но модель всё равно восстановила их порядок в эмбеддингах. Для оценки использовалась Spearman-корреляция между позицией в эмбеддинге и фактическим значением признака.

Кроме того, авторы провели unsupervised-сегментацию эмбеддингов SOMtime и обнаружили, что полученные кластеры демографически смещены: например, один кластер содержал преимущественно молодых людей с низким доходом, другой — пожилых с высоким. Это демонстрирует, что даже без какой-либо supervised-задачи возникают риски дискриминации, если эти кластеры использовать для принятия решений.

Кого затронет и как: последствия для разработчиков и бизнеса

Разработчики ML-систем, которые используют unsupervised-методы для предобработки данных (например, для уменьшения размерности или кластеризации клиентов), должны осознавать, что их пайплайны могут непреднамеренно кодировать чувствительные признаки. Это может привести к дискриминационным решениям в кредитовании, найме, медицинской диагностике и других областях.

Для бизнеса это означает необходимость расширить аудит справедливости на все компоненты пайплайна, включая unsupervised-этапы. Просто удаление чувствительных признаков из входных данных недостаточно — нужно проверять, не восстанавливаются ли они косвенно.

В российском и СНГ-контексте это особенно актуально в связи с развитием систем распознавания лиц и кредитного скоринга, где требования к недискриминации становятся всё строже. Регуляторы могут потребовать от компаний доказывать отсутствие предвзятости не только в финальных моделях, но и в промежуточных представлениях.

Что будет дальше: перспективы исследований и практические шаги

Авторы планируют расширить исследование на другие чувствительные признаки и типы данных. Они также предоставили открытый код на GitHub, что позволяет другим исследователям воспроизвести результаты и проверить свои методы. Ожидается, что это вызовет волну дискуссий о том, как определять справедливость в unsupervised-обучении.

Возможные решения включают разработку методов «слепого» обучения, которые активно удаляют информацию о чувствительных признаках из представлений, или введение регуляризаторов, штрафующих за корреляцию с ними. Однако пока это остаётся открытой проблемой.

Итог

Исследование SOMtime убедительно показывает, что «справедливость через неосведомлённость» не работает на уровне представлений: даже без чувствительных признаков модель может восстанавливать их скрытые оси. Это требует пересмотра подходов к аудиту fairness в ML-пайплайнах и разработки новых методов для обеспечения недискриминации в unsupervised-компонентах. Следить за развитием этой темы важно всем, кто создаёт ответственные AI-системы.