MESH-FL: энтропийное сжатие тензоров для федеративного обучения на Raspberry Pi

Фреймворк MESH-FL решает ключевую проблему федеративного обучения на периферийных устройствах — неэффективное сжатие обновлений модели. В отличие от традиционных методов, применяющих единую политику ко всем слоям, MESH-FL динамически распределяет степень сжатия на основе спектральной энтропии данных

MESH-FL: энтропийное сжатие тензоров для федеративного обучения на Raspberry Pi

Фреймворк MESH-FL решает ключевую проблему федеративного обучения на периферийных устройствах — неэффективное сжатие обновлений модели. В отличие от традиционных методов, применяющих единую политику ко всем слоям, MESH-FL динамически распределяет степень сжатия на основе спектральной энтропии данных. Это позволяет достичь сжатия до 56,8 раз и сократить объём передаваемых данных до 66 раз, при этом точность модели даже превышает показатели несжатого FedAvg на 2,01%. Разработка особенно актуальна для гетерогенных кластеров, где устройства имеют разную вычислительную мощность.

Как работает MESH-FL

Энтропийно-управляемое матричное произведение состояний MESH-FL использует матричное произведение состояний (MPS) — технику тензорного разложения, которая представляет веса модели в компактной форме. Ключевое новшество — адаптивное выделение рангов MPS для каждого слоя, модальности и устройства. Для этого фреймворк оценивает спектральную энтропию каждого слоя через усечённое сингулярное разложение (SVD). Чем выше энтропия, тем больше информации содержит слой, и тем выше ранг требуется для его точной реконструкции.

Динамическое распределение бюджета В рамках заданного бюджета полезной нагрузки MESH-FL распределяет ранги между слоями таким образом, чтобы минимизировать потерю информации. Это особенно важно для гетерогенных сред, где устройства имеют разные вычислительные возможности и типы данных (изображения, текст, аудио). Фреймворк автоматически учитывает модальность: например, для изображений с высокой спектральной энтропией выделяется больше ресурсов, чем для текста с низкой энтропией.

Теоретическое обоснование Исследователи доказали, что более высокая спектральная энтропия требует более высокого ранга реконструкции для сохранения точности. Это позволяет MESH-FL избежать как избыточного сжатия (потеря важной информации), так и недостаточного (неэффективное использование ресурсов). Теоретические результаты подтверждены экспериментами на кластере из 15 Raspberry Pi 4/5.

Почему это важно для федеративного обучения

Проблема гетерогенности Современные схемы сжатия в FL часто игнорируют различия между устройствами и данными. В результате мощные клиенты тратят ресурсы на избыточные вычисления, а слабые — не могут обработать обновления из-за ограничений памяти или процессора. MESH-FL решает эту проблему, адаптируя сжатие под каждое устройство в реальном времени.

Снижение нагрузки на сеть Федеративное обучение требует многократной передачи обновлений между сервером и клиентами. MESH-FL сокращает объём передаваемых данных до 66 раз по сравнению с несжатым FedAvg, что критически важно для мобильных сетей с ограниченной пропускной способностью. Например, при обучении модели на 15 Raspberry Pi общий трафик уменьшается с нескольких гигабайт до десятков мегабайт.

Повышение точности Неожиданный результат: сжатие с помощью MESH-FL не только не ухудшает точность, но и повышает её на 2,01% по сравнению с FedAvg. Это объясняется тем, что энтропийно-управляемое сжатие действует как регуляризатор, подавляя шумовые компоненты в обновлениях.

Как MESH-FL сравнивается с другими методами

Преимущества перед QSGD и Top-K В отличие от методов квантования (QSGD) или разрежения (Top-K), MESH-FL не требует ручной настройки параметров для каждого слоя. Он автоматически определяет оптимальную степень сжатия на основе энтропии. Кроме того, MPS-разложение позволяет достичь более высоких коэффициентов сжатия без значительной потери точности.

Экспериментальные результаты На наборе данных CIFAR-10 с моделью ResNet-18 MESH-FL показал сжатие 56,8× при точности 93,4% (против 91,4% у FedAvg). На более сложном наборе данных Tiny ImageNet с моделью MobileNetV2 сжатие составило 42,3×, а точность — 58,7% (против 56,2%). Во всех экспериментах MESH-FL превзошёл конкурентов по скорости сходимости и объёму переданных данных.

Какие вопросы остаются открытыми

Производительность на крупных моделях Эксперименты проводились на моделях среднего размера (ResNet-18, MobileNetV2). Неясно, как MESH-FL поведёт себя на трансформерах или моделях с миллиардами параметров. Теоретически метод масштабируется, но требуется дополнительная проверка.

Динамическое изменение состава клиентов В реальных сценариях устройства могут подключаться и отключаться в процессе обучения. MESH-FL пока не тестировался в таких условиях. Возможно, потребуется адаптация алгоритма для работы с непостоянным пулом клиентов.

Реализация на мобильных SoC Хотя эксперименты проводились на Raspberry Pi, которые имеют ARM-процессоры, детали реализации на реальных мобильных SoC (например, Snapdragon или Apple A-серии) не раскрыты. Возможны проблемы с энергопотреблением и совместимостью с аппаратными ускорителями.

Кому будет полезен MESH-FL

Разработчикам FL-систем MESH-FL предоставляет готовый фреймворк для эффективного сжатия обновлений на гетерогенных устройствах. Он может быть интегрирован в существующие FL-платформы, такие как TensorFlow Federated или PyTorch FL.

Исследователям сжатия моделей Метод открывает новое направление — энтропийно-управляемое тензорное разложение. Возможно, его можно применить не только в FL, но и в других областях, где требуется компрессия данных.

Инженерам периферийных устройств Для развёртывания FL на Raspberry Pi, мобильных телефонах или IoT-устройствах MESH-FL позволяет существенно снизить требования к памяти и пропускной способности, делая обучение на границе сети более доступным.