Почему MoE-модели проигрывают плотным на потребительском и периферийном оборудовании
Исследователи провели бенчмаркинг MoE-модели OLMoE-1B-7B против плотных аналогов на ноутбуке Apple M2 Pro и Jetson Orin Nano. Результаты показали, что теоретическое преимущество MoE по FLOP не реализуется на практике: на M2 Pro OLMoE уступил Llama-3.2-1B на 10%, а на Jetson — на 31%, потребляя в 2,1

Исследователи провели бенчмаркинг MoE-модели OLMoE-1B-7B против плотных аналогов на ноутбуке Apple M2 Pro и Jetson Orin Nano. Результаты показали, что теоретическое преимущество MoE по FLOP не реализуется на практике: на M2 Pro OLMoE уступил Llama-3.2-1B на ~10%, а на Jetson — на ~31%, потребляя в 2,1 раза больше энергии на токен. Это ставит под сомнение эффективность MoE для edge-устройств, где узким местом становится пропускная способность памяти, а не вычислительная мощность.
Ограничения MoE-моделей на практике
MoE-модели активируют лишь часть параметров, что теоретически должно снижать вычислительную нагрузку. Однако на периферийных устройствах с ограниченной памятью полный вес модели загружается целиком, и пропускная способность памяти становится главным узким местом. В исследовании OLMoE-1B-7B требовал 8 ГБ памяти, что превышало возможности Jetson Orin Nano, и это привело к падению производительности.
Почему пропускная способность памяти важнее FLOP?
На потребительском и периферийном оборудовании скорость доступа к памяти часто ниже, чем скорость вычислений. MoE-модели требуют загрузки всех экспертов, даже если активируется только один. Это увеличивает объём передаваемых данных и время ожидания. В результате выигрыш от разреженности нивелируется задержками памяти.
Результаты бенчмаркинга OLMoE-1B-7B
Исследователи использовали llama.cpp с модификациями для профилирования. На M2 Pro OLMoE показал на 10% меньшую скорость генерации токенов по сравнению с Llama-3.2-1B. На Jetson Orin Nano разрыв достиг 31%, а энергопотребление выросло в 2,1 раза. Маршрутизация занимала менее 9% времени MoE-блока, что исключает её как основной источник задержек.
Влияние диспетчеризации экспертов и KV-кеша
Диспетчеризация экспертов требует дополнительных операций копирования данных, что увеличивает нагрузку на память. KV-кеш также занимает значительный объём, особенно при длинных контекстах. В совокупности эти факторы приводят к тому, что MoE-модели не реализуют свой потенциал на ограниченном оборудовании.
Кого затронут результаты исследования
Разработчиков edge AI, инженеров по оптимизации инференса LLM и исследователей архитектур. Производители оборудования для AI-нагрузок также должны учитывать, что разреженные модели могут не дать ожидаемого прироста на их устройствах.
Что пока не изучено
Исследование ограничено одной моделью и двумя устройствами. Неясно, как поведут себя более крупные MoE-модели или модели с другим соотношением активных/общих параметров. Также не изучалось влияние квантизации или других методов оптимизации.
Выводы для практического применения
При выборе модели для потребительского или периферийного оборудования необходимо учитывать не только количество активных параметров, но и полный объём памяти. Плотные модели меньшего размера могут оказаться эффективнее, несмотря на большее число FLOP. Разработчикам стоит тестировать модели на целевых устройствах, а не полагаться только на теоретические преимущества.