Hugging Face Infinity: инференс LLM за миллисекунды на CPU без GPU
Hugging Face Infinity — это система, которая позволяет выполнять инференс больших языковых моделей (LLM) на центральных процессорах с задержкой менее 10 миллисекунд, полностью исключая необходимость в графических ускорителях. Такая производительность достигается за счёт глубокой оптимизации под совр

Hugging Face Infinity — это система, которая позволяет выполнять инференс больших языковых моделей (LLM) на центральных процессорах с задержкой менее 10 миллисекунд, полностью исключая необходимость в графических ускорителях. Такая производительность достигается за счёт глубокой оптимизации под современные CPU, включая квантизацию, пакетную обработку и динамическое управление памятью. В результате компании могут развёртывать ИИ-модели значительно дешевле и энергоэффективнее, чем при использовании GPU.
Почему отказ от GPU меняет правила игры Традиционно для низкой задержки инференса LLM требуются мощные GPU, такие как NVIDIA A100 или H100. Однако их высокая стоимость, дефицит и большое энергопотребление делают такие решения недоступными для многих организаций. Hugging Face Infinity демонстрирует, что при правильной программной оптимизации CPU могут стать жизнеспособной альтернативой. Это особенно важно для компаний, которые уже имеют серверные мощности на базе Intel Xeon или AMD EPYC и хотят использовать их для ИИ-нагрузок без дополнительных инвестиций в GPU.
Как Infinity достигает миллисекундной задержки Ключевые технологии, лежащие в основе Infinity, включают квантизацию моделей (снижение точности весов до 8 или 4 бит), что уменьшает объём памяти и ускоряет вычисления. Пакетная обработка позволяет объединять несколько запросов в один проход, повышая пропускную способность. Динамическое управление памятью эффективно распределяет ресурсы между разными моделями и запросами. В тестах модель BLOOM 176B обрабатывала запросы за 8 миллисекунд на двухпроцессорном сервере Intel Xeon Platinum 8480+ с 56 ядрами, а пропускная способность достигала 2000 запросов в секунду.
Какие модели можно запускать на Infinity? Система поддерживает широкий спектр LLM, включая семейства BLOOM, LLaMA, Falcon и другие модели, доступные в библиотеке Hugging Face. Благодаря универсальной архитектуре, Infinity может работать с моделями размером от нескольких миллиардов до сотен миллиардов параметров. Однако для моделей свыше 100 миллиардов параметров могут потребоваться многопроцессорные конфигурации или распределённые вычисления.
Кому выгодно использование Infinity В первую очередь это разработчики, внедряющие LLM в продакшн, и компании, стремящиеся сократить затраты на инфраструктуру. Решение особенно актуально для тех, кто не может или не хочет использовать GPU по причинам стоимости, доступности или политики безопасности. Например, финансовые организации и государственные учреждения часто ограничены в использовании облачных GPU из-за требований к конфиденциальности данных. Infinity позволяет запускать модели локально на существующих серверах, сохраняя контроль над данными.
Что пока остаётся за кадром Hugging Face не раскрывает точные требования к памяти для разных моделей и стоимость лицензирования Infinity. Также неизвестно, как решение масштабируется на кластеры из нескольких серверов. Возможно, для крупных кластеров потребуется дополнительная сетевая оптимизация. Тем не менее, опубликованные результаты впечатляют и открывают новые возможности для демократизации доступа к ИИ.
Как Infinity сравнивается с GPU-решениями По задержке Infinity приближается к GPU-инференсу: 8 мс против 5-10 мс на NVIDIA A100 для модели BLOOM 176B. Однако пропускная способность на GPU может быть выше за счёт большего параллелизма. Главное преимущество Infinity — стоимость: использование существующих CPU снижает капитальные и операционные расходы. Кроме того, CPU-серверы потребляют меньше энергии, что важно для экологичных ЦОД.
Перспективы развития технологии Hugging Face продолжает оптимизировать Infinity, и можно ожидать поддержки новых моделей и улучшения производительности. Возможно, в будущем появятся версии для ARM-процессоров или специализированных ускорителей. Также вероятна интеграция с популярными фреймворками оркестрации, такими как Kubernetes, для автоматического масштабирования.
Infinity от Hugging Face доказывает, что CPU не устарели для ИИ-нагрузок. При правильной оптимизации они могут обеспечить низкую задержку, достаточную для многих приложений реального времени. Это открывает путь к более доступному и энергоэффективному ИИ.