Intel 5-го поколения Xeon на GCP: прорыв в скорости языковых моделей
Новое исследование от Intel и Google Cloud показало, что 5-е поколение Xeon на платформе GCP достигает впечатляющей производительности при запуске больших языковых моделей. Результаты бенчмарков демонстрируют значительное ускорение инференса, что делает CPU-решения конкурентоспособными с GPU для ряда задач.

Intel и Google Cloud опубликовали результаты совместного бенчмаркинга производительности больших языковых моделей (LLM) на серверах с процессорами Intel Xeon 5-го поколения, доступных в облаке Google Cloud Platform (GCP). Исследование показывает, что современные CPU способны обеспечить высокую скорость инференса для моделей типа Llama 2 и Mistral, что раздвигает границы применения центральных процессоров в задачах искусственного интеллекта. Это важный шаг для компаний, которые ищут экономичные альтернативы GPU для развертывания ИИ-нагрузок.
Intel 5-го поколения Xeon на GCP: что показал бенчмарк
В ходе тестирования использовались виртуальные машины GCP с новейшими процессорами Intel Xeon Scalable 5-го поколения (кодовое название Emerald Rapids). Специалисты Intel и Google Cloud запускали популярные открытые LLM, включая Llama 2 7B и 13B, а также Mistral 7B, и замеряли ключевые метрики: время до первого токена (TTFT), скорость генерации токенов (токенов в секунду) и пропускную способность. Результаты показали, что на одном сокете Xeon 5-го поколения можно достичь скорости генерации до 22 токенов в секунду для модели Llama 2 7B с использованием библиотеки Intel Extension for PyTorch и техники низкоточной квантизации INT8. Для 13B-модели скорость составила около 12 токенов в секунду. Эти цифры сопоставимы с производительностью бюджетных GPU, таких как NVIDIA T4, но при этом CPU-решения выигрывают в цене и доступности.
Предыстория и контекст
Традиционно инференс больших языковых моделей считался прерогативой GPU, которые обеспечивают высокий параллелизм и пропускную способность памяти. Однако рост стоимости GPU и их дефицит заставили индустрию искать альтернативы. Intel активно развивает программный стек для оптимизации ИИ-нагрузок на CPU: библиотеки oneAPI, Intel Extension for PyTorch (IPEX), а также инструменты квантизации и сжатия моделей. Пятое поколение Xeon принесло улучшения в архитектуре: увеличенный кэш, поддержку новых инструкций AMX (Advanced Matrix Extensions) и более высокие тактовые частоты. В сочетании с оптимизациями GCP, такими как выбор правильного типа виртуальной машины и настройка сети, эти процессоры становятся реальной альтернативой для инференса LLM.
Как это работает?
Ключ к высокой производительности — использование техники квантизации, при которой веса модели переводятся из 16-битного формата с плавающей точкой в 8-битный целочисленный. Это сокращает требования к памяти и ускоряет вычисления за счет поддержки INT8 в аппаратных инструкциях Xeon. Дополнительно применяется техника фьюжн операций, когда несколько слоев нейросети объединяются для уменьшения накладных расходов на передачу данных. Intel также использует библиотеку Neural Compressor для автоматической оптимизации модели под конкретное аппаратное обеспечение.
Технические подробности: цифры и сравнения
В бенчмарке использовались виртуальные машины GCP типа c3-standard-88 с 88 vCPU и 176 ГБ памяти, работающие на базе двух процессоров Xeon Platinum 8592+ (56 ядер каждый). Для сравнения также тестировались предыдущие поколения Xeon (4-го поколения Sapphire Rapids) и конкурирующие решения на базе ARM, например, Ampere Altra. Результаты показали, что 5-е поколение Xeon превосходит предыдущее на 30–40% по скорости генерации токенов и на 50% по пропускной способности при работе с LLM. По сравнению с ARM-процессорами, Intel обеспечивает в 1,5–2 раза более высокую производительность благодаря поддержке AMX. При этом стоимость владения CPU-решением для инференса может быть в 2–3 раза ниже, чем у GPU-инстансов, особенно при умеренной нагрузке.
Кого затронет и как
Новые возможности важны для разработчиков и компаний, которые разворачивают ИИ-сервисы в облаке. Стартапы и средний бизнес часто не могут позволить себе выделенные GPU-кластеры, поэтому использование CPU-инстансов GCP с оптимизированными библиотеками Intel позволяет запускать LLM с приемлемой производительностью и значительно экономить бюджет. Например, чат-боты, системы анализа текста, генеративные приложения могут работать на CPU без потери качества. Для российских компаний, которые сталкиваются с ограничениями на импорт GPU, это особенно актуально: облачные CPU-решения доступны и могут быть арендованы в дата-центрах, не попадающих под санкционные ограничения. Крупные корпорации также могут использовать эти результаты для оптимизации своих ИИ-инфраструктур, снижая зависимость от дефицитных GPU.
Что будет дальше
Intel и Google Cloud планируют продолжать совместную работу по оптимизации ИИ-нагрузок. Ожидается, что следующие поколения Xeon, включая Granite Rapids и Sierra Forest, предложат еще более высокую производительность за счет увеличения числа ядер и поддержки новых инструкций. Также активно развивается экосистема программного обеспечения: выходят обновления IPEX, Hugging Face Optimum Intel, которые упрощают развертывание моделей на CPU. В ближайшие годы мы, вероятно, увидим рост числа приложений, использующих CPU-инференс, особенно в сегменте средних и небольших моделей. Однако для самых больших LLM, таких как GPT-4, GPU по-прежнему остаются необходимыми из-за требований к памяти и вычислительной мощности.
Итог
Исследование Intel и Google Cloud убедительно демонстрирует, что 5-е поколение Xeon на GCP способно эффективно выполнять инференс больших языковых моделей, обеспечивая высокую скорость и экономичность. Это открывает новые возможности для бизнеса и разработчиков, позволяя использовать ИИ без значительных затрат на GPU. Следите за развитием этой области: оптимизация CPU-инференса продолжит улучшаться, и вскоре мы можем увидеть еще более впечатляющие результаты.