Бенчмарк Llama 2 на Amazon SageMaker: производительность и стоимость моделей 7B, 13B, 70B
Hugging Face провела бенчмарк моделей Llama 2 (7B, 13B, 70B) на Amazon SageMaker, измерив время инференса и стоимость. Результаты опубликованы в блоге Hugging Face. Это исследование помогает разработчикам и компаниям выбирать оптимальную конфигурацию для развертывания Llama 2 в облаке, балансируя ме

Hugging Face провела бенчмарк моделей Llama 2 (7B, 13B, 70B) на Amazon SageMaker, измерив время инференса и стоимость. Результаты опубликованы в блоге Hugging Face. Это исследование помогает разработчикам и компаниям выбирать оптимальную конфигурацию для развертывания Llama 2 в облаке, балансируя между производительностью и затратами. В бенчмарке использовались инстансы GPU, такие как ml.g5.xlarge и ml.p4d.24xlarge, а метрики включали время инференса (latency) для различных длин последовательностей и стоимость за запрос. Для 7B модели latency составила около 0.5 секунды, для 70B — примерно 5 секунд на длинных входах.
Детали бенчмарка Llama 2 на SageMaker
Какие модели тестировались и на каком оборудовании? В бенчмарке участвовали три модели: Llama 2 7B, 13B и 70B. Каждая модель запускалась на Amazon SageMaker с использованием инстансов GPU. Для 7B и 13B моделей применялись инстансы ml.g5.xlarge (один GPU NVIDIA A10G), а для 70B — более мощные ml.p4d.24xlarge (восемь GPU NVIDIA A100). Выбор инстансов соответствовал рекомендациям по минимальным требованиям к памяти для каждой модели.
Какие метрики производительности измерялись? Основными метриками стали время инференса (latency) и стоимость за запрос. Время инференса измерялось для последовательностей разной длины: от коротких (128 токенов) до длинных (2048 токенов). Стоимость рассчитывалась на основе почасовой аренды инстанса и времени выполнения запроса. Дополнительно учитывалась пропускная способность (количество запросов в секунду).
Результаты: производительность и стоимость Для модели 7B на ml.g5.xlarge latency составила 0.5 секунды при длине входа 128 токенов и 1.2 секунды при 2048 токенах. Стоимость за запрос варьировалась от $0.0001 до $0.0003. Модель 13B на том же инстансе показала latency 0.9 секунды для коротких и 2.5 секунды для длинных входов, стоимость — $0.0002–$0.0005. Для 70B на ml.p4d.24xlarge latency достигла 5 секунд на длинных входах, стоимость за запрос составила около $0.01. Пропускная способность для 7B достигла 50 запросов в секунду, для 70B — около 10 запросов в секунду.
Как выбрать оптимальную конфигурацию для Llama 2?
Какие факторы влияют на выбор инстанса? Выбор инстанса зависит от требуемой latency, бюджета и ожидаемой нагрузки. Для приложений реального времени, где важна низкая задержка, лучше подходят 7B или 13B модели на ml.g5.xlarge. Для пакетной обработки или задач, где latency не критична, можно использовать 70B модель на ml.p4d.24xlarge, но с учетом более высокой стоимости. Также важно учитывать длину входных последовательностей: для длинных текстов latency растет линейно.
Как оптимизировать стоимость инференса? Для снижения стоимости можно использовать пакетную обработку запросов (batch inference), что увеличивает пропускную способность и снижает стоимость за запрос. Также стоит рассмотреть использование инстансов с меньшим количеством GPU, если модель умещается в память. Hugging Face рекомендует применять библиотеку Text Generation Inference (TGI) для оптимизации инференса на SageMaker.
Кого затронет этот бенчмарк? Результаты бенчмарка полезны разработчикам, инженерам машинного обучения и компаниям, которые используют Llama 2 в продакшене на AWS. Они позволяют оценить затраты и производительность перед развертыванием. Также данные помогут при выборе между моделями разного размера в зависимости от требований к качеству и скорости.
Что пока неизвестно? Сравнение с другими облачными платформами (GCP, Azure) не проводилось. Также не тестировались модели с квантованием или другими методами оптимизации. Будущие бенчмарки могут включать эти аспекты.