Netflix LLM платформа: Triton и vLLM в production — как построили

Netflix построил внутреннюю платформу для serving больших языковых моделей (LLM) на основе Triton Inference Server от NVIDIA и библиотеки vLLM. В техническом докладе инженеры стримингового гиганта рассказали, как решали ключевые вызовы: поддержка моделей разного размера, управление аппаратными ресур

Netflix LLM платформа: Triton и vLLM в production — как построили

Netflix построил внутреннюю платформу для serving больших языковых моделей (LLM) на основе Triton Inference Server от NVIDIA и библиотеки vLLM. В техническом докладе инженеры стримингового гиганта рассказали, как решали ключевые вызовы: поддержка моделей разного размера, управление аппаратными ресурсами и работа с быстро меняющимися движками инференса. Платформа стала единым слоем, абстрагирующим детали инференса от внутренних команд, использующих LLM для автоматического перевода субтитров, генерации описаний контента и других задач.

Как Netflix строил платформу для LLM

Платформа Netflix для serving LLM представляет собой единый слой, который абстрагирует детали инференса от потребителей — внутренних команд, использующих языковые модели для различных задач. В качестве основного компонента выбран Triton Inference Server, который обеспечивает унифицированный API и управление ресурсами. Для оптимизации инференса применяется vLLM — библиотека с открытым исходным кодом, известная высокой эффективностью использования памяти и поддержкой continuous batching.

Инженеры Netflix отметили, что ключевой проблемой стало разнообразие моделей: от небольших (например, 7B параметров) до крупных (70B и более). Каждая модель требует разного объёма GPU-памяти и имеет свои особенности в latency. Платформа должна автоматически выбирать подходящую конфигурацию: количество GPU, тип инстанса, размер батча. Для этого Netflix разработал систему "model profiles", которая хранит метаданные каждой модели и рекомендации по деплою.

Предыстория и контекст

Netflix давно использует машинное обучение для рекомендаций и персонализации, но LLM — новый этап. В отличие от традиционных моделей, LLM потребляют значительно больше ресурсов и требуют специализированных движков инференса. Компания начала экспериментировать с LLM в 2024 году, а к 2025 году число запросов выросло настолько, что потребовалась единая платформа. Ранее каждая команда развёртывала модели по-своему, что приводило к дублированию инфраструктуры и неэффективному использованию GPU.

Рынок инструментов для serving LLM быстро меняется: появляются новые движки (например, TensorRT-LLM, llama.cpp), а существующие обновляются каждые несколько недель. Netflix выбрал vLLM как наиболее зрелое open-source решение, но оставил возможность подключать другие бэкенды через Triton. Это позволило не привязываться к одному вендору и тестировать альтернативы.

Какие проблемы решала платформа?

Главная проблема — "фрагментация" GPU-памяти. При serving нескольких моделей на одном GPU нужно эффективно распределять память между ними. vLLM решает это через PagedAttention — технику, которая разбивает KV-кэш на страницы, как в виртуальной памяти. Netflix дополнительно реализовал "model multiplexing": если одна модель не используется, её память освобождается для другой.

Вторая проблема — задержки при холодном старте. Загрузка большой модели (например, Llama 3 70B) может занимать минуты. Netflix внедрил "warm pool" — предварительно загруженные инстансы моделей, которые ждут запросов. Это сократило время первого ответа (TTFB) с десятков секунд до миллисекунд.

Технические детали платформы

Архитектура платформы включает три уровня: оркестратор, слой инференса и мониторинг. Оркестратор (на базе Kubernetes) управляет жизненным циклом моделей: развёртывание, масштабирование, обновление. Слой инференса — Triton с бэкендом vLLM. Мониторинг собирает метрики: latency, throughput, utilisation GPU.

Netflix использует собственные GPU-кластеры на AWS (инстансы p4d и p5), но платформа спроектирована как облачно-независимая. Для масштабирования применяется autoscaling на основе длины очереди запросов и загрузки GPU. При росте трафика автоматически добавляются новые поды с моделями, при снижении — удаляются.

Важный аспект — безопасность. LLM могут генерировать нежелательный контент, поэтому Netflix внедрил фильтры на уровне платформы: проверка входных и выходных данных, ограничение по темам. Фильтры работают как отдельные микросервисы, что позволяет обновлять их независимо от моделей.

Кого затронет и как

Разработчики внутри Netflix получили единый API для вызова LLM — не нужно разбираться в деталях инференса. Это ускорило внедрение AI-функций: от автоматического перевода субтитров до генерации описаний контента. Для бизнеса платформа означает снижение затрат на инфраструктуру за счёт более эффективного использования GPU.

Для сообщества open-source опыт Netflix важен как пример production-grade serving LLM в крупной компании. Платформа построена на открытых компонентах (Triton, vLLM, Kubernetes), и инженеры Netflix делятся best practices: как настраивать continuous batching, как управлять памятью, как мониторить модели. Российские и СНГ-компании, использующие LLM, могут адаптировать эти подходы, особенно те, кто работает с Yandex GPT или другими моделями на GPU.

Что будет дальше

Netflix планирует расширять платформу: добавить поддержку мультимодальных моделей (изображения, видео) и внедрить автоматический выбор бэкенда в зависимости от модели и нагрузки. Также компания исследует возможность использования специализированных чипов, например, AWS Trainium или Google TPU, для снижения затрат.

На рынке serving LLM ожидается дальнейшая консолидация: Triton и vLLM остаются лидерами, но конкуренция со стороны TensorRT-LLM и llama.cpp растёт. Netflix продолжит следить за новыми движками и, возможно, опубликует часть кода платформы как open-source.

Итог

Netflix показал, что production-grade serving LLM возможен на open-source инструментах при правильной архитектуре. Платформа на Triton и vLLM решает ключевые проблемы: разнообразие моделей, управление памятью и latency. Опыт Netflix будет полезен любой компании, которая внедряет LLM в критически важные сервисы.