Vercel добавила уровни обслуживания в AI Gateway для контроля затрат
Платформа Vercel представила систему уровней обслуживания в AI Gateway, позволяющую разработчикам гибко управлять балансом между задержкой, пропускной способностью и стоимостью запросов к ИИ-моделям. Новая функция уже доступна для работы с провайдерами OpenAI и Gemini.

Компания Vercel обновила функциональность своего инструмента AI Gateway, внедрив уровни обслуживания (service tiers). Это нововведение призвано помочь разработчикам оптимизировать работу приложений, использующих большие языковые модели. Теперь параметры обработки запросов можно адаптировать под конкретные требования бизнес-задач, будь то высокая интерактивность или фоновая обработка данных.
Выбор приоритетов обработки запросов
Разработчики получили возможность выбирать между тремя уровнями обслуживания, каждый из которых предназначен для специфических сценариев использования. Стандартный уровень (default) обеспечивает привычную обработку запросов. Приоритетный уровень (priority) ориентирован на задачи, требующие минимальных задержек и высокой пропускной способности токенов, что важно для чат-ботов и интерактивных интерфейсов. Гибкий уровень (flex) предназначен для фоновых задач, где стоимость запроса важнее скорости, поэтому он позволяет снизить расходы за счет потенциально более высокой задержки.
На текущий момент функциональность уровней обслуживания реализована для моделей OpenAI и Google Gemini. Важной особенностью является унификация API: настройки применяются единообразно для всех поддерживаемых форматов, включая AI SDK, Chat Completions API и другие. Это позволяет менять модели или провайдеров, не перестраивая архитектуру приложения под специфику каждого поставщика.
Механика работы и биллинг
Система настроена на принцип максимальных усилий. Если по какой-то причине выбранный уровень обслуживания не может быть применен, запрос автоматически переключается на уровень по умолчанию. При этом Vercel гарантирует прозрачность расчетов: биллинг осуществляется на основе фактически примененного уровня. Если запрос с пометкой «приоритетный» был понижен до уровня «стандартный», стоимость услуги будет пересчитана по базовому тарифу, что исключает необоснованные расходы для клиента.
Для контроля и отладки AI Gateway возвращает информацию о примененном уровне в метаданных ответа провайдера. Это позволяет разработчикам анализировать производительность в реальном времени, сравнивать задержки между уровнями и подтверждать, что запрос был обработан в соответствии с ожиданиями. Ошибки в работе системы могут возникнуть только при отправке некорректных значений параметров, в остальных случаях система обеспечивает отказоустойчивость.
Тонкая настройка конфигурации
Гибкость управления достигается за счет возможности задавать уровни обслуживания как глобально, так и на уровне конкретных провайдеров. В сложных архитектурах, где задействовано несколько ИИ-поставщиков, разработчики могут конфигурировать разные уровни для каждого из них в соответствующих пространствах имен. Такая настройка позволяет точно распределять бюджет и ресурсы, комбинируя различные модели в рамках одной системы без необходимости сложной настройки инфраструктуры. Конфигурация осуществляется через параметр serviceTier в объекте providerOptions, что делает интеграцию функции быстрой и лаконичной для текущих пользователей платформы.