AI Gateway от Vercel: сортировка провайдеров по стоимости, задержке и пропускной способности

Vercel представил новую функцию сортировки провайдеров для AI Gateway, которая позволяет разработчикам задавать приоритеты при выборе модели: стоимость, время до первого токена (TTFT) или пропускная способность (TPS). Это обновление упрощает оптимизацию запросов к LLM, автоматически учитывая изменен

AI Gateway от Vercel: сортировка провайдеров по стоимости, задержке и пропускной способности

Vercel представил новую функцию сортировки провайдеров для AI Gateway, которая позволяет разработчикам задавать приоритеты при выборе модели: стоимость, время до первого токена (TTFT) или пропускная способность (TPS). Это обновление упрощает оптимизацию запросов к LLM, автоматически учитывая изменения в ценах и производительности без правки кода.

Что изменилось в AI Gateway

Ранее порядок провайдеров в AI Gateway определялся комбинацией надёжности, качества вывода, цены и скорости. Теперь разработчики могут явно указать критерий ранжирования с помощью параметра sort в providerOptions.gateway. Доступны три варианта: cost (сортировка по входной цене провайдера), latency (по времени до первого токена) и throughput (по пропускной способности). Провайдеры пробуются в порядке сортировки, а переход к следующему происходит только при недоступности текущего. Это даёт гибкость в выборе оптимального провайдера для конкретной задачи.

Новая функция особенно полезна для моделей с большим количеством провайдеров и заметными различиями в цене или скорости. Ранжирование вычисляется в момент запроса, поэтому любые изменения в списке провайдеров, их ценах или задержках автоматически учитываются без необходимости изменять код приложения. Это снижает затраты на обслуживание и позволяет быстро адаптироваться к рыночным условиям.

Как работает сортировка провайдеров

Параметр sort принимает одно из трёх значений. При выборе cost провайдеры упорядочиваются по возрастанию входной цены за токен, что помогает минимизировать расходы. Latency сортирует по времени до первого токена (TTFT) — чем меньше задержка, тем быстрее ответ. Throughput ранжирует по пропускной способности (TPS), что важно для высоконагруженных приложений. Функция совместима с другими опциями маршрутизации, такими как Zero Data Retention (ZDR) и параметром order, который позволяет явно указать приоритетные провайдеры. В ответе каждого запроса теперь содержится блок sort с метаданными: какие провайдеры рассматривались, их метрики, порядок попыток и причины исключения. Это даёт полную прозрачность процесса выбора.

Какие критерии сортировки доступны и как их выбрать?

Разработчики могут выбирать между стоимостью, задержкой и пропускной способностью в зависимости от приоритетов приложения. Например, для чат-бота, где важна скорость ответа, лучше использовать latency. Для пакетной обработки данных, где критична цена, подойдёт cost. А для сервисов с большим потоком запросов — throughput. Важно, что сортировка не гарантирует использование только одного провайдера: если первый в списке недоступен, система автоматически переходит к следующему. Это обеспечивает отказоустойчивость без ручного вмешательства.

Почему это важно для разработчиков

Нововведение решает проблему выбора между несколькими провайдерами одной модели, которые могут сильно различаться по цене и производительности. Ручное управление списком провайдеров требует постоянного мониторинга и обновления кода, что неэффективно. AI Gateway теперь автоматически оптимизирует выбор на основе заданных критериев, экономя время и ресурсы. Кроме того, функция сохраняет совместимость с Zero Data Retention, что важно для соблюдения конфиденциальности данных.

Кому пригодится новая сортировка?

Функция полезна всем разработчикам, использующим AI Gateway для работы с LLM, особенно тем, кто запускает приложения с несколькими провайдерами. Она позволяет гибко настраивать баланс между стоимостью и скоростью без сложных конфигураций. Например, стартапы могут минимизировать затраты, а крупные сервисы — обеспечить низкую задержку для пользователей. Автоматическое обновление метрик снижает нагрузку на DevOps и ускоряет развёртывание.

Что пока неизвестно

Vercel не раскрывает, планируется ли добавление других критериев сортировки, например, по надёжности или географической близости. Также не указано, будут ли в будущем поддерживаться пользовательские метрики. Однако текущий набор уже покрывает основные потребности большинства сценариев. Разработчики могут комбинировать сортировку с параметром order для тонкой настройки, что даёт дополнительный контроль.

Новая функция сортировки провайдеров в AI Gateway от Vercel — это шаг к более интеллектуальной маршрутизации запросов. Она упрощает оптимизацию затрат и производительности, делая работу с LLM более эффективной и гибкой. Разработчикам стоит протестировать её в своих проектах, чтобы оценить преимущества автоматического выбора провайдера на основе реальных метрик.