Fluid Compute от Vercel: как serverless адаптируется под AI-нагрузки

Vercel представила Fluid Compute — новую парадигму serverless-вычислений, специально разработанную для рабочих нагрузок искусственного интеллекта. В отличие от традиционного serverless, ориентированного на быстрые транзакции, Fluid Compute поддерживает длительные соединения, сохранение состояния и п

Fluid Compute от Vercel: как serverless адаптируется под AI-нагрузки

Vercel представила Fluid Compute — новую парадигму serverless-вычислений, специально разработанную для рабочих нагрузок искусственного интеллекта. В отличие от традиционного serverless, ориентированного на быстрые транзакции, Fluid Compute поддерживает длительные соединения, сохранение состояния и потоковую передачу данных, что критически важно для LLM и AI-агентов. Эта технология устраняет разрыв между классической архитектурой и современными требованиями AI-разработчиков, предлагая неограниченное время выполнения и минимальный холодный старт.

Fluid Compute: как serverless адаптируется к ИИ

Ключевое отличие Fluid Compute от традиционного serverless — поддержка длительных соединений и устранение жестких ограничений по времени выполнения. В классической модели функции имеют лимит времени (обычно до 15 минут у AWS Lambda), после чего принудительно завершаются. Для AI-агентов, которые могут генерировать ответы несколько минут, или для обработки потоковых данных это критично. Fluid Compute позволяет выполнять задачи неограниченно долго, пока они действительно нужны, а также эффективно управляет состоянием между вызовами — без необходимости полагаться на внешние базы данных или Redis.

Еще одна важная особенность — оптимизация холодного старта. Vercel утверждает, что Fluid Compute использует интеллектуальное предварительное выделение ресурсов на основе анализа паттернов использования, что сокращает время запуска до миллисекунд даже для тяжелых AI-моделей. Платформа также автоматически масштабируется от нуля до тысяч параллельных выполнений, что критично для приложений с непредсказуемой нагрузкой, таких как чат-боты или генеративные сервисы.

Предыстория и контекст

Serverless-архитектура завоевала популярность благодаря простоте и экономичности: разработчики пишут код, не заботясь об инфраструктуре, и платят только за фактическое время выполнения. Однако с ростом AI-приложений стали очевидны ограничения. LLM требуют длительных сессий, потоковой передачи данных и часто работают с контекстом, который необходимо сохранять между шагами. Попытки адаптировать serverless под AI предпринимались и раньше: например, AWS Lambda теперь поддерживает до 15 минут выполнения, а Google Cloud Functions — до 60 минут. Но этого недостаточно для сложных AI-пайплайнов.

Vercel, будучи лидером в области фронтенд-инфраструктуры, решила пойти дальше. Компания уже давно интегрирует AI-возможности в свою платформу: от встроенной поддержки потоковой передачи данных (streaming) до оптимизации для Next.js. Fluid Compute — это естественная эволюция, которая превращает Vercel в полноценную платформу для backend-задач AI, а не только для фронтенда.

Чем Fluid Compute отличается от традиционного serverless?

Главное отличие — Fluid Compute не накладывает жестких временных ограничений. Вместо того чтобы убивать функцию после тайм-аута, платформа позволяет ей работать столько, сколько необходимо для завершения задачи. Это достигается за счет новой модели управления ресурсами: Vercel использует контейнеры, которые могут «засыпать» и «просыпаться» по требованию, сохраняя состояние в памяти. Таким образом, для разработчика это выглядит как бесконечно долгая serverless-функция, которая всегда готова к работе.

Другое важное отличие — встроенная поддержка потоковой передачи. Fluid Compute изначально спроектирован для работы с SSE (Server-Sent Events) и WebSockets, что позволяет отправлять данные клиенту по мере генерации, а не ждать завершения всего запроса. Это особенно актуально для чат-приложений, где пользователь видит ответ слово за словом.

Технические детали Fluid Compute

Архитектурно Fluid Compute базируется на изолированных контейнерах с быстрым запуском, которые Vercel называет «flasks». Каждый flask может выполнять несколько concurrent-запросов, а при необходимости автоматически создаются новые экземпляры. Платформа использует распределенную файловую систему для хранения состояния, что позволяет flask'ам сохранять данные между вызовами без потери производительности.

Для разработчиков Fluid Compute доступен через стандартный API Vercel: достаточно добавить в проект конфигурацию, указав, что функция должна работать в режиме Fluid. Поддерживаются все популярные языки — JavaScript, TypeScript, Python, Go и Rust. Vercel также предоставляет SDK для работы с AI-моделями, включая интеграцию с OpenAI, Hugging Face и собственными моделями.

Производительность: Vercel заявляет, что Fluid Compute обеспечивает задержку холодного старта менее 50 мс для типовых AI-задач, а пропускная способность масштабируется линейно до тысяч запросов в секунду. Точные цифры для разных сценариев пока не раскрываются, но компания обещает опубликовать бенчмарки в ближайшие недели.

Кого затронет и как

Fluid Compute в первую очередь нацелен на разработчиков AI-приложений: создателей чат-ботов, генеративных сервисов, AI-агентов и инструментов для обработки естественного языка. Для них исчезает необходимость проектировать обходные пути для обхода тайм-аутов или арендовать выделенные серверы. Стартапы и инди-разработчики получат доступ к инфраструктуре enterprise-уровня без сложного DevOps.

Бизнес-пользователи выиграют от снижения затрат: Vercel обещает, что Fluid Compute будет стоить не дороже традиционного serverless при обычных нагрузках, но при этом позволяет избежать переплаты за idle-ресурсы. Для компаний, мигрирующих с Kubernetes или виртуальных машин, это может означать существенную экономию.

Однако есть и ограничения: Fluid Compute пока не поддерживает GPU-ускорение, что критично для обучения моделей или тяжелого инференса. Vercel фокусируется именно на легковесных AI-задачах, где основная нагрузка — на CPU и память. Для GPU-интенсивных сценариев по-прежнему придется использовать специализированные решения вроде AWS SageMaker или Google Colab.

Что будет дальше

Fluid Compute уже доступен в бета-версии для всех пользователей Vercel. Полноценный релиз запланирован на второй квартал 2025 года. Компания также анонсировала программу раннего доступа для партнеров, которые смогут протестировать платформу на реальных AI-нагрузках.

В долгосрочной перспективе Vercel планирует добавить поддержку GPU, а также интеграцию с популярными AI-фреймворками (LangChain, LlamaIndex). Если Fluid Compute оправдает ожидания, он может стать стандартом де-факто для развертывания AI-приложений в serverless-стиле, бросив вызов традиционным облачным провайдерам.

Итог

Fluid Compute от Vercel — это своевременный ответ на растущие потребности AI-разработчиков, которые больше не хотят мириться с ограничениями классического serverless. Платформа предлагает гибкость, производительность и простоту, необходимые для создания современных AI-приложений. Если вы строите что-то на LLM, стоит присмотреться к Fluid Compute уже сейчас — возможно, это именно та инфраструктура, которой не хватало.