Как снизить затраты на LLM в продакшене с $2000 до $30: опыт JobPath

Стартапы и компании, использующие языковые модели в продакшене, часто сталкиваются с проблемой высоких затрат на API. JobPath, платформа для поиска работы, смогла сократить ежемесячные расходы с прогнозных $2000 до $30 — более чем в 66 раз. Как им это удалось и какие компромиссы пришлось принять, ра

Как снизить затраты на LLM в продакшене с $2000 до $30: опыт JobPath

Стартапы и компании, использующие языковые модели в продакшене, часто сталкиваются с проблемой высоких затрат на API. JobPath, платформа для поиска работы, смогла сократить ежемесячные расходы с прогнозных $2000 до $30 — более чем в 66 раз. Как им это удалось и какие компромиссы пришлось принять, разбираем в этой статье.

Проблема: дорогие API LLM тормозят масштабирование

JobPath — это сервис, который собирает вакансии из открытых источников и Telegram-каналов, а затем структурирует их с помощью языковых моделей. Каждую ночь Celery-задача обрабатывает тысячи новых вакансий, превращая сырой текст в карточки с полями: название должности, компания, зарплата, требования и описание. Изначально для этой задачи использовалась Claude Sonnet от Anthropic. Модель показывала отличные результаты — точность структурирования достигала 99%. Однако стоимость была неподъемной: при текущем объеме затраты составляли около $2000 в месяц, и эта сумма росла вместе с каталогом. Команда понимала, что дальнейшее масштабирование невозможно без снижения расходов.

Решение: переход на open-source модель и оптимизация инфраструктуры

Разработчики JobPath протестировали несколько альтернатив и остановились на комбинации подходов. Ключевым решением стал переход на Llama 3.1 70B — open-source модель от Meta, развернутую на собственных серверах с использованием vLLM. Это позволило уйти от поминутной оплаты API к фиксированным затратам на железо. Серверное оборудование состояло из двух NVIDIA A100, аренда которых обошлась примерно в $30 в месяц. В результате ежемесячный счет упал с $2000 до $30.

Как именно JobPath снизила затраты: технические детали

Переход на собственную инфраструктуру потребовал серьезной оптимизации. Разработчики провели серию экспериментов с разными моделями и конфигурациями. Они выяснили, что Llama 3.1 70B с квантизацией Q4KM дает приемлемое качество для их задачи. Для инференса использовали vLLM — библиотеку с открытым исходным кодом, которая оптимизирует использование GPU и позволяет обслуживать множество запросов одновременно.

Однако ключевым фактором стала оптимизация промптов. Изначально на каждую вакансию уходило около 2000 токенов. После тщательной настройки и сокращения инструкций объем снизился до 500 токенов. Это в четыре раза уменьшило нагрузку на модель и ускорило обработку. Также команда внедрила пакетную обработку: Celery-задача теперь отправляет на LLM сразу несколько вакансий, что повышает эффективность использования GPU.

Компромиссы: снижение точности и рост сложности поддержки

Любая экономия требует жертв. После перехода на Llama 3.1 70B точность структурирования снизилась с 99% до 97%. В редких случаях модель может ошибиться в определении зарплаты или названия компании, но эти ошибки исправляются постобработкой. Для конечных пользователей JobPath изменения почти незаметны, но для бизнеса это означает, что масштабирование больше не требует кратного роста затрат на AI.

Кроме того, возросла сложность поддержки инфраструктуры. Развертывание и обслуживание собственных серверов требует компетенций в DevOps и готовности тратить время на настройку. Однако для JobPath эти усилия оправдались: экономия в 66 раз позволила компании масштабироваться без увеличения бюджета на AI.

Кого затронет и как: практические последствия для разработчиков и бизнеса

Опыт JobPath в первую очередь полезен стартапам и средним компаниям, которые обрабатывают большие объемы текстовых данных: агрегаторам вакансий, маркетплейсам, сервисам анализа отзывов. Если ваш бизнес зависит от API дорогих LLM, переход на open-source модели может кардинально изменить экономику проекта. Однако стоит учитывать, что такой подход требует инвестиций в инфраструктуру и DevOps-специалистов.

Для конечных пользователей JobPath изменения почти незаметны: точность структурирования вакансий снизилась незначительно — с 99% до 97%. В редких случаях модель может ошибиться в определении зарплаты или названия компании, но эти ошибки исправляются постобработкой. Для бизнеса это означает, что можно масштабироваться без кратного роста затрат на AI.

Что будет дальше: развитие подхода и возможные риски

Команда JobPath планирует и дальше оптимизировать систему: тестировать более новые модели, такие как Llama 3.2, и экспериментировать с дообучением на своих данных. Они также рассматривают возможность использования смешанного подхода: дешевая модель для 90% простых вакансий и дорогая — для сложных случаев. Это может еще больше снизить затраты без потери качества.

Однако есть и риски. Open-source модели быстро устаревают, и через полгода может появиться более эффективная платная модель, которая окажется выгоднее с учетом всех затрат на поддержку. Кроме того, рост объемов данных может потребовать дополнительных GPU, что увеличит фиксированные расходы. Но пока выбранная стратегия себя оправдывает.

Итог

JobPath на практике доказала, что затраты на LLM в продакшене можно сократить в десятки раз без катастрофической потери качества. Их рецепт — open-source модель Llama 3.1 70B на собственном железе, оптимизация промптов и пакетная обработка. Если ваш проект упирается в стоимость API, возможно, стоит присмотреться к этому подходу. Но помните: экономия требует компетенций и готовности к компромиссам в точности.