8 способов снизить затраты на AI-агентов: опыт реального продукта и промпты для вайбкодеров

Запуск AI-агентов может быть дорогим: каждый ответ требует перечитывания всего предыдущего контекста, что быстро увеличивает счёт за токены. Юля Гончарова, продакт, дизайнер и вайбкодер, столкнулась с этой проблемой, создавая веб-приложение с мультиагентной системой на Claude Sonnet 4.6. Её стартап

8 способов снизить затраты на AI-агентов: опыт реального продукта и промпты для вайбкодеров

Запуск AI-агентов может быть дорогим: каждый ответ требует перечитывания всего предыдущего контекста, что быстро увеличивает счёт за токены. Юля Гончарова, продакт, дизайнер и вайбкодер, столкнулась с этой проблемой, создавая веб-приложение с мультиагентной системой на Claude Sonnet 4.6. Её стартап включает несколько агентов: один собирает данные пользователя, другой помогает сформулировать цель, третий проводит регулярные чек-ины, четвёртый — ежедневный чат-помощник. Также есть агенты инвесторов, симулирующие питч-сессии. Агенты координируются через общие данные, а не общаются напрямую, что снижает сложность, но не затраты. В своей статье на Habr она описала восемь методов, которые помогли сократить расходы на токены, оставаясь на той же модели. Эти советы будут полезны разработчикам и основателям, строящим AI-продукты.

Как устроена мультиагентная система и почему она дорогая

В системе Гончаровой каждый агент при каждом ответе заново «прочитывает» весь предыдущий разговор, накопленный контекст по проекту и свои инструкции. Это приводит к линейному росту затрат с каждым новым сообщением. Anthropic, провайдер модели, позволяет использовать «память» — специальный механизм, который сохраняет часть контекста и не требует его перечитывать. Однако у этой памяти есть срок годности, и именно её грамотное использование дало основную экономию. Без оптимизации стоимость одного диалога могла достигать десятков долларов в день, что неприемлемо для стартапа на ранней стадии.

Восемь способов снизить затраты на токены

1. Использовать memory для хранения ключевых данных

Вместо того чтобы каждый раз передавать агенту всю историю диалога, можно сохранять только самые важные факты в специальный блок памяти. Например, имя пользователя, его цель, последние действия. Это позволяет агенту «вспомнить» контекст без перечитывания тысяч токенов. Гончарова рекомендует структурировать память как JSON-объект, который обновляется после каждого значимого события.

2. Ограничивать историю диалога последними N сообщениями

Не все сообщения одинаково полезны. Если диалог длинный, можно передавать агенту только последние 10–20 сообщений, а остальное — только в виде сжатого саммари. Это резко сокращает количество токенов на входе. В продукте Гончаровой агент чат-помощника получает только последние 15 сообщений и краткое резюме предыдущих.

3. Применять саммаризацию контекста

После каждого важного этапа (например, завершения регистрации) агент генерирует краткое резюме того, что произошло, и сохраняет его в память. В следующих вызовах это резюме заменяет полную историю. Это особенно эффективно для агентов, которые работают последовательно: после передачи эстафеты новый агент получает только саммари, а не весь лог.

4. Использовать system prompt для инструкций, а не для контекста

Инструкции агента (system prompt) не должны содержать динамические данные. Всё, что меняется от сессии к сессии, лучше выносить в отдельный блок контекста или память. System prompt остаётся статичным и не увеличивает затраты при каждом вызове. Гончарова советует держать его объём до 500 токенов.

5. Кэшировать промежуточные результаты

Если несколько агентов используют одни и те же данные (например, профиль пользователя), их можно закэшировать и передавать только ссылку на кэш, а не сам объект. Это снижает дублирование токенов. В её системе общие данные хранятся в базе, и каждый агент получает только идентификатор, а не полный объект.

6. Оптимизировать промпты для конкретных задач

Каждый промпт должен быть максимально кратким и конкретным. Удаление лишних слов, объединение нескольких инструкций в одну, использование примеров вместо длинных описаний — всё это сокращает количество токенов. Гончарова приводит пример: вместо «пожалуйста, проанализируй и предоставь ответ» можно написать «ответь кратко».

7. Настроить механизм «стоп-слов» для раннего завершения

Если агент может дать ответ до того, как обработает весь контекст, можно использовать стоп-слова или условия досрочного завершения. Например, если пользователь говорит «спасибо, достаточно», агент может не генерировать полный ответ. Это экономит токены на выходе.

8. Периодически чистить и архивировать старые данные

Не вся информация остаётся актуальной. Старые логи, устаревшие цели, завершённые задачи — их можно удалять из контекста или перемещать в архив, который не передаётся агенту. Гончарова настроила автоматическую очистку каждые 24 часа: данные старше недели сжимаются в одно саммари.

Чем эти методы отличаются от стандартных подходов

В отличие от типичных рекомендаций (например, просто уменьшить модель или использовать более дешёвого провайдера), эти методы сохраняют качество ответов и не требуют смены модели. Они работают на уровне архитектуры приложения и управления контекстом. Ключевое отличие — использование памяти как основного инструмента, а не просто урезание истории. Это позволяет агенту оставаться «умным», но платить меньше.

Кого затронет и как

Разработчики AI-агентов, особенно соло-фаундеры и небольшие команды, могут сразу применить эти техники в своих проектах. Для стартапов, которые строят мультиагентные системы, экономия может составлять до 50–70% от затрат на токены. В русскоязычном сообществе вайбкодеров (разработчиков, использующих AI-кодинг) эти советы особенно актуальны, так как многие работают с ограниченными бюджетами. Крупные компании тоже могут выиграть, масштабируя подход на сотни агентов.

Что будет дальше

Гончарова планирует опубликовать готовые промпты для каждого из восьми методов, чтобы другие разработчики могли их скопировать и адаптировать. Она также работает над автоматизацией очистки памяти и интеграцией с другими моделями, такими как GPT-4o. В ближайшие месяцы ожидается появление инструментов для мониторинга затрат на токены в реальном времени, что упростит применение этих техник.

Итог

Снижение затрат на AI-агентов — это не про жертву качеством, а про умную архитектуру. Использование памяти, саммаризация, ограничение истории и оптимизация промптов позволяют сократить расходы на токены в разы, сохраняя функциональность. Эти методы уже доказали свою эффективность в реальном продукте и доступны каждому разработчику.