Миллион токенов за 1 ₽ или за 20 726 ₽: одна RTX 5090, и почему API все равно дешевле
Стоимость генерации миллиона токенов с помощью локальной видеокарты может варьироваться от одного рубля до более чем двадцати тысяч рублей, и решающим фактором оказывается не мощность GPU, а интенсивность её использования. В этой статье мы разберём, как такие расчёты были проведены на примере RTX 50

Стоимость генерации миллиона токенов с помощью локальной видеокарты может варьироваться от одного рубля до более чем двадцати тысяч рублей, и решающим фактором оказывается не мощность GPU, а интенсивность её использования. В этой статье мы разберём, как такие расчёты были проведены на примере RTX 5090, сравним их с тарифами популярных API-сервисов и выясним, в каких случаях покупка собственного железа действительно оправдана, а когда разумнее обратиться к облачным решениям.
Одна RTX 5090: что показали замеры
Автор эксперимента взял одну из самых производительных потребительских видеокарт — RTX 5090 — и провёл серию тестов, чтобы определить её реальную пропускную способность при работе с современными языковыми моделями. Замеры показали, что карта способна обрабатывать около 2000 токенов в секунду при использовании квантованных моделей уровня Llama 3 8B. На основе этих данных была рассчитана стоимость генерации миллиона токенов с учётом цены карты, энергопотребления и амортизации.
Ключевой результат: если карта работает 24 часа в сутки, себестоимость миллиона токенов составляет примерно 1 рубль — это сопоставимо с самыми дешёвыми API-тарифами. Однако если карта используется всего несколько часов в день, цена резко возрастает. При загрузке 1 час в сутки стоимость миллиона токенов подскакивает до 20 726 рублей — именно столько придётся заплатить за амортизацию дорогого железа, которое большую часть времени простаивает.
Предыстория и контекст
Спор о том, что выгоднее — арендовать мощности или купить собственные — ведётся в сообществе разработчиков уже несколько лет. С появлением доступных LLM и ростом цен на API этот вопрос стал особенно острым. Многие компании и отдельные разработчики задумываются о приобретении видеокарт, надеясь сэкономить на долгосрочной дистанции. Однако статистика использования показывает: большинство проектов не нагружают GPU постоянно. Пиковая нагрузка обычно приходится на рабочие часы, а ночью и в выходные карта простаивает.
Автор статьи отмечает, что при выборе между API и собственным железом важно учитывать не только прямые затраты на оборудование, но и такие факторы, как стоимость электроэнергии, обслуживание, охлаждение, а также время, которое разработчик тратит на настройку и поддержку инфраструктуры. В большинстве случаев API оказывается проще и дешевле, особенно для небольших проектов и стартапов.
Как считалась стоимость миллиона токенов?
Методика расчёта проста: берётся полная стоимость владения картой в год (цена карты, делённая на срок службы, плюс затраты на электроэнергию), делится на количество токенов, которые карта может сгенерировать за год при заданной загрузке. Полученная цифра показывает, сколько стоит каждый миллион токенов при разных сценариях использования.
Автор учёл цену RTX 5090 в 200 000 рублей, срок службы 3 года, энергопотребление 575 Вт и тариф на электроэнергию 5 рублей за кВт·ч. При загрузке 24 часа в сутки годовые затраты на электричество составляют около 25 000 рублей, амортизация — около 67 000 рублей, итого около 92 000 рублей в год. При производительности 2000 токенов в секунду карта за год генерирует примерно 63 миллиарда токенов, что даёт около 1,5 рубля за миллион токенов — близко к заявленному 1 рублю.
Технические подробности и сравнение с API
Автор сравнил полученные цифры с тарифами семи популярных API-сервисов, включая OpenAI, Anthropic, Google и российских провайдеров. Оказалось, что даже самые дешёвые тарифы на API для моделей уровня Llama 3 8B стоят от 2 до 5 рублей за миллион токенов, что сопоставимо с себестоимостью при круглосуточной работе собственной карты. Однако при загрузке менее 8 часов в сутки API становится значительно выгоднее.
Например, при 8 часах работы в день себестоимость миллиона токенов на собственной карте составляет около 6 рублей — это уже дороже большинства API. При 4 часах — 12 рублей, при 1 часе — 46 рублей. Таким образом, точка безубыточности находится примерно на уровне 20 часов работы в сутки. Это означает, что для большинства реальных сценариев использования — от разработки до продакшена с переменной нагрузкой — API оказывается экономически оправданным.
Почему API всё равно дешевле для большинства задач?
Секрет в том, что API-провайдеры распределяют стоимость своих серверов между тысячами клиентов, достигая высокой загрузки оборудования. Они могут позволить себе устанавливать цены, которые для отдельного разработчика с собственной картой недостижимы при неполной загрузке. Кроме того, API снимает с вас бремя администрирования: не нужно думать об обновлениях, охлаждении, замене вышедших из строя компонентов и мониторинге.
Даже если вы планируете использовать карту активно, не стоит забывать о скрытых затратах. Покупка видеокарты — это только начало. Вам понадобится материнская плата с поддержкой PCIe, блок питания достаточной мощности, корпус с хорошей вентиляцией и, возможно, дополнительные системы охлаждения. Всё это увеличивает первоначальные вложения и, соответственно, амортизационные расходы.
Кого затронет и как
Для разработчиков и небольших студий, которые рассматривают покупку видеокарты для запуска LLM, эти расчёты могут стать решающим фактором. Если проект не требует круглосуточной обработки запросов, API-сервисы позволяют сэкономить значительные средства и не отвлекаться на администрирование железа. Крупные компании с постоянной высокой нагрузкой, напротив, могут выиграть от собственной инфраструктуры, но им придётся учесть затраты на масштабирование и обслуживание.
В России и СНГ ситуация усугубляется сложностями с поставками видеокарт и их высокой ценой из-за санкций. Поэтому аренда GPU-серверов или использование API может быть особенно привлекательным для локальных разработчиков. Автор статьи подчёркивает, что его расчёты носят приблизительный характер и зависят от конкретных условий, но общая тенденция очевидна: API дешевле для большинства.
Что будет дальше
С развитием технологий и появлением более эффективных моделей стоимость генерации токенов будет снижаться как на стороне API, так и на стороне локального железа. Возможно, в будущем появятся специализированные чипы для LLM, которые изменят экономику. Однако на текущий момент выбор между API и собственной картой упирается в простую арифметику: если ваша карта простаивает большую часть времени, вы переплачиваете за железо.
Автор рекомендует перед покупкой видеокарты трезво оценить реальную нагрузку и рассчитать точку безубыточности по своей методике. Возможно, лучшим решением станет гибридный подход: использовать API для пиковых нагрузок и собственную карту для постоянных базовых задач.
Итог
Покупка RTX 5090 для запуска LLM может быть оправдана только при почти круглосуточной загрузке. В остальных случаях API-сервисы оказываются в разы дешевле и проще в использовании. Прежде чем тратить сотни тысяч рублей на железо, посчитайте, сколько часов в сутки ваша карта будет реально работать — именно этот показатель определяет итоговую стоимость каждого миллиона токенов.