Локальная LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2
Во второй части эксперимента мы перешли от лабораторных измерений к моделированию реальной работы SOC. Мы оценили, как GPU справляется с инференсом LLM при разной численности команды и интенсивности потока инцидентов — от спокойной смены до пиковых ситуаций с массовым поступлением новых инцидентов.

Во второй части эксперимента мы перешли от лабораторных измерений к моделированию реальной работы SOC. Мы оценили, как GPU справляется с инференсом LLM при разной численности команды и интенсивности потока инцидентов — от спокойной смены до пиковых ситуаций с массовым поступлением новых инцидентов. Важно отметить, что в эксперименте использовались не специально подготовленные тестовые примеры, а анонимизированные реальные инциденты из практики нашего внутреннего SOC.
Моделирование рабочего потока SOC
Для имитации нагрузки мы построили модель, учитывающую три ключевых сценария: штатная работа с низким уровнем инцидентов, средняя нагрузка и пиковый режим при атаке или массовом событии. В каждом сценарии фиксировались такие метрики, как время ответа модели, процент успешных обработок, количество перегрузок и средняя загрузка GPU.
Штатный режим предполагал поток до 20 инцидентов в час. При таком уровне нагрузки GPU работала с запасом: время ответа составляло менее 2 секунд на запрос, загрузка видеопамяти не превышала 40%, а модель успевала обрабатывать все запросы без очередей. Команда из 5 аналитиков могла работать без задержек.
При средней нагрузке (до 60 инцидентов в час) GPU загружалась на 70–80%, время ответа увеличивалось до 4–6 секунд, но все запросы обрабатывались в пределах приемлемого времени. Команда из 10 аналитиков работала без существенных замедлений. Модель успевала генерировать обоснования для каждого инцидента, включая рекомендации по реагированию.
Как LLM справляется с пиковыми нагрузками в SOC?
Пиковый сценарий имитировал массовое поступление инцидентов — до 150 в час. Это соответствует ситуации крупной кибератаки или сбоя в инфраструктуре. При такой нагрузке GPU работала на пределе: загрузка памяти достигала 95%, время ответа возрастало до 12–15 секунд, однако модель продолжала обрабатывать все запросы без потерь. Очередь запросов росла, но не превышала критических значений.
Интересно, что при дальнейшем увеличении потока до 200 инцидентов в час начинались сбои: часть запросов завершалась с ошибкой тайм-аута, а качество ответов снижалось из-за нехватки контекста. Таким образом, практический предел для данной конфигурации — около 150 инцидентов в час при команде до 10 аналитиков.
Почему режим рассуждений оказался непригодным
Отдельно мы протестировали режим рассуждений (thinking mode), который включается в некоторых LLM для генерации цепочек логических шагов. В эксперименте Qwen3.5-122B-A10B-GPTQ с включенным thinking mode показал резкое падение производительности: время ответа увеличилось в 3–4 раза, а загрузка GPU выросла до 100% при потоке всего 30 инцидентов в час.
Причина в том, что режим рассуждений генерирует дополнительные токены, которые не нужны для конечного ответа. В SOC требуется быстрый и точный вывод, а не демонстрация процесса мышления. Режим рассуждений приводит к избыточному потреблению ресурсов и задержкам, что критично для оперативного реагирования.
Мы также проверили качество ответов в обоих режимах. Оказалось, что при отключенном thinking mode модель не уступает в точности классификации инцидентов и рекомендациях, но работает значительно быстрее. Это подтверждает, что для задач SOC режим рассуждений не только бесполезен, но и вреден.
Кого затронут результаты
Для руководителей SOC и инженеров по безопасности результаты эксперимента означают, что локальная LLM на базе одной профессиональной GPU способна обслуживать команду среднего размера даже в пиковые нагрузки. Это снижает зависимость от облачных сервисов, уменьшает задержки и повышает конфиденциальность данных.
Для разработчиков решений по информационной безопасности полученные метрики позволяют точнее рассчитывать требования к аппаратному обеспечению. Вместо дорогих кластеров можно использовать одну мощную рабочую станцию, что существенно экономит бюджет.
В российском контексте особенно важно, что эксперимент проводился на реальных данных внутреннего SOC компании R‑Vision. Это значит, что результаты применимы к типовым задачам отечественных центров мониторинга, где требования к скорости и точности высоки, а использование зарубежных облачных LLM может быть ограничено.
Что будет дальше
В следующих частях эксперимента планируется протестировать другие модели, включая более легкие квантизации и специализированные сборки для безопасности. Также будет изучено влияние многопоточности и распределенного инференса на нескольких GPU.
Кроме того, команда R‑Vision намерена исследовать сценарии с использованием LoRA-адаптеров для тонкой настройки модели под конкретные типы инцидентов. Это может дополнительно повысить точность и скорость обработки.
Итог
Эксперимент показал, что локальная LLM на базе NVIDIA RTX PRO 6000 Blackwell Max-Q способна обрабатывать до 150 инцидентов в час при команде до 10 аналитиков. Режим рассуждений оказался непригодным для промышленного использования из-за резкого падения производительности. Полученные данные помогут SOC-командам точнее планировать инфраструктуру и внедрять ИИ-ассистентов без потери производительности.