Почему ИИ не заменит QA-инженера: эксперимент с 2000 тестов в крупном банке
Искусственный интеллект не способен полностью заменить QA-инженера, особенно в сложных сценариях тестирования. Это подтвердил эксперимент, проведенный в крупном российском банке, где AI-ассистент проанализировал более 2000 автотестов. Хотя технология показала эффективность в рутинных задачах, на нес

Искусственный интеллект не способен полностью заменить QA-инженера, особенно в сложных сценариях тестирования. Это подтвердил эксперимент, проведенный в крупном российском банке, где AI-ассистент проанализировал более 2000 автотестов. Хотя технология показала эффективность в рутинных задачах, на нестандартных кейсах она часто ошибается, требуя человеческого контроля.
Автотесты писали, чтобы экономить время. Но в какой-то момент команда поняла, что тратит на их обслуживание больше, чем экономит. Тест упал в CI — нужно открыть Allure, зайти на стенд через VPN, авторизоваться, лезть в DOM, искать отвалившийся локатор. На один тест уходит полчаса-час. После релиза еще пара дней уходит на починку локаторов из-за изменений во фронтенде. А когда утром видишь 200 красных тестов при нетронутом коде, начинается расследование. В этот момент хочется отдать всё это AI-ассистенту и заняться делом. Команда так и сделала, но панацеи не вышло.
Как устроен AI-ассистент для тестирования
Егор Лаптев, QA Fullstack Java в SENSE на проекте крупного российского банка, разработал AI-ассистента на базе GPT-4o-mini. Ассистент подключается к Allure TestOps через API, получает упавшие тесты, анализирует логи, скриншоты и видео, затем генерирует исправления в виде готовых кусков кода. Система использует набор промптов, которые направляют ИИ на разные сценарии: анализ падений, исправление локаторов, обновление тестовых данных. В основе лежит стек Selenide, Cucumber, REST Assured, Allure, Kafka и Moon в Kubernetes, но принципы универсальны для любых UI- и API-тестов.
Ассистент работает в полуавтоматическом режиме: инженер запускает анализ вручную или по триггеру из CI, получает рекомендации, проверяет их и применяет. Полная автоматизация пока опасна — ИИ может внести ошибки в рабочий код. Однако даже частичная автоматизация экономит часы на рутинных задачах.
Какие задачи ИИ решает хорошо?
Эксперимент показал, что ИИ отлично справляется с типовыми падениями, связанными с изменением текста на странице, сменой CSS-классов или добавлением новых элементов в DOM. Например, когда фронтенд поменял надпись «Войти» на «Авторизоваться», ассистент за секунду обновил локатор. Также ИИ успешно анализирует логи и скриншоты, чтобы определить причину падения — например, если тест упал из-за таймаута или отсутствия элемента. В таких случаях ассистент генерирует корректные исправления, которые можно применить без дополнительной проверки.
Почему ИИ не справляется со сложными кейсами?
Проблемы начинаются на сложных кейсах: когда нужно понять бизнес-логику, учесть множество условий или исправить неочевидную ошибку в тестовых данных. ИИ может предложить несуществующий локатор, сослаться на элемент, которого нет в DOM, или начать ходить по кругу, генерируя однотипные исправления. Особенно опасна ситуация, когда ассистент с уверенностью выдаёт неверное решение — это требует двойной проверки, что сводит на нет экономию времени. В одном из тестов ассистент предложил исправить локатор, который на самом деле был правильным, а ошибка крылась в тестовых данных.
Технические детали и стоимость внедрения
Для работы ассистента используется API Allure TestOps: ассистент загружает данные о падении, включая скриншоты и видео, в base64, затем отправляет запрос к GPT-4o-mini с контекстом. Промпты написаны с учётом особенностей проекта: например, указано, что локаторы должны быть устойчивыми, а исправления — минимальными. Стоимость одного запроса к GPT-4o-mini составляет около 0,1–0,2 цента, то есть анализ одного теста обходится в копейки. Однако при частоте 200–500 падений в день затраты могут достигать нескольких долларов, что всё равно дешевле часа работы инженера.
Инфраструктура включает Kubernetes, где крутится Moon — инструмент для запуска браузеров в контейнерах. Ассистент написан на Java с использованием Spring Boot, логи хранятся в Kafka. Внедрение заняло около двух недель: разработка промптов, интеграция с Allure, тестирование на реальных падениях. Основная сложность — настройка контекста для ИИ, чтобы он не галлюцинировал. Пришлось экспериментировать с формулировками, чтобы ассистент не выдумывал локаторы.
Кого затронет внедрение AI-ассистента
Разработчики и QA-инженеры, работающие с автотестами, получат инструмент, который снимает рутину: исправление локаторов, анализ логов, генерация простых исправлений. Для бизнеса это сокращение времени на поддержку тестов и ускорение релизного цикла. Однако для крупных проектов с тысячами тестов эффект может быть спорным — если каждый десятый кейс требует ручной проверки, экономия снижается.
В российских компаниях, где активно используют Allure TestOps и Selenide, такой ассистент может стать стандартом. Но важно помнить: ИИ не заменяет экспертизу инженера. На сложных кейсах, связанных с бизнес-логикой или интеграционными тестами, человеческий контроль обязателен.
Что будет дальше
Егор Лаптев планирует улучшить ассистента: добавить поддержку видеоанализа в реальном времени, расширить промпты для сложных сценариев, внедрить механизм самопроверки, когда ИИ перепроверяет свои исправления. В перспективе — полная автоматизация для типовых падений с автоматическим созданием MR. Однако пока ассистент остаётся помощником, а не заменой.
Итог
ИИ-ассистент для QA — это не панацея, а полезный инструмент, который экономит часы на рутине, но требует контроля на сложных кейсах. Эксперимент SENSE показал, что технология готова к промышленному использованию, но с оговорками. Следить за развитием стоит всем, кто работает с автотестами — в ближайшие год-два такие ассистенты станут привычным элементом CI/CD.