Как настроить мультиагентное ревью кода с Grok, Codex и Claude Code
Разработчики всё чаще доверяют написание кода ИИ-агентам, но качество результата часто оставляет желать лучшего. Вместо того чтобы полагаться на одну модель, можно организовать ревью силами нескольких агентов с разными архитектурами. Это снижает риск пропущенных ошибок и повышает надёжность кода без

Разработчики всё чаще доверяют написание кода ИИ-агентам, но качество результата часто оставляет желать лучшего. Вместо того чтобы полагаться на одну модель, можно организовать ревью силами нескольких агентов с разными архитектурами. Это снижает риск пропущенных ошибок и повышает надёжность кода без привлечения человека.
Почему одного ИИ-агента недостаточно
Термин vibe coding прочно вошёл в лексикон разработчиков, которые используют ИИ-агентов для написания кода. Идея проста: вы описываете желаемую функциональность, а агент сам пишет, правит и даже деплоит приложение. На практике, однако, попытка скормить агенту большой объём работы за один заход почти всегда заканчивается результатом категории «ну, вроде работает». Код может содержать логические ошибки, дублирование или просто не соответствовать спецификации.
Проблема в том, что языковые модели склонны к галлюцинациям: они могут придумывать несуществующие API, неправильно использовать библиотеки или игнорировать крайние случаи. Если использовать одну и ту же модель для генерации и ревью, она часто «соглашается» с собственными ошибками, так как её архитектура и обучающие данные одинаковы. Поэтому автор статьи на Habr предложил необычное решение: заставить нескольких ИИ-агентов рецензировать код друг друга.
Как устроен процесс ревью с участием нескольких ИИ
Автор использует комбинацию трёх инструментов: Claude Code от Anthropic, Grok от xAI и Codex от OpenAI. Claude Code выступает в роли основного генератора кода — он получает задачу и пишет реализацию. Затем готовый код отправляется на ревью двум другим агентам: Grok и Codex. Каждый из них анализирует код на предмет ошибок, неоптимальных решений и отклонений от требований. После этого Claude Code получает отзывы и вносит исправления. Цикл повторяется до тех пор, пока все рецензенты не одобрят результат.
Ключевая идея — использовать разные модели с разными архитектурами и обучающими данными. Это снижает вероятность того, что все агенты пропустят одну и ту же ошибку. Grok, обученный на данных X (Twitter), может заметить проблемы, которые упустит более консервативный Codex, и наоборот. Автор отмечает, что такой подход напоминает парное программирование, но с участием трёх «разумов».
Какие модели лучше всего подходят для ревью кода?
Выбор моделей зависит от ваших задач. Claude Code отлично справляется с генерацией сложного кода благодаря большому контексту и способности следовать инструкциям. Grok, несмотря на меньшую популярность в кодинге, может заметить нестандартные ошибки благодаря своему обучению на данных социальных сетей. Codex, предшественник GPT-4, хорошо понимает распространённые паттерны и библиотеки. Комбинация этих трёх моделей покрывает разные аспекты: Claude отвечает за качество реализации, Grok — за логику и крайние случаи, Codex — за соответствие стандартам и лучшим практикам.
Предыстория и контекст
Vibe coding стал популярен после того, как крупные языковые модели (LLM) научились генерировать рабочий код для простых задач. Разработчики начали использовать ИИ не только для автодополнения, но и для создания целых функций и модулей. Однако быстро выяснилось, что модели склонны к галлюцинациям. Традиционное ревью кода человеком требует времени и ресурсов, поэтому идея автоматизировать проверку с помощью ИИ выглядит логичным шагом.
Ранее уже предпринимались попытки использовать одну и ту же модель для генерации и ревью, но это часто приводило к тому, что модель «соглашалась» с собственными ошибками. Использование разных моделей должно решить эту проблему. Автор статьи пошёл дальше и реализовал полноценный конвейер, где агенты обмениваются замечаниями через API.
Как это работает на практике?
Автор описывает процесс в виде последовательности шагов. Сначала Claude Code получает задачу на естественном языке, например «напиши функцию для сортировки массива объектов по нескольким полям». Claude Code генерирует код и сохраняет его во временный файл. Затем запускаются Grok и Codex: каждый получает задание «проверь этот код на ошибки, утечки памяти, несоответствие спецификации и предложи улучшения». Агенты возвращают список замечаний в структурированном формате. Claude Code анализирует замечания, отсеивает дубликаты и ложные срабатывания, после чего вносит правки. Цикл повторяется до трёх итераций, после чего код считается готовым.
Технические подробности реализации
Для автоматизации автор написал скрипт на Python, который использует API всех трёх моделей. Claude Code вызывается через официальный SDK Anthropic, Grok — через API xAI, Codex — через OpenAI API. Скрипт управляет очередностью, передаёт контекст и собирает результаты. Важный момент: каждому агенту передаётся не только код, но и исходное описание задачи, чтобы ревьюеры могли оценить соответствие требованиям. Автор использует system prompt с чёткими инструкциями: «Найди логические ошибки, проверь обработку ошибок, оцени читаемость». Для уменьшения затрат он ограничивает количество токенов на ответ и использует кэширование контекста.
Автор также реализовал механизм голосования: если два из трёх агентов указывают на одну и ту же проблему, она принимается автоматически. Если мнения расходятся, Claude Code решает, учитывать ли замечание. Это позволяет избежать бесконечного цикла правок. По оценкам автора, такой подход увеличивает время генерации примерно вдвое, но значительно повышает качество кода.
Кого затронет и как
Метод будет полезен прежде всего разработчикам, которые активно используют ИИ-агентов в повседневной работе. Вместо того чтобы тратить часы на ручное ревью сгенерированного кода, можно доверить эту задачу другим ИИ. Это особенно актуально для стартапов и небольших команд, где нет выделенного code review. В России и странах СНГ, где многие разработчики работают удалённо, такой подход может повысить эффективность распределённых команд.
Однако стоит учитывать и ограничения. Во-первых, стоимость вызовов нескольких API может быть существенной. Во-вторых, модели могут ошибаться в ревью так же, как и в генерации. Автор предупреждает, что метод не заменяет человеческого ревью для критически важного кода, но хорошо подходит для черновиков и прототипов. Кроме того, использование трёх разных провайдеров увеличивает сложность интеграции и требует управления ключами доступа.
Что будет дальше
Автор планирует опубликовать свой скрипт в открытом доступе, чтобы сообщество могло его протестировать и доработать. В перспективе можно ожидать появления готовых инструментов, которые будут встраивать мультиагентное ревью прямо в CI/CD пайплайны. Например, GitHub Actions с вызовом нескольких моделей перед мержем pull request. Также возможно появление специализированных моделей, обученных именно на ревью кода, что сделает процесс ещё более надёжным.
Итог
Использование нескольких ИИ-агентов для ревью кода — логичное развитие идеи vibe coding. Оно позволяет повысить качество генерируемого кода без увеличения нагрузки на человека. Пока метод требует ручной настройки и не лишён недостатков, но он открывает путь к более зрелому использованию ИИ в разработке. Следите за развитием этой области: возможно, скоро мультиагентное ревью станет стандартной практикой.