Как работает Reasoning в LLM: почему ChatGPT иногда «думает» минуту
Вы задаёте вопрос ChatGPT, и вместо мгновенного ответа видите надпись «Thinking» — иногда на целую минуту. Неужели модель обрела сознание? На самом деле это не магия, а сложный инженерный процесс под названием Reasoning. Сегодня все ведущие языковые модели, от GPT-4o до Claude 3.5, поддерживают режи

Вы задаёте вопрос ChatGPT, и вместо мгновенного ответа видите надпись «Thinking» — иногда на целую минуту. Неужели модель обрела сознание? На самом деле это не магия, а сложный инженерный процесс под названием Reasoning. Сегодня все ведущие языковые модели, от GPT-4o до Claude 3.5, поддерживают режим размышлений, но мало кто понимает, что происходит внутри. Давайте разберёмся, как работает Reasoning и почему он стал прорывом в искусственном интеллекте.
Как психолог случайно спроектировал думающую LLM
История Reasoning началась не с инженеров, а с психолога. В 2022 году исследователь из Стэнфорда заметил, что если попросить языковую модель «объяснить шаги решения», точность ответов резко возрастает. Это наблюдение легло в основу техники Chain-of-Thought (CoT) — цепочки рассуждений. Вместо того чтобы выдавать ответ сразу, модель генерирует промежуточные логические шаги. Позже выяснилось: если добавить в промпт фразу «Давайте подумаем шаг за шагом», качество ответа улучшается на 10-15%.
Однако настоящий прорыв произошел, когда инженеры OpenAI решили не просто просить модель рассуждать, а обучить её этому на уровне архитектуры. Так появилась модель o1 (ранее Q), которая использует внутренние «токены размышлений» — скрытые последовательности, которые модель генерирует перед финальным ответом. Эти токены не видны пользователю, но занимают время вычислений — отсюда и задержка в несколько десятков секунд.
Чем Reasoning отличается от обычного ответа?
Ключевое отличие — в способе обработки запроса. Обычная LLM генерирует ответ последовательно, токен за токеном, опираясь только на предыдущие слова. Reasoning-модель сначала строит внутреннюю «рассуждалку»: она перебирает возможные пути решения, проверяет гипотезы и возвращается к началу, если заходит в тупик. Этот процесс напоминает то, как человек решает сложную задачу — пишет черновик, исправляет ошибки, перепроверяет.
Технически это реализовано через специальные скрытые токены, которые помечают начало и конец каждого этапа рассуждения. Модель обучается на миллионах примеров пошаговых решений, где каждый шаг явно размечен. В результате она не просто выдает ответ, а выстраивает логическую цепочку, которую можно интерпретировать.
Почему модель «думает» так долго?
Время задержки связано с количеством внутренних токенов размышлений. Для сложных задач модель генерирует сотни или тысячи скрытых токенов, каждый из которых требует вычислительных ресурсов. OpenAI оптимизирует этот процесс, но фундаментально Reasoning требует в 5-10 раз больше вычислений, чем обычный ответ. Именно поэтому ChatGPT может «думать» минуту над сложным математическим вопросом, но ответить на «Как дела?» мгновенно.
Как это повлияло на точность моделей?
Влияние оказалось драматическим. На бенчмарках математических задач (например, GSM8K) модели с Reasoning улучшили точность с 58% до 92%. В задачах на логику и планирование прирост составил от 30 до 50 процентных пунктов. Особенно впечатляют результаты в программировании: GPT-4 с Reasoning решает 87% задач на Codeforces против 48% у обычной версии.
Однако есть и обратная сторона. Reasoning требует в 5-10 раз больше вычислительных ресурсов — каждый запрос может стоить в десятки раз дороже. Кроме того, модели стали «задумываться» даже над простыми вопросами, где мгновенный ответ был бы уместен. Это породило феномен «Горе от ума»: чрезмерное размышление над тривиальными задачами.
Кого затронет и как
Для разработчиков Reasoning — это одновременно благословение и проклятие. С одной стороны, улучшенная точность позволяет использовать LLM в критических приложениях: медицинская диагностика, юридический анализ, финансовое моделирование. С другой — рост задержек и стоимости делает модель непригодной для чат-ботов реального времени или голосовых ассистентов.
Российские компании, такие как Яндекс и Сбер, уже внедряют Reasoning в свои модели — YandexGPT и GigaChat. Однако из-за санкционных ограничений доступ к самым мощным GPU ограничен, поэтому отечественные аналоги пока уступают западным по скорости и глубине рассуждений.
Что будет дальше
Исследователи работают над гибридными архитектурами, которые будут включать Reasoning только для сложных задач, а для простых отвечать мгновенно. Уже появились модели с «режимом турбо», где пользователь сам выбирает глубину размышлений. Ожидается, что к 2026 году Reasoning станет стандартным компонентом любой LLM, а время задержки сократится до 2-3 секунд благодаря специализированным чипам.
Кроме того, активно развивается направление «открытого Reasoning» — когда модель показывает пользователю свои промежуточные шаги. Это не только повышает доверие, но и позволяет человеку корректировать ход рассуждений на лету.
Итог
Reasoning — это не магия и не сознание, а инженерное решение, имитирующее человеческое мышление через пошаговое построение логических цепочек. Технология уже радикально повысила точность LLM в сложных задачах, но породила новые проблемы — рост стоимости и времени ответа. Следить за этой темой стоит каждому, кто работает с ИИ: в ближайшие годы Reasoning станет таким же привычным, как автодополнение текста.