Почему LLM знают теорию КПТ, но не применяют: новое исследование
Крупные языковые модели демонстрируют впечатляющие теоретические знания в области когнитивно-поведенческой терапии, достигая точности до 96% на экзаменационных вопросах. Однако, как показало недавнее исследование, эти модели не способны гибко применять различные терапевтические стратегии в реальных

Крупные языковые модели демонстрируют впечатляющие теоретические знания в области когнитивно-поведенческой терапии, достигая точности до 96% на экзаменационных вопросах. Однако, как показало недавнее исследование, эти модели не способны гибко применять различные терапевтические стратегии в реальных диалогах. Учёные разработали новый подход к измерению реального поведения LLM, выявив систематическое смещение в сторону всего одной стратегии — валидации и рефлексии, независимо от контекста. Это открытие ставит под сомнение готовность LLM к практическому использованию в области ментального здоровья.
Как проводилось исследование
Авторы работы создали комплексный каркас для оценки применения КПТ языковыми моделями. В основе лежит структура Beck's Cognitive Conceptualization, которая разбивает диалог на ключевые компоненты когнитивной терапии. Для проверки клинических концептов использовалась онтология SNOMED CT, а соответствие проверялось через Natural Language Inference. Выбор терапевтической стратегии — валидация и рефлексия, сократический опрос или предложение альтернативных перспектив — осуществлялся через множественную цепочку рассуждений (MCoT).
Что показали эксперименты
Эксперименты проводились на трёх open-weight LLM и 14 клинических кейсах из набора данных RealCBT. Результаты оказались неожиданными: простое добавление определений протокола через одну цепочку рассуждений практически не меняло поведение моделей. Даже использование MCoT давало лишь незначительное улучшение — около 1,2–1,3%. Все модели оставались смещёнными в сторону валидации и рефлексии, независимо от того, какая стратегия требовалась по протоколу.
Почему LLM не могут переключаться между стратегиями КПТ?
Этот вопрос стал центральным в исследовании. Учёные ввели метрику Protocol Leverage Force (F), которая измеряет, насколько сильно вмешательство меняет поведение модели относительно её ответа по умолчанию. Оказалось, что даже при явном указании протокола модели не демонстрируют гибкости. Возможные причины включают недостаточное обучение на разнообразных терапевтических диалогах, а также фундаментальные ограничения архитектуры, которая не способна к динамическому переключению стратегий.
Почему это важно для ментального здоровья
Когнитивно-поведенческая терапия — это структурированный подход, который требует от терапевта умения выбирать правильную стратегию в зависимости от контекста. Если LLM не могут этого делать, их применение в реальной клинической практике остаётся ограниченным. Работа предлагает новую метрику для оценки реального поведения модели, а не только её теоретических знаний. Это позволяет разработчикам систем для ментального здоровья более точно понимать, насколько модель готова к практическому использованию.
Кого затронет это исследование
Результаты исследования важны для разработчиков систем ментального здоровья, исследователей в области аффективных вычислений и специалистов по NLP, работающих над применением LLM в психотерапии. Они также представляют интерес для клиницистов, которые рассматривают возможность использования ИИ в качестве вспомогательного инструмента.
Что пока остаётся неизвестным
Остаётся неясным, почему даже при явном указании протокола модели не меняют поведение. Возможно, требуется более глубокая настройка или специализированное обучение на реальных терапевтических диалогах. Также не установлено, как метрика F коррелирует с клиническими исходами — то есть, действительно ли модели, которые лучше следуют протоколу, приводят к лучшим результатам для пациентов. Будущие исследования должны ответить на эти вопросы, чтобы продвинуть применение LLM в области ментального здоровья.