Эксперимент: может ли ИИ перестать верить учебнику и почему это важно

Новый эксперимент проверяет, как языковые модели меняют убеждения под давлением данных. Одна и та же модель получает одинаковые результаты, но разную «биографию» старой теории — и принимает разные решения. Разбираем, что это значит для научных ИИ и почему доверять учебникам опасно.

Эксперимент: может ли ИИ перестать верить учебнику и почему это важно

Представьте, что при запуске исследовательская ИИ-система получает доступ к архиву тысяч предыдущих попыток: удачные методы, ошибки, споры, опровержения и нерешённые вопросы. Очевидно, что способность системы может расти, даже если сама базовая модель не меняется. Но что именно система запоминает? Не только открытия. Вместе с ними в архив попадут устаревшие инструкции, ложный консенсус, случайные ошибки и выводы, которые все повторяют, хотя никто уже не помнит, откуда они взялись.

Научной системе недостаточно уметь узнавать новое. Она должна уметь при достаточных основаниях перестать считать истиной то, что уже очень хорошо «знает». Причём желательно не после первой странной цифры прибора — иначе вместо учёного получится генератор сенсаций. Но и не через сто лет после того, как старая теория окончательно перестала предсказывать мир. Автор статьи на Habr предлагает эксперимент, который проверяет именно этот баланс: одна и та же языковая модель получает одни и те же экспериментальные данные, но разную биографию старой теории. В одной версии она остаётся рабочей гипотезой. В другой успевает стать учебником, обрасти цитатами и породить зависимые знания.

Суть эксперимента: биография теории решает всё

Эксперимент строится на простой, но мощной идее: если решение модели меняется только из-за статуса и числа пересказов старой теории, мы получаем измеримый эффект научного авторитета при неизменной доказательной базе. В контрольной группе модель «знает» теорию как свежую гипотезу, которую можно оспорить. В экспериментальной — та же теория подаётся как устоявшийся учебник, подкреплённый множеством ссылок и зависимых знаний.

Модель получает одинаковые экспериментальные данные, которые противоречат старой теории. Вопрос: пересмотрит ли она свои убеждения? Если модель с «учебниковой» биографией упорно держится за старое, а модель с «гипотетической» биографией легко принимает новое, значит, дело не в данных, а в том, как они вписаны в контекст. Это ключевой вывод: научный авторитет — не просто социальный феномен, а фактор, который можно изолировать и измерить в контролируемых условиях.

Автор подчёркивает, что если этот эффект можно уменьшить, не заставляя ИИ устраивать революцию после каждого сбоя прибора, возникает инженерный вопрос: можно ли программировать не только память исследовательской системы, но и правила, по которым она меняет убеждения? Это уже не теоретическая дискуссия, а практическая задача для разработчиков ИИ.

Предыстория: почему ИИ склонен верить учебнику

Проблема уходит корнями в то, как обучаются современные языковые модели. Они тренируются на огромных массивах текстов, где устоявшиеся теории встречаются чаще, чем свежие гипотезы. Модель усваивает статистические закономерности: если теорию многократно повторяют, она становится для модели «правдой». Это не особенность конкретной архитектуры, а следствие обучения на человеческих текстах, где авторитет и консенсус играют огромную роль.

В научной практике консерватизм имеет смысл: наука должна быть осторожной, чтобы не прыгать от каждой аномалии к новой парадигме. Но когда речь идёт об ИИ, который будет автономно исследовать мир, этот консерватизм может стать опасным. Система, которая не способна пересмотреть устаревшие убеждения, будет повторять ошибки прошлого, даже когда данные ясно указывают на необходимость перемен.

Ранее уже были попытки решить эту проблему через механизмы активного обучения или байесовские обновления, но они не учитывали именно социальный аспект: как статус теории влияет на её устойчивость. Эксперимент на Habr делает шаг вперёд, предлагая конкретную методологию для измерения этого влияния.

Как это работает: почему статус теории важнее данных?

Механика эксперимента напоминает классические психологические тесты на конформизм, но перенесённые в область ИИ. Модель получает «биографию» теории: количество упоминаний, цитат, зависимых публикаций. В одном случае теория подаётся как недавняя гипотеза, в другом — как основа учебников. Затем модель сталкивается с противоречащими данными.

Результат, который ожидает автор, — модель с «учебниковой» биографией будет более устойчивой к пересмотру. Это происходит потому, что в процессе обучения модель связала теорию с множеством других фактов: если она изменит убеждение, придётся пересмотреть и зависимые знания. Это создаёт «когнитивный диссонанс», который модель пытается избежать, игнорируя новые данные или интерпретируя их как ошибку.

Важно, что эксперимент не требует менять веса модели — только контекст, в котором подаются данные. Это означает, что проблему можно решать на уровне промптов или архитектуры памяти, а не переобучать модели с нуля. Для разработчиков это практический инструмент: можно тестировать, насколько их система умеет отличать устаревшие догмы от живых гипотез.

Технические детали: как программировать смену убеждений

Автор предполагает, что решение лежит в разработке «правил обновления убеждений» — аналогично тому, как байесовские методы обновляют вероятности, но с учётом социального контекста. Можно представить систему, которая отслеживает не только данные, но и «возраст» теории, количество её подтверждений и связей с другими знаниями. Когда новые данные достаточно сильны, система «понижает» статус теории, даже если она много раз пересказана.

Это напоминает механизмы научных революций, описанные Томасом Куном, но переведённые на язык алгоритмов. Вместо того чтобы ждать, пока теория окончательно рухнет, ИИ мог бы постепенно снижать её вес при накоплении аномалий. Однако здесь есть риск: если порог срабатывания слишком низкий, система будет постоянно менять убеждения, что сделает её ненадёжной.

Автор предлагает искать золотую середину, используя метрики вроде «уверенности» модели, но с поправкой на статус теории. Технически это можно реализовать через механизмы внимания или отдельные модули памяти, которые хранят не только факты, но и их «социальную силу». Пока это гипотеза, но эксперимент даёт способ её проверить.

Кого затронет: от разработчиков до учёных

Для разработчиков ИИ это означает новый вызов: научиться проектировать системы, которые не просто выдают ответы, но и умеют сомневаться в собственных знаниях. Это критично для автономных исследовательских агентов, которые будут работать в науке, медицине или финансах. Если такой агент застрянет на устаревшей модели, это приведёт к ошибкам с реальными последствиями.

Для научного сообщества эксперимент поднимает вопросы о том, как мы передаём знания следующим поколениям — и людям, и машинам. Возможно, нам стоит пересмотреть, как мы подаём теории в учебниках: как абсолютные истины или как временные конструкции. Это особенно актуально для России и СНГ, где научное образование часто опирается на авторитетные источники, и ИИ-системы, обученные на таких текстах, могут унаследовать этот консерватизм.

Для бизнеса, использующего ИИ для анализа данных, это предупреждение: не стоит полностью доверять выводам модели, если они основаны на устаревших предположениях. Нужны механизмы проверки и пересмотра, чтобы системы оставались актуальными.

Что будет дальше: от эксперимента к практике

Автор планирует опубликовать результаты эксперимента, и если гипотеза подтвердится, это откроет дорогу к разработке методов «обновления убеждений» для ИИ. Возможны два сценария: либо мы научимся программировать смену убеждений на уровне архитектуры, либо обнаружим, что это невозможно без переобучения, и тогда потребуются новые подходы к обучению.

В любом случае, тема выходит за рамки академической дискуссии. Уже сейчас компании вроде OpenAI и Google работают над тем, чтобы модели могли признавать свои ошибки и обновлять знания. Эксперимент на Habr — один из шагов в этом направлении, и он показывает, что даже небольшие изменения в подаче информации могут кардинально менять поведение ИИ.

Следить за этой темой стоит всем, кто работает с ИИ: от исследователей до инженеров. Умение системы отличать истину от авторитета — это не просто академический интерес, а необходимость для создания надёжных и безопасных ИИ.

Итог

Эксперимент на Habr предлагает измеримый способ проверить, как научный авторитет влияет на убеждения ИИ. Если гипотеза подтвердится, мы получим инструменты для программирования здорового скептицизма в исследовательских системах. Это важно не только для науки, но и для любой сферы, где ИИ принимает решения. Следите за результатами — они могут изменить то, как мы обучаем и используем искусственный интеллект.