SageMath повышает эффективность LLM-агентов в решении математических задач

В мире искусственного интеллекта математика всегда оставалась одним из самых сложных вызовов. Недавняя работа группы исследователей показала, что интеграция больших языковых моделей с системой компьютерной алгебры SageMath способна значительно повысить точность решения сложных математических задач.

SageMath повышает эффективность LLM-агентов в решении математических задач

В мире искусственного интеллекта математика всегда оставалась одним из самых сложных вызовов. Недавняя работа группы исследователей показала, что интеграция больших языковых моделей с системой компьютерной алгебры SageMath способна значительно повысить точность решения сложных математических задач. Разработанный агент использует подход ReAct (Reasoning and Acting), получая верифицированную обратную связь от SageMath и доступ к актуальной документации через инструмент Context7. Система была протестирована на улучшенной версии бенчмарка RealMath, что позволило объективно оценить её эффективность.

Как работает агент с SageMath

Предложенная архитектура объединяет языковую модель и среду компьютерной алгебры в единый цикл рассуждения и действия. LLM генерирует шаги решения, которые проверяются SageMath на корректность. Если результат неверен, агент получает обратную связь и корректирует подход. Дополнительно через Context7 модель может запрашивать свежую документацию SageMath, что особенно полезно для редких или сложных функций.

Такой подход позволяет избежать типичных ошибок LLM, связанных с арифметикой и алгебраическими преобразованиями. Вместо того чтобы полагаться на внутренние знания модели, агент использует SageMath как надёжный вычислительный движок, а языковая модель отвечает за стратегию и планирование.

Почему это важно для развития ИИ в математике

Ранее основное внимание в области ИИ для математики уделялось автоформализации и доказательству теорем. Использование компьютерной алгебры в агентных рабочих процессах LLM оставалось малоизученным. Данная работа демонстрирует, что интеграция CAS может значительно повысить производительность моделей, особенно для открытых весовых моделей, сокращая разрыв с закрытыми коммерческими системами.

Это открывает новые возможности для автоматизации математических исследований, где требуется не только логика, но и точные вычисления. Кроме того, подход может быть адаптирован для других научных дисциплин, где необходима символьная обработка.

Какие результаты показали эксперименты

В экспериментах оценивались несколько frontier-моделей, включая GPT-5.5, Qwen 3.7-Max и другие. Доступ к SageMath дал прирост в решении задач от 1,5 до 27,8 процентных пункта, в среднем +9,7 п.п. Наибольший выигрыш показала модель Qwen 3.7-Max. Наилучший абсолютный результат — 75,2% решённых задач — достигнут GPT-5.5, при этом у неё же оказалось наименьшее потребление токенов среди конфигураций с инструментами.

Исследователи также улучшили бенчмарк RealMath, добавив многошаговую постобработку и многоэтапный пайплайн валидации. Это позволило повысить качество и надёжность набора задач, что критически важно для объективного сравнения моделей.

Какие задачи решает SageMath лучше всего

Система показала наибольшую эффективность на задачах, требующих символьных вычислений: упрощение выражений, решение уравнений, работа с рядами и пределами. В то же время для задач, основанных на текстовом понимании или логических рассуждениях, прирост был менее значительным. Это объясняется тем, что SageMath специализируется именно на алгебраических операциях, а не на семантике.

Как это повлияет на сообщество открытых LLM

Для разработчиков открытых моделей это особенно важно, так как интеграция с SageMath позволяет существенно повысить точность без необходимости увеличивать размер модели. Например, Qwen 3.7-Max с SageMath превзошла результаты многих закрытых моделей без инструментов. Это снижает барьер для создания мощных математических ассистентов на базе открытых технологий.

Какие ограничения остаются

Неизвестно, как система поведёт себя на более широком спектре математических задач за пределами RealMath. Бенчмарк охватывает в основном университетский уровень, но не включает задачи исследовательского уровня, требующие открытия новых гипотез. Авторы называют автоматическое открытие гипотез следующей целью, но пока неясно, насколько эффективен будет текущий подход в этой области.

Какие перспективы у такого подхода

Интеграция LLM с системами компьютерной алгебры — лишь первый шаг. В будущем возможно подключение других специализированных инструментов: систем доказательства теорем (например, Lean), статистических пакетов или даже симуляторов. Это позволит создавать универсальных научных агентов, способных решать задачи из разных областей.

Кроме того, улучшение бенчмарка RealMath задаёт новый стандарт для оценки математических способностей ИИ. Многошаговая валидация и постобработка делают оценку более надёжной, что важно для дальнейших исследований.

Что это значит для математиков и разработчиков

Математики получают инструмент, который может автоматизировать рутинные вычисления и проверять сложные выкладки. Разработчики ИИ — готовую архитектуру для создания агентов, работающих с внешними инструментами. Сообщество открытых LLM — возможность конкурировать с закрытыми системами без огромных вычислительных затрат.

В конечном счёте, работа показывает, что гибридные системы, сочетающие языковые модели и специализированное ПО, могут превзойти чистые LLM в задачах, требующих точности. Это направление будет активно развиваться в ближайшие годы.