CausalDS: бенчмарк для оценки причинно-следственного мышления ИИ-агентов в науке о данных
Исследователи представили CausalDS — новый бенчмарк, предназначенный для оценки способности ИИ-агентов на основе больших языковых моделей (LLM) к причинно-следственному мышлению в контексте науки о данных. Этот бенчмарк объединяет задачи, охватывающие все три уровня причинности по Джуде Перлу: наблю

Исследователи представили CausalDS — новый бенчмарк, предназначенный для оценки способности ИИ-агентов на основе больших языковых моделей (LLM) к причинно-следственному мышлению в контексте науки о данных. Этот бенчмарк объединяет задачи, охватывающие все три уровня причинности по Джуде Перлу: наблюдение, вмешательство и контрфакты. В отличие от существующих тестов, CausalDS требует от модели не только рассуждений, но и написания кода для работы с реальными данными, что приближает оценку к практическим задачам.
Что такое CausalDS и как он устроен
CausalDS — это бенчмарк, специально разработанный для проверки причинно-следственного мышления у ИИ-агентов, работающих в области науки о данных. Каждый элемент бенчмарка представляет собой «сцену», которая включает структурную причинную модель (SCM) с сгенерированными наблюдательными данными и синтетическое повествование на естественном языке, основанное на реалистичном домене. Компоненты сцены могут быть согласованы с эмпирическими распределениями из реальных наборов данных, что снижает риск так называемого «каузального попугайничества», когда модель просто повторяет выученные шаблоны без истинного понимания причинности.
Какие уровни причинности охватывает бенчмарк?
Бенчмарк включает задачи, соответствующие всем трём уровням причинности по Перлу. Уровень 1 — наблюдение: модель должна предсказывать события на основе наблюдаемых данных. Уровень 2 — вмешательство: требуется оценить эффект от целенаправленного изменения переменной. Уровень 3 — контрфакты: модель должна рассуждать о том, что могло бы произойти при других обстоятельствах. Большинство задач включают компонент написания кода для анализа данных, так как данные часто содержат несовершенные наблюдения, генерируемые моделью наблюдений. Это делает бенчмарк более реалистичным по сравнению с абстрактными тестами.
Почему CausalDS важен для развития ИИ
Существующие бенчмарки для оценки причинно-следственного мышления либо фокусируются на абстрактном причинном выводе без реалистичной работы с данными, либо проверяют навыки анализа данных без учёта причинно-следственной структуры. CausalDS объединяет оба аспекта, а также вводит оценку умения модели воздерживаться от ответа, когда его невозможно дать с уверенностью. Это приближает оценку ИИ-агентов к реальным задачам в науке о данных, где неопределённость и неполнота данных — обычное дело.
Как бенчмарк оценивает отказ от ответа?
Отказ от ответа (abstention) рассматривается как полноценный результат с оценкой. Если модель не может сделать обоснованный вывод, она должна это указать, а не выдавать случайное или неверное заключение. Это важный аспект для практического применения, так как в реальных задачах данных часто недостаточно для уверенного причинно-следственного вывода.
Кого затронет появление CausalDS
Разработчики LLM и исследователи в области ИИ, работающие над агентными системами для науки о данных, получат новый инструмент для оценки своих моделей. Специалисты по причинно-следственному выводу смогут использовать бенчмарк для тестирования новых методов. Компании, внедряющие ИИ-агентов для анализа данных, смогут более объективно оценивать их способности. Бенчмарк также может стимулировать развитие моделей, которые не только хорошо рассуждают, но и умеют признавать свою неуверенность.
Что пока неизвестно о CausalDS
Результаты тестирования современных LLM на CausalDS пока не опубликованы. Также не раскрыты детали реализации генерации сцен и метрик оценки. Исследовательское сообщество ожидает дальнейших публикаций, которые покажут, насколько хорошо текущие модели справляются с задачами бенчмарка. Пока можно только предполагать, что CausalDS станет важным эталоном для оценки причинно-следственного мышления в ИИ.