Почему скалярное вознаграждение не учит мировые модели: одномерная проекция
Скалярный сигнал ценности, используемый при обучении мировых моделей, способен восстановить лишь одномерную проекцию структуры задачи. Это означает, что традиционный подход с одним вознаграждением может быть фундаментально недостаточным для сложных сред. Исследователи из arXiv в работе «The Rank-One

Скалярный сигнал ценности, используемый при обучении мировых моделей, способен восстановить лишь одномерную проекцию структуры задачи. Это означает, что традиционный подход с одним вознаграждением может быть фундаментально недостаточным для сложных сред. Исследователи из arXiv в работе «The Rank-One Corner: How Much Value Equivalence Does a Task Need from a World Model?» экспериментально доказали, что ограничение связано не с ёмкостью модели, а с размерностью целевой функции. Результаты ставят под сомнение эффективность многих современных алгоритмов обучения с подкреплением и указывают путь к более мощным многомерным сигналам.
Что показал эксперимент с DreamerV3
Учёные провели серию экспериментов в контролируемой среде с известным замыканием задачи — набором предиктивных координат, от которых зависят запросы агента. Они обучили стек DreamerV3 с различными целевыми функциями и измерили, насколько хорошо модель восстанавливает истинную структуру. При использовании скалярного сигнала ценности качество восстановления через линейный зонд составило лишь R²=0.10. Это практически нулевой результат: модель не улавливает многомерную природу задачи. Когда же целевую функцию заменили на полную многомерную, R² взлетел до 0.76. Разница колоссальна и напрямую указывает на размерностное ограничение.
Как размерность целевой функции влияет на предсказания
Исследователи варьировали размерность целевой функции от 1 до 4 и наблюдали чёткую закономерность: через вспомогательную голову модель устанавливала ровно столько же предиктивных направлений, сколько было в целевой функции. Аналогичная лестница прослеживалась и через собственную голову ценности модели, хотя и с меньшей амплитудой. Это подтверждает, что диссоциация носит размерностный, а не архитектурный характер. Контрольные эксперименты с выравниванием ёмкости и проверки in-situ исключили альтернативные объяснения, такие как недостаток параметров или особенности наблюдений.
Почему это меняет подход к обучению мировых моделей
Традиционно ценностная эквивалентность считалась бинарной характеристикой: либо модель её достигает, либо нет. Новое исследование показывает, что это размерностная характеристика. Скалярный сигнал ценности даёт лишь одномерную проекцию, что может быть достаточным для простых задач, но катастрофически мало для сложных сред с многомерной структурой. Результаты указывают на необходимость перехода к многомерным целевым функциям. Вместо одного вознаграждения агент должен получать вектор сигналов, каждый из которых отражает отдельное измерение задачи.
Кого затронут эти результаты
Разработчики алгоритмов обучения с подкреплением должны пересмотреть архитектуры мировых моделей. Инженеры, работающие с DreamerV3 и подобными системами, могут столкнуться с ограничениями при решении задач, требующих богатого представления структуры. Исследователи представления знаний в ИИ получают новый инструмент для анализа. Практические рекомендации уже сейчас: если задача имеет многомерную природу, используйте многомерную целевую функцию, а не одно вознаграждение.
Что остаётся неясным
Пока не известно, как оптимально выбирать размерность целевой функции для произвольной задачи. В сопутствующей задаче с замкнутым контуром, где структура наблюдаема покадрово, реконструкция устанавливает структуру, и скалярная цель оказывается достаточной. То есть закон действует в режиме, где более дешёвые обучающие сигналы не могут восстановить структуру. Требуется дальнейшее изучение границ применимости и разработка методов автоматического определения необходимой размерности.
Какие альтернативы скалярному вознаграждению существуют?
Один из подходов — использование многомерных сигналов ценности, например, вектора вознаграждений, где каждая компонента соответствует отдельной цели. Другой — обучение с подкреплением на основе задач, где сама задача определяет размерность. Также перспективны методы, комбинирующие несколько целевых функций с разными весами. Однако все эти подходы требуют дополнительных исследований и экспериментов.
Выводы
Ценностная эквивалентность в обучении мировых моделей — это не бинарное свойство, а размерностная характеристика. Скалярный сигнал ценности восстанавливает лишь одномерную проекцию задачи, что ограничивает возможности моделей. Для полного захвата структуры необходимы многомерные целевые функции. Результаты работы «The Rank-One Corner» открывают новое направление в разработке алгоритмов обучения с подкреплением и ставят вопросы о выборе оптимальной размерности.