Phasor Transformer: новая архитектура временных рядов с линейной сложностью и глобальным контекстом
Исследователи представили Phasor Transformer — новый блок для трансформеров, который моделирует последовательности на единичной окружности, достигая сложности O(N log N) вместо квадратичной. Эта архитектура может стать прорывом для задач с очень длинными временными рядами, где традиционное самовнима

Исследователи представили Phasor Transformer — новый блок для трансформеров, который моделирует последовательности на единичной окружности, достигая сложности O(N log N) вместо квадратичной. Эта архитектура может стать прорывом для задач с очень длинными временными рядами, где традиционное самовнимание слишком дорого. В основе подхода лежит использование обучаемых фазовых сдвигов и дискретного преобразования Фурье (DFT) для глобального смешивания токенов без явных карт внимания.
Как работает Phasor Transformer
Phasor Transformer заменяет механизм самовнимания на операции в частотной области. Каждый блок содержит легковесные обучаемые фазовые сдвиги, которые позволяют модели сдвигать сигнал во времени, и DFT-смешивание, реализуемое через быстрое преобразование Фурье. Это обеспечивает сложность O(N log N) — значительно быстрее, чем O(N²) у стандартного трансформера. При этом сохраняется глобальный контекст, так как преобразование Фурье учитывает все точки последовательности.
Почему это важно для временных рядов
Стандартное самовнимание имеет квадратичную сложность по длине последовательности, что делает его дорогим для длинных временных рядов. Phasor Transformer предлагает альтернативу, сохраняя глобальный контекст без явных карт внимания, что может быть критично для задач с очень длинными контекстами (например, финансы, климат, мониторинг). В таких областях длина временного ряда может достигать миллионов точек, и квадратичная сложность становится непреодолимым барьером.
Какие результаты показала модель Large Phasor Model
На основе Phasor Transformer построена модель Large Phasor Model (LPM), протестированная на синтетических мультичастотных временных рядах в задаче авторегрессионного прогнозирования. Модель превзошла нуль-параметрический baseline (персистентность) и показала монотонное улучшение с глубиной при скорректированном градиентном пути. При этом LPM остаётся конкурентоспособной, но не превосходит самовнимание при значительно меньшем числе параметров. Авторы описывают явный фронт эффективности-точности, показывая, что масштабируемое моделирование временных рядов в осцилляторных доменах возможно через геометрически ограниченные фазовые вычисления.
Какие преимущества дает работа на единичной окружности
Моделирование на единичной окружности (многообразие S¹) позволяет естественным образом кодировать периодические паттерны и фазовые соотношения. Это особенно полезно для временных рядов с сезонностью, циклами или осцилляциями. Фазовые сдвиги обучаются, что позволяет модели адаптироваться к различным временным масштабам. Такой подход может быть эффективнее, чем добавление позиционных кодировок или использование оконных функций.
Кого затронет эта разработка
Разработчиков моделей для временных рядов, особенно в областях с длинными последовательностями (финансы, метеорология, IoT). Исследователей, работающих над эффективными архитектурами трансформеров. Потенциально — инженеров, занимающихся оптимизацией вывода моделей на устройствах с ограниченными ресурсами, так как Phasor Transformer требует меньше памяти и вычислений.
Какие ограничения и нерешенные вопросы остаются
Неясно, как поведёт себя LPM на реальных (несинтетических) данных с шумом и нерегулярными паттернами. Также не проводилось сравнение с другими эффективными архитектурами, такими как линейное внимание или State Space Models (например, Mamba). Отсутствуют эксперименты на стандартных бенчмарках (например, Long Range Arena). Кроме того, не исследовано влияние фазовых сдвигов на сходимость и устойчивость обучения.
Что можно ожидать в будущем
Если Phasor Transformer подтвердит свою эффективность на реальных данных, он может стать основой для новых поколений моделей временных рядов. Возможны гибридные архитектуры, сочетающие фазовые блоки с традиционным самовниманием для коротких последовательностей. Также вероятно появление оптимизированных реализаций для GPU и TPU, что сделает модель доступной для широкого круга задач.