Новая функция вознаграждения на основе импульса улучшает управление светофорами с помощью ИИ
Исследователи разработали новый метод обучения систем управления светофорами, который использует глубокое обучение с подкреплением и функцию вознаграждения на основе импульса. Этот подход помогает снизить заторы и выбросы CO2, улучшая движение в городах. Традиционные системы управления светофорам

Исследователи разработали новый метод обучения систем управления светофорами, который использует глубокое обучение с подкреплением и функцию вознаграждения на основе импульса. Этот подход помогает снизить заторы и выбросы CO2, улучшая движение в городах.
Что такое функция вознаграждения на основе импульса?
Традиционные системы управления светофорами часто полагаются на штрафы за задержки или длину очереди, что может приводить к неоптимальным решениям. Новый метод, названный Momentum-Based Reward Function (MBRF), учитывает не только текущую загруженность перекрестка, но и тенденцию изменения плотности потока — так называемый «импульс». Это позволяет агенту DRL не просто минимизировать заторы, а поддерживать плавное движение транспортных средств. Импульс отражает ускорение или замедление потока, что дает системе возможность предвидеть изменения и реагировать на них проактивно.
Почему это важно для умных городов?
Городские пробки — одна из главных проблем современных мегаполисов. Они приводят к значительным выбросам CO2, потерям времени и снижению качества жизни. Существующие адаптивные системы управления светофорами часто используют короткозорые или нестабильные стратегии, которые не могут адаптироваться к быстро меняющимся условиям. Новый метод MBRF позволяет находить лучший баланс между пропускной способностью и экологичностью, что критично для развития «умных городов». Улучшение управления светофорами может снизить задержки на 10–20% и уменьшить выбросы на аналогичную величину.
Как MBRF сравнивается с другими методами?
Эксперименты проводились в симуляторе SUMO с использованием стандартных метрик: время ожидания, длина очереди, пропускная способность и выбросы CO2. Результаты показали, что MBRF превосходит классические алгоритмы, такие как Max Pressure и LQF, а также простые функции на основе задержки или очереди. Особенно заметно преимущество MBRF в стабильности обучения и в достижении компромисса между выбросами и пропускной способностью. В то время как другие методы могут приводить к колебаниям или застреванию в локальных оптимумах, MBRF демонстрирует более гладкую сходимость и лучшие долгосрочные результаты.
Детали исследования
Группа исследователей представила новый подход к обучению систем управления светофорами с помощью глубокого обучения с подкреплением (DRL). Вместо традиционных штрафов за задержки или длину очереди они предложили функцию вознаграждения, основанную на импульсе (MBRF), которая поощряет поддержание движения транспортных средств. MBRF оценивает не только текущую загруженность перекрёстка, но и тенденцию изменения плотности потока — «импульс». Это побуждает агента DRL не просто минимизировать заторы, а поддерживать плавное движение. Эксперименты проводились в симуляторе SUMO с использованием стандартных метрик: время ожидания, длина очереди, пропускная способность и выбросы CO2. Результаты показали, что MBRF превосходит классические алгоритмы (Max Pressure, LQF) и простые функции на основе задержки или очереди как по стабильности обучения, так и по компромиссу между выбросами и пропускной способностью.
Кого затронет эта технология?
Разработчиков систем управления дорожным движением, городские власти, компании, занимающиеся «умными» городами, и исследователей в области обучения с подкреплением. MBRF может быть интегрирована в существующие адаптивные системы управления светофорами, что позволит улучшить их эффективность без полной замены инфраструктуры. Городские планировщики смогут использовать этот метод для снижения заторов и улучшения экологической обстановки.
Что пока неизвестно?
Неясно, как метод поведёт себя в реальных условиях с несовершенными датчиками и в масштабах целого города. Также не исследовано влияние MBRF на пешеходов и велосипедистов. Будущие исследования должны проверить робастность алгоритма в условиях шума и задержек данных, а также учесть мультимодальные транспортные потоки.