AcMAS: новый метод обнаружения скрытых атак в мультиагентных системах через анализ активаций
Исследователи разработали AcMAS (Activation-based framework for Malicious-behavior detection in Multi-Agent Systems) — инновационный подход к выявлению вредоносных действий в мультиагентных системах (MAS) на основе больших языковых моделей. В отличие от традиционных методов, которые анализируют толь

Исследователи разработали AcMAS (Activation-based framework for Malicious-behavior detection in Multi-Agent Systems) — инновационный подход к выявлению вредоносных действий в мультиагентных системах (MAS) на основе больших языковых моделей. В отличие от традиционных методов, которые анализируют только явные сообщения между агентами, AcMAS изучает внутренние состояния рассуждений в пространстве активаций нейронных сетей. Это позволяет обнаруживать даже самые скрытые атаки, которые не проявляются на уровне коммуникации.
Современные системы безопасности для MAS обычно полагаются на два ключевых допущения: атаки имеют явно выраженный семантический характер, а топология системы известна и статична. Однако реальные кибератаки становятся всё более изощрёнными и скрытыми, часто маскируясь под легитимные действия. Кроме того, выполнение задач в MAS часто происходит асинхронно, что делает традиционные графовые модели неэффективными — они не могут отследить временные сдвиги и сложные паттерны взаимодействия. AcMAS решает обе эти проблемы, работая без явного знания графа взаимодействий и сохраняя устойчивость к временным задержкам.
Как работает AcMAS
Метод основан на анализе активаций нейронных сетей локальных агентов. Каждый агент в MAS, как правило, использует большую языковую модель (LLM) для принятия решений. При обработке запросов активируются определённые нейроны, и паттерны этих активаций отражают внутренние рассуждения агента. AcMAS собирает данные об активациях со всех агентов и ищет аномалии, которые могут указывать на вредоносное поведение. Например, если агент внезапно начинает генерировать нехарактерные для него паттерны активаций, это может сигнализировать о компрометации.
В синхронных сценариях, когда все агенты работают в едином темпе, AcMAS достигает F1-меры 0.94, что значительно превосходит графовые методы с их 0.72. В асинхронных условиях, где временные метки сообщений различаются, преимущество становится ещё более впечатляющим: 0.93 против 0.38. Это означает, что AcMAS практически не теряет эффективности при переходе к асинхронной архитектуре, в то время как традиционные методы практически перестают работать.
Почему это важно для безопасности MAS
Мультиагентные системы всё чаще используются в критических областях: финансах, здравоохранении, автономных транспортных системах и промышленной автоматизации. Компрометация одного агента может привести к каскадным сбоям или утечке конфиденциальных данных. Существующие методы защиты, такие как мониторинг сообщений или проверка целостности кода, неэффективны против атак, которые маскируются под нормальное поведение. AcMAS предлагает принципиально иной уровень защиты — анализ внутреннего состояния модели, который невозможно подделать без изменения самой нейронной сети.
Кроме того, фреймворк позволяет не только обнаруживать атаки, но и восстанавливать работоспособность скомпрометированных агентов. Вместо изоляции или перезапуска AcMAS использует сигналы активации для коррекции поведения агента, возвращая его к нормальному функционированию. Это особенно ценно в системах, где простой недопустим, например, в автономных автомобилях или торговых роботах.
Какие атаки может обнаружить AcMAS
Метод протестирован на различных открытых LLM, включая LLaMA, и показывает устойчивость при изменении интенсивности атак и масштаба системы. AcMAS эффективен против широкого спектра угроз: от внедрения вредоносных инструкций до тонких манипуляций с выходами агента. Например, если злоумышленник пытается заставить агента передать конфиденциальные данные под видом обычного запроса, активации нейронов при обработке такого запроса будут отличаться от нормальных, что и обнаружит система.
Важно, что AcMAS не требует знания графа взаимодействий между агентами — он анализирует каждого агента индивидуально, что делает его применимым к динамическим и изменяющимся топологиям. Это особенно актуально для современных MAS, где агенты могут присоединяться и покидать систему в реальном времени.
Какие ограничения остаются
Несмотря на впечатляющие результаты, у AcMAS есть и неизвестные аспекты. Детальные вычислительные затраты при масштабировании на очень большие системы пока не раскрыты. Хотя анализ активаций менее ресурсоёмок, чем полный перебор графа, для систем с тысячами агентов может потребоваться значительная вычислительная мощность. Кроме того, остаётся открытым вопрос эффективности против атак, намеренно оптимизированных для обхода активационного анализа. Злоумышленники могут попытаться подобрать вредоносные запросы так, чтобы они вызывали паттерны активаций, неотличимые от нормальных. Исследователи признают, что это потенциальная точка уязвимости, требующая дальнейшего изучения.
Кому будет полезен AcMAS
Разработчики и исследователи в области безопасности мультиагентных систем получат новый мощный инструмент для защиты своих решений. Инженеры, создающие приложения на основе LLM-агентов в финансах, здравоохранении и автономных системах, смогут интегрировать AcMAS для повышения устойчивости к кибератакам. Бизнес, использующий MAS для автоматизации процессов, может снизить риски компрометации и избежать финансовых потерь от инцидентов безопасности.
Что пока неизвестно
Детали вычислительных затрат при масштабировании на очень большие системы, а также эффективность против атаки, намеренно оптимизированной для обхода активационного анализа, остаются предметом будущих исследований. Тем не менее, AcMAS уже сейчас представляет собой значительный шаг вперёд в области безопасности мультиагентных систем, предлагая принципиально новый подход к обнаружению скрытых угроз.