OpenEvoShield решает проблему защиты LLM-MAS в условиях двойной нестационарности. Это важно, потому что статические детекторы теряют эффективность при эволюции атак и нормального поведения.
В LLM-based multi-agent systems (LLM-MAS) атака редко выглядит как одиночный инцидент. Она распространяется через межагентную коммуникацию и меняется по мере адаптации злоумышленника. Система в этот момент тоже не статична: появляются новые агенты, инструменты, сценарии. Возникает двойной дрейф (dual non-stationarity): меняется распределение атак и одновременно смещается нормальное поведение. Статические фильтры и обученные детекторы предполагают фиксированное распределение. Как только это предположение нарушается, растут пропуски атак и ложные срабатывания (false positives).
Авторы предлагают OpenEvoShield — континуальную защиту с ко-эволюцией (continual defense). Ключевая идея — разделить скорости адаптации. Атаки требуют быстрых обновлений, нормальное поведение — медленной стабилизации. Это реализовано через асимметричный контроллер скоростей (M1), который оценивает два сигнала дрейфа и назначает разные learning rates: быстрый для attack-side и медленный для normal-side. Такой подход — компромисс между реактивностью и стабильностью. Без него система либо не успевает за атакой, либо начинает «паниковать», принимая нормальные изменения за аномалии.
Архитектура разбита на четыре модуля.
- M1 (rate controller) вычисляет drift-сигналы через KL divergence и семантические отклонения.
- M2 (normal-boundary updater) поддерживает динамическую границу нормального поведения через EMA и генеративную оценку траекторий.
- M3 (policy updater) быстро адаптирует ансамбль детекторов с регуляризацией EWC, чтобы избежать catastrophic forgetting.
- M4 (detector) объединяет сигналы на уровне узлов, подграфов и всего графа и использует energy-based OOD detection для неизвестных атак.
Реализация опирается на графовое представление коммуникаций (communication graph). Это важно: атаки в MAS часто проявляются не на уровне одного сообщения, а как паттерн взаимодействия. M4 агрегирует аномалии на нескольких масштабах, что позволяет ловить координированные атаки, которые ускользают от node-level методов. Дополнительно OOD-голова (out-of-distribution detection) классифицирует новые типы атак как UNKNOWN вместо ложного «нормально».
Отдельная инженерная проблема — забывание (forgetting). Быстрая адаптация к новым атакам перезаписывает старые знания. Здесь используется EWC (elastic weight consolidation), которая фиксирует важные параметры модели через Fisher information. Это снижает деградацию на ранее известных паттернах, но вводит trade-off: слишком сильная регуляризация замедляет адаптацию.
Эксперименты показывают поведение системы в динамике, а не только в статике. В стандартных условиях OpenEvoShield немного улучшает метрики по сравнению с сильными baseline (например, INFA-GUARD). Но ключевое различие проявляется при длительном деплое. В сценарии из 100 раундов с эволюцией атак статические методы резко деградируют. OpenEvoShield удерживает низкий Attack Success Rate и показывает высокий Novel Detection Rate (обнаружение новых атак). При этом false positive rate остаётся низким. Это указывает на корректную балансировку между адаптацией и стабильностью.
Интересный эффект — восстановление после инъекций. При появлении новой атаки система кратковременно теряет точность, но возвращается к исходному уровню за несколько раундов. Это результат связки M1 и M3: первый фиксирует дрейф, второй быстро переобучает детектор. Без явного drift-сигнала (как в naive continual подходах) система деградирует постепенно и не восстанавливается.
Есть и ограничения. Подход предполагает, что дрейф можно корректно измерить через выбранные метрики (KL и embedding similarity). В более хаотичных средах это может давать шум. Также добавляется вычислительная нагрузка: несколько моделей, графовые энкодеры, OOD-оценка. Для latency-sensitive систем это может быть критично.
В индустрии подобные подходы отражают общий сдвиг: защита AI-систем переходит от статических фильтров к адаптивным механизмам с online learning. OpenEvoShield — пример того, как эту идею можно реализовать на уровне архитектуры, а не только модели.
Источник информации
arXiv — крупнейший открытый репозиторий препринтов (с 1991 года, под эгидой Корнелла), где исследователи оперативно размещают рабочие версии статей; материалы общедоступны, но не проходят полное рецензирование, поэтому результаты следует считать предварительными и, по возможности, сверять с обновленными версиями или рецензируемыми журналами. arxiv.org