SRD-GUARD: Защитная основа МЛМ через семантическое переписывание и совместное многотиповое царапинирование для латентного преднамеренного воздействия
arXiv: 2609.06540v1 Annualce Type: кросс-бюллетень: Большие языковые модели (LMS) все чаще используются в критических прикладных программах, но нападения на побеги могут скрыть вредное намерение посредством ролевых игр, выдуманных сценариев или кажущихся доброжелательными мотивациями. Существующая оборонная система может пропустить замаскированные нападения или чрезмерно отклонять законные просьбы. Мы предлагаем SRD-GARD, без параметров, оборонную систему с черной коробкой, которая раскрывает скрытое намерение посредством семантичной переписки и основанной на консенсусе оценки риска. С учетом быстрого ввода данных SRD-GUARD генерирует пять семантически связанных переписей, которые сохраняют лежащую в основе цель и при этом удаляют ненужную контекстуальную упаковку. Первоначальные оперативные и перезаписывающие данные совместно оцениваются несколькими независимыми счетчиками безопасности на основе LLM в постоянной шкале рисков. Модуль принятия решений сочетает абсолютные пороговые значения риска с относительными изменениями рисков между первоначальными и перезаписывающимися сигналами для адаптивного перехвата, сохранения или предупреждения на реквизитах