Оптимизация направления движения: послевыборная защита против уничтожения ЛМД
arXiv:2609.16204v1 Аннонс Тип: новое резюме: Охранники безопасности при использовании моделей языка с открытым весом могут быть легко обойдены в обход метода " Рефузал Феатур абблэйшн (RFA), который позволяет определить и проецировать направление линейного отказа из остаточного потока, часто достигая высокого показателя успеха атак (АСР) при сохранении потенциала модели. Защита от этих нападений обычно требует расчетно дорогостоящей корректировки безопасности на каждом новом контрольно-пропускном пункте. Мы введем оптимизацию направления движения (DDO), быструю, пост-специальную защиту от изменения веса, которая не требует корректировки базовой модели. Наш подход основан на простой механистической проницательности: аббатские нападения зависят от контрастных оценок, чтобы найти направление отказа. Вместо того, чтобы пытаться скрыть подлинное схему отказа, DDO активно вводит высокозначительный нелинейный приманочный сигнал в нейроны сети MLP. Когда нападавший пытается найти направление отказа, приманка портит их оценку и обманывает его в оболочку ч.