Мембрана: самодеятельная память о противоестественной безопасности для защиты агентов LLM
arXiv: 2606.05743v2 Тип уведомления: заменить перекрестное резюме: несмотря на достижения в области безопасности, крупные языковые модели по-прежнему уязвимы для постоянно возникающих тюремных расставаний. Существующие откорректированные классификации безопасности не могут адаптироваться к этим возникающим атакам, в то время как адаптивные ограждения на основе памяти имеют тенденцию к чрезмерному избежанию доброжелательных запросов, похожих на хранимые нападения. Мы предлагаем "Мембран" - саморегулирующийся ограждений, построенный на Contrasentive Safety Memory (CSM): каждая клетка сочетает условия блокировки вредного запроса с условиями для выдачи поверхностно похожих доброжелательных запросов. Без переподготовки Мембран эволюционирует в СЗМ, делая каждое вредное взаимодействие и его доброжелательный аналог контрастной клеткой, индексируемой основной стратегией нападения, так что одна ячейка обобщает тематические варианты одного и того же механизма. В заключение следует отметить, что извлеченные клетки служат основой для принятия точных решений по вопросам безопасности. На уровне модели безопасность на Хармбенче и уровень агентской безопасности на Агент-Харме, Мембран достигает