Сильные, но щекотливые: простые нападения
arXiv: 2510.11570v3 Тип уведомления: заменить перекрестное резюме: модели с открытым весом (МОД) приближаются к возможностям своих пограничных партнеров, но создают серьезные проблемы в плане безопасности, поскольку их трудно отрегулировать или контролировать после выпуска. Во избежание неправильного использования защитные ограждения, основанные на аргументации, в которых модели прямо обосновывают соображения безопасности перед ответом, стали перспективной первичной защитой и позволяют достичь почти идеальных показателей отказа при вредных запросах. Мы показываем, что эта сильная защита вызывает тревогу и может быть подорвана смущенно простыми нападениями для того, чтобы вызвать крайне запрещенные вопросы, такие как «Как убить человека без его задержания?», в частности мы выявляем одну систематическую уязвимость из механизма аргументации — тогдашнего ответа: логику поэтапного перехода, которая определяет когда рассуждения о безопасности начинаются и заканчиваются, можно легко манипулировать. На основе этого вывода мы разработали четыре простых, но эффективных метода " краснокожих команд > , которые систематически разрушают